LLM 관련 주요 논문 - 2026-08-07

1. Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering


2. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping


3. TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories


4. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization


5. QuanTiMedAI: Quantum-Enhanced Time-Series Model guided by Agentic AI for Cardiac Arrest Mortality Prediction


6. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models


7. TS-RAG: Retrieval Augmented Generation for Time Series Forecasting


8. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning


9. Comparative Approaches to Agent Retrieval over Large Skill Libraries


10. MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration


11. iARCS: Iterative Agentic RL for Controllable 3D Scene Generation


12. Contextual Information Policy Optimization for Search Agents


13. Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts


14. Mind the Gaps: Mixture-of-Minds for Human Simulation


15. ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment


16. Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents


17. Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Inference


18. From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models


19. Training a Conditioned Video Game Agent on a VLM Annotated Dataset


20. VLMs for Videogame Data Annotation


21. CourseGraph: Finding overlaps and differences in Computer Science courses across universities


22. Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?


23. ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion


24. Cautious Context Steering for Language Model Personalization


25. When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents


26. When Agentic AI Meets Integrated Sensing and Communication


27. ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution


28. Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay


29. Subliminal Learning is Non-Semantic Distillation


30. Unified Agent: Managing Interactions across Devices


31. RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation


32. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model


33. Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning


34. Measuring and Detecting Harmful AI Sycophancy


35. SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution


36. Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging


37. EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents


38. Recursive Synthesis for Long-Horizon Terminal Tasks


39. Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index


40. Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination


41. C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models


42. DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data


43. Counterfactual Analysis via Large Language Models


44. CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction


45. Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks


46. LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs


47. Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning


48. Coherence-Oriented Dream Scene Visualisation


49. TriQua: Reconciling Granularity and Context in Factuality Evaluation


50. Small Foundation Models of Human Cognition and Behaviour


51. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents


52. SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse


53. Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models


54. The Ignition Index: Measuring Global Workspace Dynamics in Language Models


55. Learning When to Trust via Selective Context Preference Optimization


56. AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games


57. Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data


58. Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents


59. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)


60. Visual Grounding in Zero-Shot Vision-Language Control


61. Learning Globally Reusable Skills for Coding Agents


62. Reducing belief in conspiracy theories as they unfold using large language models


63. Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture


64. Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers


65. Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case


66. FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India


67. ProDVI: Programmatic Dynamics Priors for Value Network Initialization


68. BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks


69. The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025


70. CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents


71. MACRO: Markov Chain Routing of Transformer Layers


72. MameLoshnLM: Yiddish Language Model and Evaluation Benchmark


73. Hierarchical Latent Prediction for Language Models


74. A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems


75. GROM: Gradient-Free Rapid One-Shot Machine Unlearning


76. UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on


77. Once a Response, Always a Response: Detecting LLM-generated Text via Latent Prompt Restoration


78. Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots


79. Answer First, Reason Later: Commitment Order in Diffusion LLMs


80. F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading


81. Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics


82. Relay, Don’t Route: Adaptive Population Handoff for Cost-Efficient LLM-Driven Evolution


83. SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries


84. The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions


85. When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems


86. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning


87. Learning Context-Free Grammars for Grammar-Constrained Decoding via Declarative Agentic Programming with Guarantees


88. Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation


89. Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents


90. Position: It’s Time to Optimize LLMs for Self-Consistency


91. Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap


92. Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios


93. Estimating time spent on work tasks


94. DREAM: LLM-based Dynamic Role-playing via Event-Aware Memory Graph


95. Large Language Models Threaten Double-blind Review


96. Beyond Sentiment: Comparing Traditional NLP and LLM-Based Multi-Dimensional Analysis for Political News Evaluation


97. Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability


98. Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models


99. Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support


100. HoloCount: A Holistic Visual Counting Benchmark for MLLMs