LLM 관련 주요 논문 - 2026-09-25

1. A Living Benchmark for Information Retrieval from Electronic Health Records


2. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance


3. Jev-Mobile: Jev as an Executor for Mobile GUI Agents



5. GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI


6. Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale


7. PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations


8. SciWalker: Synthesizing Scientific Coding Problems with Operator Graphs and Execution Feedback


9. Style, Not Self: Surface Cues Explain Zero-Shot Code Attribution by Large Language Models


10. How does Adversarial Influence Scale in Multi-Agent Systems?


11. Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark


12. Neuro-symbolic AI for Industrial Configuration


13. Who Holds the Pen? Let Specifications, Not Agents, Sign Off


14. Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents


15. Ontology-Mediated Neurosymbolic Constraint Acquisition from Multiple Stakeholders


16. When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression


17. Learning to Ideate for Scientific Impact


18. Hallucination Neurons and Where to Find Them: An Investigation into the existence of Hallucination Neurons


19. Breaking the Environment Wall: Evolving LLM Agent Environments for Recursive Self-Improvement


20. Fair Like Us? Auditing LLM Alignment in Resource Allocation


21. To Think or Not to Think: Allocating Reasoning Where It Helps


22. PartHackBench: Certified Equal-Progress Stress Tests for Partial-Credit Tool-Agent Evaluation


23. HiPACE: Hierarchical Phase-Boundary Analysis and Controlled Evaluation of Feature Absorption in Sparse Autoencoders


24. Stale Does Not Mean Unsafe: Guard Precision for Tool-Using LLM Agents under Infrastructure State Races


25. BiGraph-Diffuse: A Bidirectional Diffusion Language Model with Graph-Structured Retrieval For Mental Health Counseling


26. Delay-of-Gratification as a Multi-Agent Survival Micro-benchmark for Long-Horizon LLMs: Social Exposure, Personas, and Tool Use Budgets


27. Evaluation of Multi-Turn Consistency in LLM Agents: Survival Analysis and Failure-Rationale Taxonomy


28. SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories


29. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures


30. Epistemic-Probabilistic Model for Guarded Multi-Agent LLM Coordination


31. SkinAgent AI: A Safety-Grounded Multimodal Agentic Framework for Non-Diagnostic Skincare Support


32. Towards An LLM-Driven Unified Conversion Framework for BT and FSM in Autonomous Intelligent Systems


33. IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking


34. A Wrong Turn Does Not Ruin the Journey: Deviation-Guided Skill Self-Evolution for LLM Agents


35. CounterRoute: Self-Routed Reasoning via Hierarchical Counterfactual Credit Assignment


36. CRISS: A Retrieval-Augmented AI Chatbot for Assisting Cancer Registrars


37. From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents


38. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL


39. MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks


40. AlphaDiverse: Post-Training Local Quantitative Research Agents for Diverse Exploration in Alpha Factor Mining


41. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning


42. From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs


43. PFArena: Benchmarking Language Models for Protein Modification


44. Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents


45. Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation


46. RECLAIM: Can Agents Reproduce the Claims of Machine Learning Papers?


47. Agent Memory with Episodic Retrieval for Financial Decision-Making


48. Progressive Skill Discovery as Access Control for Tool-Using LLM Agents: Structural Governance through Role-Scoped Capability Delivery


49. Driving Epidemic Models with AI Agents: the Epydemix Agent Framework


50. Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents


51. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs


52. BaseCamp — An Agentic AI Framework for Automating DNA Sequencing Data Pipelines


53. Pistis Technical Report


54. TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split


55. When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing


56. LLM Agents Can Easily Tamper With Their Own Traces


57. Coding Agents for Generalized Task and Motion Planning Problems


58. To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech


59. Requirement-Bound Verified Commissioning: A Frozen Four-Billion-Parameter Local Model as a Candidate Generator under an External Acceptance Layer with Verification and Release Authority


60. Minimally Invasive Steering of Language Models


61. Instrumental Monitor Evasion Emerges Under Ordinary Task Pressure


62. Does a model’s stated reason for rejecting a candidate do any work?


63. R-DEIM Net: An Efficient Rationale-Augmented Dual-Expert Interaction Model for Paraphrase Detection


64. How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure


65. KernelOPT: Dispatch-Aware Agentic Search for GPU Kernel Optimization


66. Era by Eon: Benchmarking Enterprise Agents on Hidden Knowledge


67. Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits


68. Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases


69. Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation


70. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS


71. Guardrails or Roadblocks? Effects of Pedagogical Style and Context Awareness in AI Teaching Assistants for Programming


72. World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal


73. Beyond Average Safety: Chance-Constrained LLM Fine-tuning


74. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration


75. An Empirical Study of VLM Pipelines for Long-Document QA


76. Cultural Divergence Preservation: Diagnosing Flattening and Caricature in LLM-Simulated Survey Populations


77. Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs


78. Hard Stop: Kernel-Level Preemption and Containment for Rogue Agentic Execution



80. TimeBraid: Unifying Time Series and Language for Understanding and Forecasting


81. Prefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs


82. Decoupling Knowledge and Privacy: Post-Task Self-Distillation Replay for LLM Continual Learning


83. Graph, Loop, and Harness Engineering for Zero-Trust Agentic Data Engineering and Analytical Processing



85. An Exploratory Ablation of a Small MLA–SSM Hybrid Language Model


86. PROOF: Profiling Reliability of Object-Level Facts in Large Language Models


87. Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report


88. IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis


89. agentic-ger: terminology recovery in long-form speech using global context


90. Rufus-Air: An Open LLM Post-Training Recipe


91. From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring


92. Domain Recentering and Confidence-Weighted Prior Calibration for Vision-Language Models


93. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts


94. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams


95. Reasoning Instructions Can Break Answer Decoding in Vision–Language Models


96. Post-Training Leaves Behavioral Shadows on Unrelated Decisions


97. HarnessPAI: An Evolving Harness for Physical AI


98. Med-AR: Autoregressive Vision-Language Pretraining for Long-Tailed Chest X-Ray Classification and Uncertainty-Aware Evaluation


99. Tag-Aware Structured Text Translation: Towards a Systematic Understanding


100. Where Does Exactly-Once Live? Model, Harness, and Tool-Contract Effects on Duplicate Side Effects in LLM Agents


101. Design and Evaluation of LLM Chaining-Based Task Planning for General Purpose Service Robots


102. Beneath the Scores: Rethinking Hallucination Evaluation for Video Understanding Models


103. Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers for LLM-Driven Pentest Agents


104. On the Effectiveness of Kernel-Level Evidence for Agent Security


105. Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs


106. Blockchain-Enabled Artificial Intelligence and AI Agents for Secure Data Sharing and Cybersecurity Applications


107. A Harness for Synthesizing Diverse Naturalistic Full-Duplex Conversations


108. DrGait: Biomechanically Grounded Visual Reasoning for Interpretable Clinical Gait Analysis


109. Technical Manual for Toolkit for Confidence-Corpus Consistency via Fine-Tuning on a Fabricated Corpus


110. The Fellowship of the Query: Learning Retrieval Actions


111. Learning to Discover Interesting Mathematics


112. NumericJev: Jev-like LLM Numerical Decoding with Multiway Decision Trees


113. Persistent Billable State: Denial-of-Wallet Attacks and Defenses in Tool-Calling LLM Agents


114. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents


115. Speculative Evaluation of Stochastic LLMs


116. Who Is Behind the Harness? Fingerprinting LLMs through Agentic Behavior