LLM 관련 주요 논문 - 2026-08-25

1. Prime Agent: A Self-Improving RLM Harness


2. Mitigating Reasoning-Induced Misalignment via Safety-Direction Penalty


3. SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning


4. Multi-Modal Semantic Expansion with Constrained LLM Reranking for Conversational Music Recommendation


5. StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models


6. Walking on the DARKSIDE


7. EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models


8. Apodex 1.1: Scaling Agentic Intelligence for Complex Work


9. Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance


10. Automated Construction of FAIR Digital Object Knowledge Graphs from Flat Cultural Heritage Records


11. POOL: Propagated Uncertainty Over Lookalikes


12. AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models


13. Improving O-RADS Risk Stratification from Ultrasound Reports: A Comparative Evaluation of Hybrid versus End-to-End LLM Reasoning Strategies


14. LLM-based Agents for Forecasting and Prediction: Methods, Training, Evaluation, and Applications


15. From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation


16. AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces


17. MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks


18. PsychJail: Exploring Psychological Jailbreaks via Multi-Turn Persuasion of LLM Policies


19. Toward Effective and Reliable LLM Agents via Dynamic Ontology


20. Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents


21. Proxy reliance in large language model decisions is uncalibrated to predictive evidence


22. Your AI, On a Dial: Controlling Investment Bias in LLMs with a Single Neuron


23. GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis


24. FinixDoc: Rethinking Financial Document Parsing Beyond Saturated Benchmarks


25. Performance of a domain-specific large language model in answering patient questions in psychiatry


26. TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts


27. The Retriever Should Remember: Experience-Amortized Reranking for Long-Term Agent Memory


28. Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models


29. The Compaction Cliff in Long-Running AI Agent Memory


30. LLM-Based Selection of Incongruent Verbal and Nonverbal Behavior for Virtual Humans


31. CacheRouter: A Dual-Path Tool Routing Architecture with Cache-Preserving Main-Model Isolation for Long-Tail Tool Discovery


32. Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf


33. CAI-DLLM: Convergence Aware Inference for Diffusion Language Models


34. DeepSAGE: Stage-Aware Reinforcement Learning for Structured CBT Counseling Dialogue


35. Coalition-Aware Skill Reliability for Self-Evolving Agents


36. ExecRubrics: Executable Tool-Augmented Rubrics for Verifiable and Efficient Long-Form Evaluation


37. Small Reasoning Models are Instruction Followers in Function Calling


38. When Persona Simulations Are Informative: Graph-Structured Signals for Pluralistic Opinion Sensing


39. Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding


40. LLMs for Survey Text Analysis - A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis


41. Analyzing and Mitigating Cross-Lingual Degradation in Multilingual Medical VQA


42. Addressing the Selection Problem in Explainable AI


43. Where Cognition Lives: Dissecting Emergent from Computed Function in a Minimal Complete Cognitive Architecture


44. Clarify User Expertise: Towards Proactive Conversational Agents Tailoring Responses to User Proficiency


45. Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models


46. Query-Driven Multimodal Information Extraction from Long Documents


47. Role-Specialized Mixture-of-Agents with Open-Weight LLMs for Clinical Prediction


48. MCP-Universe RL: A Framework for Training MCP Tool-Use Agents via Reinforcement Learning


49. Evaluation of Small Vision-Language Models on Qualitative Mechanical Problems


50. Measuring Stability and Failure Behavior in Language Models Under Structured Perturbations


51. MegaMem: A Retrieval Solution for Ultra-Large Context Windows


52. Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning


53. Development and Feasibility Evaluation of an Edge AI as Medical Device System for Breast Cancer Multidisciplinary Team Meetings


54. Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks


55. Dissecting Neuro-Symbolic Quality Assurance for Synthetic Oncology Data Generation


56. Decision-Support and Modeling with Large Language Models for Geothermal Well Arrays


57. From SQL Generation to Tool Selection: A Domain-Oriented Pattern for MCP Servers


58. More Accurate or More Efficient? Evaluating Locally Deployed Compact Open-Weight Language Models for Mathematical Reasoning


59. SPAR-Hate: An Auditor-Guided Multi-Agent Framework for Bilingual Hate Speech Parsing


60. DynaContext: Self-Improving Dynamic Contextualization of Optimized Prompts for Heterogeneous Parameter Extraction


61. Redteaming Leading Arabic LLMs with ASAS


62. Closed-loop AI achieves certifiable engineering design


63. Repo2Skill-Evo: Repository Skills Go Stale in Silence


64. GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI


65. Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning


66. From Solver Feedback to Faithful Plans: Multi-Role Reinforcement Learning for Symbolic Planning


67. HiMA-MDD: A Hierarchical Multi-Agent Harness for Interpretable Multimodal Depression Detection in Clinical Interviews


68. MemGuard: Persisting Verifier Signals for LLM-Agent Memory Governance


69. LLM4LLM: Bridging Kernel Benchmarks and Real Deployment via Closed-Loop Agentic Optimization


70. GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?


71. Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents


72. HIRA: A Human-in-the-Loop Retrieval-Augmented Cascade for Document Classification in Regulated Industries


73. ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling


74. From Association to Causation: Improving Retrieval Precision of Retrieval-Augmented Generation via Causal Relations and an Attention Mechanism


75. Context as an Environment: Programmatic Context Management for Long-Horizon Agents


76. From Mastery Profile to Simulated Response: Stochastic Student Knowledge Graphs (SSKG) for Faithful LLM Student Simulation


77. Measuring Activation Control in Large Language Models


78. SAEM: Stage-Aware Expert Management for Memory-Efficient MoE Inference in Chain-of-Thought Reasoning


79. Semantic Compression Trees: Multi-Resolution Knowledge Retrieval via Hierarchical Semantic Residuals


80. Data-Driven Dynamic Algorithm Dispatch with Large Language Models


81. A Reproducible, License-Aware Distillation Recipe for CPUDeployable Safety Classification


82. Let Credit Follow Computation: Architecture-Aware Credit Transport for Large Language Model Reinforcement Learning


83. Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities



85. Retrieval-grounded robot program generation and simulation-based correction via Model Context Protocol


86. Spyre-Accelerated Retrieval-Augmented Generation on IBM LinuxONE: A Cloud-Native Architecture for Secure, High-Throughput Enterprise AI Inference


87. There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items


88. RIACT: A Responsible AI System for Personalized Study Habit Tracking and Early Burnout Signal Detection in University Students


89. SchemaRouter: Field-Aware Tool Routing for Efficient Heterogeneous Agentic RAG


90. LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform


91. KVBoost: Chunk-Level Key-Value Cache Reuse with Deviation-Guided Recomputation for Efficient Large Language Model Inference


92. How to Train a Critic Stably and Efficiently


93. EG-ARSA: An Expert-Grounded Open Model for Visual Road Safety Auditing in Low-Resource Settings


94. ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings


95. The Interaction Tax: When Communication Erases Diversity in Multi-Agent Teams


96. What’s the Catch? Evaluating Temporal Consistency in Vision-Language Models


97. InjecMEM: Memory Injection Attack on LLM Agent Memory Systems


98. Right-Sizing LLM-Agent Decomposition in VAT Determination: A Pilot Controlled Sweep


99. Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data


100. Adversarial Entropy Inflation Against Gumbel-Based Inference Verification


101. FIDES: A Concordance Protocol for LLM-Generated Trading Strategies


102. Sigmoid Attention as a Better Substrate for Learned KV Cache Eviction


103. E2S-Pruner: Progressive Two-Stage Evidence Fusion for Visual Token Pruning in Vision-Language Models


104. Future Querying: Can LLMs Serve as Implicit Medical World Models?


105. Credal Large Language Models for Semantic Commitment under Uncertainty


106. NetConfArena: An Executable Benchmark for LLM Agents in Closed-Loop Network Configuration


107. Language Chain in Alignment: Cross-Lingual Ranking Preference Optimization


108. Molecular LLM Agents: From Architectural Design to Scientific Autonomy


109. Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia


110. Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking


111. Beyond Surface Cues: Disentangling Sociocultural Signals in Multilingual LLMs


112. Unlearning Is Not Just Erasing: Temporal Decoupling via Generation Inequality


113. SplitLite: Low-Rank Residual Compression for Split Learning


114. A Physical Response-and-Memory Model for Muon Optimization


115. What Proves You Wrong: Benchmarking Language Models on Falsifiable Research Ideation


116. Do Spoken Language Models Hear Speech as They Read Text? Bridging Structural Gaps Between Speech and Text


117. AraDetox: A Multi-Dialect Arabic Detoxification Dataset


118. Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning


119. Minimal Local Simulation Foundations for LLM- and VLM-Driven Agents in 2D and 3D Environments


120. SDoH-Aware Narrative Anchoring Bias in Medical LLMs for Trustworthy Clinical Decision Support


121. TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents


122. Don’t Repeat Yourself: Stopping Verbatim Loops at Sampling Time


123. XTC: Head-Aware Sampling by Excluding Top Choices


124. Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation


125. DiaRelay: Relaying Dialogue Context with a Constant-Size Memory for Emotion Recognition in Conversation


126. Enrich-Retrieve-Rank: Scaling Capability Discovery Beyond In-Context Routing


127. Evaluating Inference-Time Defenses Against Package Hallucination in LLM-Generated Code


128. GeoRisk-RAG: A Hierarchy-Aware Risk Framework for Improving RAG Reliability through Selective Answering


129. Teaching LLMs How ICU Physicians Approach Clinical Reasoning Through OMOP-Aligned Retrieval Improves Reasoning Across Clinical Domains


130. Vision-Language Models for Occupational Physical Exposure Assessment: Estimating External Hand Forces in Manual Material Handling Tasks from RGB Video


131. Hybrid Panels: Toward Human-AI Collaboration in Survey Research


132. BLADE: Bilevel Low-rank Augmented-Lagrangian Erasure for LLM Unlearning


133. Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator


134. Pre-Decoding Acoustic Triage for Budgeted Vision-Language Captioning of Untrimmed Egocentric Video


135. Register Shifts Break LLM Safety: A Bengali Benchmark with Culturally Grounded Harms


136. LLM Evaluation on Unseen Questions: Contextual Multidimensional IRT Model


137. OVIBench: Benchmarking Online Video Question Answering under Interruption


138. Length-Adaptive Decoding for Masked Diffusion Machine Translation


139. Training-Free VLM Personalization via Calibrated Residual Decoding


140. Improving Few-Step Language Flows with Untied Self-Conditioning


141. Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints


142. Lexical Perturbations Disrupt LLM Reasoning: An Empirical Study of Attention Diversion


143. Semantic Reasoning Denoising: Correcting Language Model Reasoning with Semantic Operators


144. On Predicting Vulnerability Severity Using In-Context Learning: An Industrial Case Study


145. Real-TurnTurk: A Multimodal Turkish Corpus for Turn-Taking Prediction


146. NoTB: Oracle-Free Triage of LLM-Generated RTL via Cross-Model Formal Consensus


147. EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning


148. Bi-EZP: LLM-Guided Bilevel Program Evolution for Ensemble Zero-Cost Proxy Discovery


149. Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks


150. BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications


151. HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning


152. ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning


153. PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models


154. SAFE-G: Structure-aware Faithful Evidence-guided Generation for Knowledge-based Visual Question Answering


155. Evaluation Awareness in Language Models: Representation, Verbalization, and Control


156. Architecture as Capability Equalizer for Coding Agents


157. SynEHR: Joint Modeling Inter-visit Temporal Evolution and Intra-visit Clinical Structure for Longitudinal EHR Synthesis


158. Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning


159. Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents



161. SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation


162. TASSO: TAsk-Specific Subspace Optimization for Continual Learning of Vision-Language Models


163. CyrillicQA: The Influence of Phonetically Encoded Secret Language on LLM Performance


164. FigmaTrace: Capturing Creative Nuances in Human Figma Design Workflows


165. Agentic Security: A Systematization of Tools, Failure Modes, and Design Laws for LLM-Driven Penetration Testing


166. Mitigating Bias in Large Vision-Language Models via Counterfactual Ensemble Decoding



168. Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models


169. On the Role of Citations in Preference Data


170. Wazobia Eval: A Benchmark for Nigerian Pidgin Emotion Understanding, Sarcasm Detection, and Cultural Reasoning



172. Small Language Model enabled Autonomous agent for Language-Conditioned Cognitive Radar