LLM 관련 주요 논문 - 2026-06-30

1. Self-Evolving World Models for LLM Agent Planning


2. DOPD: Dual On-policy Distillation


3. Linguistic Firewall: Geometry as Defense in Multi-Agent Systems Routing


4. The FIL Hypothesis: Inductive Biases Help with Kernel Engineering


5. Whose Side Is Your Agent On? Multi-Party Principal Loyalty in LLM Agents


6. Using Large Language Models as Low-Cost Statistical Estimators for Human-Response Data


7. BayesEvolve: Explicit Belief States for Autonomous Scientific Discovery


8. ManimAgent: Self-Evolving Multimodal Agents for Visual Education


9. PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning


10. EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures


11. Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents


12. Does Verbose Chain-of-Thought Really Help? In-Distribution Evidence that Content, Not Length, Matters


13. Open Problems in Constitutional Preference Reconstruction


14. Structural Certification for Reliable Physical Design with Language Models


15. AlgoSkill: Learning to Design Algorithms by Scheduling Human-Like Skills


16. Be Faithful When Response: Returning Fluent and Grounded Answers for Vision-Language Models Reinforcement Learning


17. SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning


18. HippoSpark: An On-Demand Experience System for LLM Reasoning


19. AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes


20. The CRISTAL Method: Neurosymbolic analysis from AI-synthesized world models


21. CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents


22. DeepTrans Studio: Turning Expert Interventions into Shared Team Knowledge in Agentic Translation Workflows


23. Toward Secure and Reliable PDDL Formalization of Large Language Models with Planner-in-the-Loop Feedback


24. Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds


25. SCARCE: Scalable Cascade Analysis for Rare-event Characterisation via Embeddings


26. Cognitive World Models for Process-Level Social Influence Evaluation


27. Faults in Our Formal Benchmarking: Dataset Defects and Evaluation Failures in Lean Theorem Proving


28. FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models


29. LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents


30. Diagnosing and Repairing Factual Errors in RAG under Budget Constraints


31. When LLMs Develop Languages: Symbolic Communication for Efficient Multi-Agent Reasoning


32. Hierarchical Experimentalist Agents


33. Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners


34. When Summaries Distort Decisions: Information Fidelity in LLM-Compressed Financial Analysis


35. PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents


36. AI Trading’s Alpha Singularity: Emergent Market Reasoning through Agent-to-Agent Self-Evolution


37. Evidence-Informed LLM Beliefs for Continual Scientific Discovery


38. Selective Memory Retention for Long-Horizon LLM Agents


39. Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem


40. Low-cost concept-based localized explanations: How far can we get with training-free approaches?


41. Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering


42. Preventing Error Propagation in Multi-Agent AI through Runtime Monitoring


43. Customized Generative AI Agent for Transportation Engineering Practice: A Development and Continued Pre-training Guideline


44. Expert Evaluation of Clinical AI Tools on Real Point-of-Care Clinical Queries


45. Primary ICD Category Prediction using LLM-based Probing


46. Mechanistic Personality Analysis of LLMs Steering Personality via Latent Feature Interventions


47. Self-Supervised Theorem Discovery in a Formal Axiomatic System


48. Agent Safety Is Action Alignment


49. Agentic Abstention: Do Agents Know When to Stop Instead of Act?


50. ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models


51. BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards


52. An AI agent for treatment reasoning over a biomedical tool universe


53. Aristotelian Virtue Profiling of LLMs through Ethical Dilemmas


54. Search for Truth from Reasoning: A Dynamic Representation Editing Framework for Steering LLM Trajectories


55. IMCBench: A benchmark for multimodal LLMs in Image-grounded Medical Conversations


56. Data and Evaluation Closed-Loop for Model Capability Enhancement


57. Recursive Self-Evolving Agents via Held-Out Selection


58. LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training


59. GROW$^2$: Grounding Which and Where for Robot Tool Use


60. C$^{2}$R: Cross-sample Consistency Regularization Mitigates Feature Splitting and Absorption in Sparse Autoencoders


61. Words Speak Louder Than Code: Investigating Cognitive Heuristics in LLM-Based Code Vulnerability Detection


62. TraceLab: Characterizing Coding Agent Workloads for LLM Serving


63. On the Faithfulness of Post-Hoc Concept Bottleneck Models


64. Situation Perception: A Necessary Primitive to Artificial Superintelligence


65. COHORT: Collaborative Orchestration for Hardening via Offensive Replay on Emulated Topologies


66. Field Order Should Not Matter: Permutation-Invariant Embedding Model Fine-Tuning for Structured Metadata Retrieval


67. Collective cooperation without individual fidelity in LLM agents


68. Translating Natural Language to Strategic Temporal Specifications via LLMs


69. Can LLMs Rank? A Tale of Triads and Triage


70. DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training


71. MCP Server Architecture Patterns for LLM-Integrated Applications


72. Research Entity Extraction and Topic Detection from UKRI Grant Proposals


73. Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation


74. Estimating Grammatical Gender Directions in Contextual Embeddings under Controlled and Natural Contexts


75. SA-VLA: State-aware tokenizer for improving Vision-Language-Action Models’ performance


76. Online Data Selection for Instruction Tuning via Gaussian Processes


77. Little Brains, Big Feats: Exploring Compact Language Models


78. MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs


79. RiverONE: Generating Knowledge-Intensive VLM by Simulated Quantum Machines


80. DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation


81. SWE-Together: Evaluating Coding Agents in Interactive User Sessions


82. SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows


83. LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion


84. SABER-Math: Automated Benchmark for Information Retrieval Evaluation in Mathematics


85. LWDrive: Layer-Wise World-Model-Guided Vision-Language Model Planning for Autonomous Driving


86. Clinical Reasoning Graphs: Structured Evaluation of LLM Diagnostic Reasoning Reveals Competence Without Consistency


87. ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation


88. MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers


89. Neural Procedural Memory: Empowering LLM Agents with Implicit Activation Steering


90. Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework


91. Mandol: An Agglomerative Agent Memory System for Long-Term Conversations


92. Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent


93. TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging


94. PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF


95. Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies



97. Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop


98. SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution


99. A Machine-Verified Proof of a Quantum-Optimization Conjecture


100. Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature


101. Fuzzing Large Language Models to Elicit Hidden Behaviours


102. Two-Stage Prompt Optimization for Few-Shot Relation Extraction: From Reasoning-Guided Search to Gradient-Guided Refinement


103. Do We Still Need Fine Tuning? Turkish Sentiment Analysis in the Era of Large Language Model


104. Mechanistically Eliciting Latent Behaviors in Language Models


105. The Joint Effect of Quantization and Sampling Temperature on LLM Safety Alignment: A Factorial Analysis


106. ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models


107. Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM


108. VISTA-DZ: Visual Semantic Trajectory Adaptation for Personalized Dilemma Zone Prediction


109. Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era


110. SemJoin: Semantic Join Optimization


111. SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models


112. The Verbose Context Problem in Medical Records


113. Reported Confidence in LLMs Tracks Commitment More Than Correctness


114. To Reason or to Fabricate: Reasoning Without Shortcuts via Hint-Anchored Pairwise Aggregation


115. Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation


116. Interpretable Inverse Design of Metal-Organic Frameworks with Large Language Model Agents


117. Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction


118. Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense


119. LLMography: Transforming Human-AI Conversations into Traceability, Oversight, and Auditability Indicators


120. LC-ICL: Label-Guided Contrastive In-Context Learning for Robust Information Extraction


121. Solver-Verified Formulation Generation and Selection for Multi-Warehouse Inventory Allocation Using Large Language Models


122. Dynamic Parsing and Updating Natural Language Specification using VLMs for Robust Vision-Language Tracking


123. Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs


124. Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning


125. Manufactured Confidence: How Memory Consolidation Turns Hearsay into Confident Facts


126. A Hybrid Framework for Song Lyric Annotation Based on Human-LLM Alignment


127. A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis


128. Invariant Reasoning Directions in Latent Trajectories of Language Models


129. On the Nonlinearity of Learning Rate Scaling for LLM Training


130. How Anthropomorphic Language Impacts Public Perceptions of AI


131. LLM Semantic Signaling Game and Mechanism Design: Systematic Blindness, Awareness Shaping, and Mindset Dynamics


132. Statistically Indistinguishable, Operationally Distinct: A Formal Barrier for Tabular Foundation Models


133. AB-RAG: Adaptive Budgeted Retrieval-Augmented Generation for Reliable Question Answering


134. Diff-Based Code Corruption using LLMs for Large-Scale Bugfix Benchmarking


135. The strength of clinical evidence is recoverable from language model representations but not from their stated grades


136. How to Leverage Synthetic Speech for LLM-Based ASR Systems?


137. Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification


138. Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation


139. Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B


140. DLR: Zero-Inference-Cost Latent Residuals for Low-Rank Pre-Training


141. Multi-Agent Routing as Set-Valued Prediction: A WildChat Benchmark and Cost-Aware Evaluation


142. Latent Bridges for Multi-Table Question Answering


143. A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation


144. Exploring the Value of Diverse LLM Explanations in Introductory Programming


145. The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning


146. LAMP: Lean-based Agentic framework with MCP and Proof Repair


147. HARD-KV: Head-Adaptive Regularization for Decoding-time KV Compression


148. Categorizing Mathematical Concepts with LLM Voting Ensembles in Mathswitch


149. Four Types of LLM Reliance and Their Predictors Among Undergraduate Writers: A Mixed-Methods Study at a Minority-Serving R1 University


150. 5ting at SemEval-2026 Task 8: Strong End-to-End Multi-Turn RAG via LLM-Based Reranking and Faithfulness Control


151. CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation


152. Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks


153. Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare


154. When More Sampling Hurts: The Modal Ceiling and Correlation Ceiling of Test-Time Scaling


155. RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots


156. What LLMs explain is not what they believe: Evaluating explanation sufficiency under models’ own input beliefs


157. Database Context Compression for Text-to-SQL on Real-World Large Databases


158. Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation


159. Correct codes for the wrong reasons? validating LLMs as measurement instruments for theoretical constructs


160. Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG


161. KernelSight-LM: A Kernel-Level LLM Inference Simulator


162. CMSL: Constructive Multi-Sequence Learning for Recommendation Systems


163. TUA-Bench: A Benchmark for General-Purpose Terminal-Use Agents


164. Decomposing Memorization Reduction in Privacy-Preserving Fine-Tuning of SLMs for CSIRTs


165. An Agentic AI Pipeline for Appliance-Level Energy Anomaly Detection and LLM-Driven Recommendations


166. Is Lying an Emergent Behaviour in LLMs? Evidence from Gaslighting AI agents in a Sustainability Game


167. LLM agents security duality: a comprehensive survey of self-security and empowered cybersecurity


168. LoRA-Tuned Large Language Models for Dementia Detection via Multi-View Speech-Derived Features


169. When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs


170. Spectral Perturbation of the Empirical Fisher Information Matrix under Weight Quantization


171. Building to the Test: Coding Agents Deliver What You Check, Not What You Requested


172. Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems


173. Evidence-Driven LLM Agent for C-to-Synthesizable-C Conversion and Verification


174. RADIANT-PET: Reasoning-Augmented PET/CT Lesion Segmentation with Large Language Models and Reinforcement Learning


175. Data Provenance for Image Auto-Regressive Generation


176. RoboGaze: Evaluating Robot World Models via Structured Vision-Language Analysis


177. When Does Overlap Help? OSU-Mem and a Cell-Conditional Analysis of Trajectory Memory for LLM Agents


178. Conversational Query Engine for Mixed-Modality Heterogeneous Enterprise Data Sources


179. Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models


180. meta-pipe: An LLM-agent pipeline for end-to-end automated systematic review and meta-analysis


181. LUMEN: Cost-Transparent Multi-Agent Pipeline for Automated Systematic Review and Meta-Analysis


182. ConCise: Training-Free Conclusion-Chain State Compression for Cost-Efficient Multi-Step RAG Services


183. Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance


184. How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation


185. From Regulatory Approvals to Patents: Cross-Domain Linking for Cardiovascular Device Traceability


186. Auditing LLM-Governed Social Robots with Culture-Specific Moral Gradients


187. PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation


188. HyBIRD: Hyperbolic Bridge Retrieval and Diagnosis for Methodology Inspiration Retrieval


189. LLM-Ideoplasticity: Measuring Ideological Plasticity in the Political Behavior of LLMs as a Context-Conditioned Distribution


190. Insidious by Design: Implications of Large Language Model algorithmic bias for the Global South


191. When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries


192. ADEPT: An Entropy-Driven Dual-Strategy Agent for Interactive Video Retrieval


193. Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task