LLM 관련 주요 논문 - 2026-07-14

1. Playful AI in Professional Email: A Field Experiment on Tone and Recipient Engagement


2. Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction


3. Reproducing human biases in route choice using large language models: Toward scalable behavioral modeling


4. Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns


5. Interaction Scaling: Grounding the Third Axis of Test-Time Compute


6. MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models


7. HCRMap: Pressure-Aware Hot-Expert Residency Mapping for 3.5D MoE Chiplet Inference


8. The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning


9. StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure


10. OpsMem: Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis


11. Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents


12. AutoVSR: Automatic Visual-to-Symbolic Reasoning for Symbolic Expression Generation from Circuit Schematic


13. Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation


14. Valid $\ne$ Necessary: Diagnosing Latent Inefficiency in Chain-of-Thought


15. Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory


16. What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities


17. The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy


18. The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation


19. NextFund: A Unified Performance Tracking Platform for Agentic Portfolio Management


20. A Formal Hierarchical Architecture for Agentic Orchestration with Stack-Based Execution and Lazy Discovery


21. OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping


22. AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation


23. From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth


24. SETA: Scaling Environments for Terminal Agents


25. Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health


26. STEC: Evidence Compression for Deep Search in Open-domain Multi-Hop QA


27. Imaging-101: Benchmarking LLM Coding Agents on Scientific Computational Imaging


28. Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems


29. Filtering Harmful Actions Isn’t Enough: Phantom Transfer in Agentic SDF


30. WattCouncil: Context-Aware Household Energy Scenario Generation With Governed LLMs


31. Embark Now: User Demand Oriented Framework for Multi-day Urban Travel Itinerary Planning


32. Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories


33. Constraint-Aware Hierarchical Search for Regulation-Driven Fine-Grained Classification


34. Laguerre Geometry for Interpreting Large Language Models


35. CRiT-QA: Evaluating Multi-hop Reasoning with Counterfactual Chains and Distractor Traps


36. Large language model agents accelerate inverse design of metal-organic frameworks for gas separation


37. Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach


38. GRASP: GRanularity-Aware Search Policy for Agentic RAG


39. SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models


40. Can Agentic Trading Systems Pay for Their Own Intelligence?


41. Information-seeking failures of large language models in agentic clinical reasoning


42. Behavioural Signatures of Risk-Sensitive Decision-Making in Large Language Models


43. UNIT: Unleash Large Language Models Potential for Graph Continual Learning


44. Dynamic Agent Skills: A Lifecycle Survey and Taxonomy of Evolving Skill Libraries


45. Looped State-Space Language Models with Adaptive Exit-State Selection


46. MAG: A Web-Agent Benchmark and Harness for Multimodal Action and Guide Generation


47. AgentAbstain: Do LLM Agents Know When Not to Act?


48. Exploring Agentic Workflows for Generating High Quality Math Visual Aids


49. Semantic Drift and the Stability of Operator Control in Reasoning-Class Decision Support Systems


50. Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems


51. BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking


52. Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets


53. Coresets Before Score Sets: Evaluation-Unsupervised Prompt Subset Selection for LLM Benchmarks


54. Closed-Loop Control with Rule-Aligned Small Language Models and Multi-Agent Self-Correction


55. YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate


56. Faithful, Not Corrective: Message-Format Effects in Multi-Hop Agent Relays Are Tier-Dependent


57. Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking


58. Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks


59. Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias


60. Evidence-Backed Video Question Answering


61. Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models


62. StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description


63. VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion


64. Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming


65. RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM


66. Extending LLM Context via Associative Recurrent Memory


67. Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals


68. Agentic Skill Optimization over Lie Algebroids


69. A Multimodal Dataset for Large Language Model Applications in the Energy Domain


70. Agentic Routing: The Harness-Native Data Flywheel


71. Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points


72. Fail-Aware and Explainable Test Oracle Prediction


73. PRISM Edit: One Vector for All Temporal Answers


74. The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students


75. Automated Textbook Auditing with Multi-Agent LLM Systems


76. Enhancing LLMs through human feedback: a journey towards self-improvement


77. Multi-Agent LLMs Fail to Explore Each Other


78. DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs


79. ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm


80. AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation


81. AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP


82. Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video


83. BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services


84. Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies


85. The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model Pipeline Optimisation Approaches and their Interactions


86. How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study


87. 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects


88. Large Language Models for Token-Efficient and Semantic-Preserving Opinion Summarization


89. Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games


90. Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents


91. Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs


92. To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning


93. PromptGraph: Graph-Guided Prompt Sanitization for Balancing Privacy and Utility in LLM Inference


94. Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification


95. Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs


96. Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting


97. Anamnesis: An Open-Source Platform for Large-Scale Backstory-Conditioned Survey Simulation


98. WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen


99. MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference


100. Tool-Adaptive LLM Reranker


101. Motif: Discovering and Automating Personal Web Workflows


102. Towards Autonomous and Auditable Medical Imaging Model Development


103. Conditional Optimal Bridge for Riemannian Activation Steering


104. Confining Nondeterminism: AI-Driven Research Systems as DBMSs for Reliable, Non-Wasteful, Transparent, and Collaborative Research [Vision]


105. Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents


106. ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples


107. Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards


108. Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts


109. Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability


110. SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding


111. A Stepwise Questioning Expert-Editor Multi-Agent Framework for Long-Document Summarization


112. Structured Thoughts For Improved Reasoning And Context Pruning


113. Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift


114. Partial Contracts Suffice: Sound, LLM-Inferred Regression Verification


115. PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning


116. Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices


117. Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization


118. EmoStyle: Affective Conditioning of Style-Specialist Experts for Emotional Image Generation


119. LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning


120. GAE: Graph-Augmented Evolution for Scientific Discovery via Reinforcement Optimization


121. A Large-Scale Dataset of MCP Implementations on GitHub


122. Cost of Reasoning in non-English Languages: A Case Study on Japanese


123. Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety


124. Efficiently Adapting Spoken Language Models for the Singaporean Context


125. An LLM-powered Agentic Recommendation System for Connected TV Content Discovery


126. SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification


127. Faithful by Design: Evaluating and Improving LLM-Generated Clinical Trial Summaries for Multi-Stakeholder Audiences


128. Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data


129. Memory-Conditioned Tool Calling for Camera-First Visual Agents


130. Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B


131. Large Multimodal Model-Based Environment-Aware Mobility Management


132. The Universal Language of CSI:Unifying Wireless Sensing Across Devices and Environments


133. Depth-Entropy Guided Sampling for Training-Free LLM Reasoning