LLM 관련 주요 논문 - 2026-07-28

1. ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams


2. Eviction as Estimation: A Fixed-Lag Smoothing View of Test-Time Memory, and When Measuring Beats Accumulating


3. Reason-Mediated Behavioral Models for Auditing LLM Social Simulators


4. SIREN: Towards End-to-End Extreme-Weather Early Warning with Experience-Grounded LLM Agents


5. LLM-SoccerArena: Benchmarking LLMs on Real-World Predictions in Sports


6. Hierarchical Group-Conditional Conformal Risk Control for Selective Prediction in Language Models



8. Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis


9. Making Mathematical Knowledge Explainable, Accessible and Interoperable Through Large Language Model Integration


10. From Execution to Capability: Scientific Experience Consolidation via Procedural Knowledge Synthesis


11. Failures Reveal What Metrics Miss: An Evidence-Driven Agent for Recursive Refinement of ECG Classifiers


12. Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization


13. Simulating Tenant Responses to Energy Policy Interventions with Transaction-Cost-Aware LLM Age


14. Gubernaut: A Deterministic Homeostatic Controller for Affect-Regulated LLM Agents, Validated Across Independent Model Families



16. Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach


17. Falsifiable Commitment Planning for Self-Correcting Web Agents


18. MemChain: Learning Interpretable Memory Traces for Memory-Augmented LLM Agents


19. Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks


20. DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models


21. MemTX: Transactional Belief Commit for Stateful Agent Memory


22. Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory


23. GOTS: Greedy Orthogonal Token Selection for High-Resolution Vision-Language Models


24. From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement


25. Training Language Models to Cooperate with Inference-Time Controllers


26. E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios


27. Offline-Online Curriculum RL for Multimodal Reasoning


28. Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems


29. SpecAHD: Localize to Specialize for Automated Heuristic Design in Large-Scale Routing Problems


30. Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning


31. ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness


32. Do LLMs Know Their Vulnerable Scenarios?


33. Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning


34. Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation


35. ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications


36. RareLens: Towards End-to-End Rare Disease Care via Aligning Divergent Large Language Model Reasoning


37. TopoFE: topology-aware LLM-guided Automated Feature Engineering


38. AgentOmnia: Scaling Agentic Models for Full-Scenario Applications


39. SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows


40. Compiler-Grounded Hierarchical Diagnosis for LLM-Based Triton Kernel Optimization


41. SymStep: Symbolic Step Verification for Logical Reasoning


42. Stress-testing large language model agents in a robotic chemistry laboratory


43. Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming


44. ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control


45. Let AI Agents Translate Networks, Not Reason About Them


46. Agent Team Work Zone: An Automated, Persistent Workspace for Long-Lived Coding Agent Teams


47. Commitment To Cooperation With Self-Negotiated Contracts


48. Spatial Reasoning in LLM Game Agents: Impact of Causal Context and Multi-Step Planning


49. SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering


50. Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures


51. Test-Time Coverage: Test-Conditioned Data Curation for Deployment-Aware Learning


52. PANOPTICON: A PII-Based Assemblage of Naturalistic Output Tokens for Investigating Privacy Leakage Within LLM Context Window


53. Bayesian Repetition Penalty: A Principled Adjacent-Conditional Framework for Reversing Attention Collapse in Autoregressive Language Models


54. Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture


55. HiLLTS: Zero-Shot Hierarchical LLM-Guided Traffic Signal Control for Sustainable Transportation


56. LazyMem: Retrieve Broadly, Construct Selectively for Efficient Long-Term Agent Memory


57. Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents


58. Imprompt: A Language Framework for Prompt Programming


59. How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift


60. Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models


61. CuraWeb: Joint Optimization of Quality, Redundancy, and Diversity for Web-Scale Pretraining Data


62. TRE: Training-Free Hallucination Detection for Diffusion Language Models


63. StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech


64. EventOD: Event-Aware OD Flow Generation via LLM-Guided Semantic Modulation


65. Do Language Models Converge to Themselves? Recursive Self-Refinement as Textual Relaxation


66. KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering


67. ARdena: Scenario-driven control of real-time LLM agents


68. STAIF: A Stage-wise Optimization for Complex Instruction Following


69. PTStore (Prefix Tensor Store): Distributed Prefix Caching and Replication for High Throughput Inference Serving


70. Extracting Algorithms in Pre-trained LLMs: A Case on Hidden Markov Models


71. CRAFT: Learn the Schema, Execute the Plan


72. PRESTO: Prefix-Aligned Tree Drafting for Diffusion Speculative Decoding


73. VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing


74. Masked Distillation: Internalizing the Chain-of-Thought in Language Models


75. TokenMem: Faithful Knowledge Injection for Frozen LLMs


76. CHS-SQL: A Text-to-SQL approach based on Confidence-Guided Heuristic Search Schema Linking process


77. Opti-Q: A Constraint-Based Optimization Framework for Multi-LLM Question Planning


78. DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training


79. Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure


80. Tokengeist: Multi-Turn Attribution Tracing in Agentic Conversations


81. Evaluating LLMs as Interpretable Controllers for Dynamical Systems


82. Group Preference Collapse in Personalized Multimodal Large Language Models


83. DeepLook: Deeper Thinking with Lookahead


84. Chart Deception in Vision-Language Models: From Vulnerability to Mitigation


85. HyCE-RAG: Hypergraph Chain-of-Evidence Retrieval-Augmented Generation for Explainable Multi-hop Question Answering


86. Structure Over Scale: Schema-Constrained Causal Graphs for RAG


87. Lexical discovery in unknown environments orchestrated by Large Language Models


88. ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation


89. TriSP: Tri-Signal Structured Pruning for Large Language Models


90. MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models


91. Multi-Objective Structured Pruning of LLMs for Latency and Model Size Optimization


92. HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization


93. cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs


94. Temporal Context Reinstatement Drives Episodic-Like Order Memory in Long-Context Language Models


95. Too much evidence, too little time: From text to actionable recommendations through multi-objective evidence reasoning


96. Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL


97. Reference Feature Atlases for Mechanistic Auditing of Language Models


98. Keyword Matters: Unveiling the Energy Sensitivity of On-Device LLM Prompting


99. MedLoCoMo: A Long-Context Multi-Session Medical Dialogue Benchmark for Large Language Models


100. Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents


101. SF-AMS: Strategic Forgetting for Structured Memory in LLM Agent


102. Codifying the Judge: Scalable Evaluation via Program Distillation


103. MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models


104. Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy


105. ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding


106. KANEx: Translating Kolmogorov-Arnold Networks’ Interpretability to Medical Explainability


107. DataOrchestra: Learning to Orchestrate Per-Example Curation of Pretraining Data


108. Efficient LLM-Generated Shuttling Compilers for Complex Trapped-Ion Architectures


109. A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility


110. Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents


111. Evaluating the Impact of Explainable AI on Trust in AI-Assisted Code Review


112. D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models


113. CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding


114. The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding


115. LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding


116. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes


117. UNIFUSION: Adapting Autoregressive Language Models into Discrete Diffusion under a Unified Reverse-Rate Objective


118. Evaluating RAG for French immigration law: a benchmark and baseline study


119. LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings


120. DraftExpert: Expansion-Aware Self-Speculative Decoding for End-Device MoE Inference


121. Closed-Loop Validation-Repair for Healthcare Interoperability: A Multi-Model Study of Schema Compliance in Clinical LLMs


122. DeepFaith: Evidence-Grounded LLMs for Faithful Incident Reporting in Multi-Stage APT Defense


123. Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls


124. Teacher Knows It Best: Spontaneous Symmetry Breaking and Tipping Points in Networked Langevin Dynamics AI Sycophancy


125. The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages


126. FilmBench: A Film-Grade Benchmark for Cinematic Video Generation


127. StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting


128. Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim


129. MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning


130. ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning


131. HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent


132. Disentangling Semantic Attention from Structural Bias in the Attention Manifold


133. Agentic Cloud Decoys: A Deception-Driven Framework for Autonomous Intrusion Investigation


134. SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding


135. Moral Hazard in Multi-Agent Language Models


136. Tag Questions and the Generational Reversal of Sycophancy Across 45 Language Models


137. SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving


138. Understanding Tone-Dependent Inference Cost in Large Language Models


139. Embodied GPT-5.1: Evidence of a World Model?


140. TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation


141. Kalypso: Relational LLM Serving


142. Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages


143. A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever


144. How Context Attribution Handles What the Model Already Knows


145. PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis


146. A Few Words Go a Long Way: Language Guided Robot Policy Synthesis


147. WISERouter: LLM Routing with Workload Budget Constraint


148. The Illusion of Secure LLM Code: Closing the Security Gap via Iterative Reprompting


149. CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation


150. Where Is the Cost of Third-Party API Routers in Agentic Software Development?


151. Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric


152. Auditing Alignment Controllability in LLMs via Political Axes


153. Novel Claim or Déjà Vu? Rethinking “Contamination-Free’’ Dynamic Evaluation for Multimodal Automated Fact-Checking


154. Do Diagrams Help Large Language Models Reason? Evidence from Syllogistic Reasoning


155. Token-Region Guided Cross-Attention Fusion for Multimodal Affect Interpretation



157. Reasoning or Memorization: Can LLMs Understand and Generate Chinese Xiehouyu Riddles?


158. TLA$^{+}$-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA+ Specification Generation


159. When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles


160. Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing


161. Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition


162. What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features


163. Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining


164. In-Context Learning as Implicit Policy Gradient


165. False Prophets: On the Security of World Models in Agentic Systems


166. Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios


167. Traceable LLM Reasoning for Fake-Order Fraud Detection


168. Attention-Guided Layer Selection for Contrastive Decoding in Large Language Models


169. ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation


170. Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models


171. MixQuant: Adaptive Mixed-Precision Quantization for Large Language Models


172. VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy


173. Adversarial Test-Hardening for AI-Written Code: An Instrument Autopsy and a Pre-Registered Causal Estimate of the Critic Loop


174. Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning


175. Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model


176. Not All LLM Reasoning is Visible in the Chain-of-Thought


177. Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests


178. Do Coverage and Mutation Scores of LLM-Generated Test Suites Correlate with Their Effectiveness? (Replicability Study)


179. Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests


180. Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias


181. Agentic Autoresearch for CT Reconstruction


182. Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis


183. LC-SEPLM: long-range contact-supervised adaptation for sequence-only protein representation learning


184. Cheap Probes Predict Expensive Training in 3D-CT Vision–Language Models


185. DomainPilot: Domain-Level Loss-Guided Two-Stage Data Mixture Optimization for Efficient Language Model Fine-Tuning


186. Beyond Shapley: An Influence-Based Data Auditing Pipeline for LLM Alignment and Evaluation


187. Spectral Dynamics of Semantic Drift in Clinical Multi-Agent Language Model Networks


188. Hierarchical Grading in Large Language Models


189. AI-generated Images Challenge Visual Trust in High-risk Scenarios


190. Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks


191. An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia


192. CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents


193. SetGo: Metadata Readiness for Scientific AI Datasets


194. Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS


195. A didactical-driven teacher assistant for a dimensional modeling course


196. Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review


197. Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B


198. Evaluating Large Language Models for Symbolic Security Protocol Analysis