LLM 관련 주요 논문 - 2026-09-09

1. Procedural Graphs: Self-Evolving Execution Structures for LLM Agents


2. MeClear: Cooperative Game-Theoretic Attribution and Risk-Aware Memory Clearance for Long-Horizon LLM Agents


3. Answer-Distribution Trajectories: A Stochastic-Dynamics View of LLM Reasoning


4. Deposon: An Auditable, Conservation-Guaranteed, Game-Theoretically Tested Scattering Layer over LLM Reasoning Paths


5. PlannerForge: LLM Agents for Scenario-Based Testing of Motion Planners in Autonomous Driving


6. Closing the Consistency Gap: Self-Evolving Agents That Learn to Stay on Course


7. It’s All in the Way You Say It: The Role of Information Representation in LLM-Based Glycemic-Event Prediction


8. CLAMP: Constrained Decoding for Vision-Language Embodied Planning


9. Graph-Based Personalized Memory for LLM Agents: Representation, Evolution, Retrieval, and Evaluation


10. A Three-Tier Persona Vector for Controllable User Simulation in Agentic Evaluation


11. AgentGrad: Intervention-guided Prompt Optimization for Multi Agent Systems


12. BIO-MEMART: Biometric-Aware KV Cache Memory for Multi-User LLM Agents


13. Personalizing LLM Agent Memory Using Biometrics


14. SRPO: Setwise Relative Policy Optimization for Multi-Agent LLMs


15. EvolveScaler: Synthesizing Information-Evolution Contexts via Executable State Machines and Natural-Language Rendering


16. FastE: Readout-Triggered Token Compression for LLM Embedding Inference


17. LEBGen: An LLM-Enhanced Bayesian Network Framework for Few-Shot Travel Survey Data Generation


18. Evidence-Aligned Entity Verification for Hallucination Detection in Retrieval-Augmented Generation


19. Agentic ML Exploration (A-MLE) for Ads Ranking


20. Style Over Substance: Content-Invariant Wrappers Flip LLM Safety-Judge Verdicts


21. SE-GoS: Self-Evolving Graph-of-Skills for Skill Library at Scale


22. TTGBench: Benchmarking Topological Evolution and Semantic Drift in Text-attributed Temporal Graphs


23. Vision: Data-Centric Anchoring for Robust and Interpretable Agentic AI


24. Do Dynamic Routers Need Memory? HeRo: History-Aware Routing for Efficient LLM Inference


25. Bridging the Semantic-Utility Gap in Multimodal RAG via Generator-in-the-Loop Alignment


26. Less Is Personal: Learning Minimal Sufficient User Profiles for Personalized Language Models


27. Safe Harness Self-Evolution: A Theoretical Analysis of Feasibility and Limits


28. OntologyBench: Can Dense Retrieval Satisfy Structured Biomedical Constraints?


29. SchemeArena: Factorized Stress Testing of Scheming in LLM Agents


30. CIVI: A Framework for Diagnosing Search Agent Failures in Civic Information


31. Automated Design of Inventory Policy with Large Language Models: An Exploratory Study


32. Eliciting Self-Verification in Multimodal Reasoning Agents with Reinforcement Learning


33. A Layered Analysis of Disagreement And Answer Quality in Multi-Agent LLM Debate


34. Sparks of In Silico Cognitive Science: Theories from Simulated Data Can Generalize to Humans


35. When Can LLM Digital Twins Reduce Human Measurement? From Behavioral Fidelity to Statistical Substitutability


36. From Event Logs to Governed Action: A BlueSky Agenda for Agentic Process Mining


37. CausalVerify: An Execution-Grounded Benchmark for LLM Causal Inference Workflows


38. Beliefs and Behavior in Language Models


39. PRIMUS: Identity, Governance, and Verification for Multi-Agent Federations


40. Do Large Language Models Know What They Don’t Know II? A Fully Behavioral, Non-Cognitive Measure of Epistemic Honesty


41. What Does an LLM-Agent Leaderboard Rank Actually Compare?


42. xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems


43. Aegix Pulse: A Traceable Three-Stage Architecture for Personalized Content Generation and Context-Preserving Revision


44. From Simulated Citizens to Simulated Deliberation: Challenges in Representation and Interaction


45. The Internal Anatomy of Strategic Choice in Large Language Models


46. CIT-CAD: Constraint Intent Tree-based CAD Code Generation and Verification


47. Human-like moral judgments conceal divergent motive attributions in large language models


48. AAS-RAIL: Improving Information Extraction for Asset Administration Shells through Retrieval-Augmented In-Context Learning


49. SkillAlign: Aligning Skill Interfaces for LLM-based Agents


50. Elastic Horizon: Discovering the Effective Interaction Frontier in Agentic Reinforcement Learning


51. Agentic Algorithm Engineering: Improving Shared-Memory Exact Minimum Cuts


52. EmoMed: An Emotionally-Aware Agent for Multimodal Medical Support with Real-Time Information Retrieval


53. PhysMAS: Physics-Grounded Multi-Agent Synthesis of Compositional 4D Gaussians


54. Risk Is Not Review Value: Wrong-Answer Exposure Under Bounded Review Budgets


55. VST: Verifiable Structured Transport for Auditable Agent-to-Agent Alpha Discovery


56. When and Why LLM Causal Priors Help: Closed-Loop Prior Selection for Amortized Causal Inference


57. A visual large language foundational model for medical image recognition using clinician-oriented social media


58. Reason Through the Latent! Making Latent Visual Reasoning Necessary


59. SerenAI: State-transition system inspired by text-based world AI models


60. MARBO: Relational Belief Grounding for LLM Agents in Social Deduction Games


61. AutoKD: Autonomous Knowledge Discovery


62. MVFA: A Multi-View Text-Guided Multimodal Fusion LLM Adapter for Sentiment Analysis and Emotion Recognition


63. Substrate-Portable Execution for Production LLM Workflows


64. LayerRoute: Action-Conditioned Mixture-of-Layers Routing for Vision-Language-Action Policies


65. Explaining AI Agents Through Execution Traces


66. DAREBench: Deployment-Aware and Reliable Evaluation of Models as Agents



68. The End of AI Exponentiation: Fluttering Inside and Outside AI Bubble


69. Multimodal Resource-Exhaustion Attacks on Vision-Language Models via Joint Pixel-Prompt Optimization


70. AgentBrew: Offline Tool-Use Agent Learning from Raw Real-World Trajectories


71. Beyond Top-$k$ Skill Retrieval: Diversity-Aware Skill Routing for LLM Agents


72. Agentic BAIM-LLM Evaluation (ABLE): Benchmarking LLM Use of Protein Design Tools


73. Exposing Weaknesses in Emotion Recognition in Conversations


74. Spillover-Aware Multi-Value Steering for Pluralistic LLM Alignment


75. More Than Mimicking Reviewers: Evaluating LLMs for Pre-Submission Peer Review


76. Distilling Vision-Language Models for On-Device Fire Understanding


77. DI-Bench: Systematically Generating In-Domain Data Intelligence Benchmarks for Enterprise Agents


78. Inference-Time Graph Engineering for Multi-Agent LLM Workflows


79. Beyond Prompts: Measuring and Optimizing LLM Tool-Agent Harnesses


80. Recovering Temporal and Geographic Signals from Language Model Embeddings


81. CUSP: Decomposable Collective Uncertainty for Multi-Agent Multimodal Reasoning


82. What LLM Trading Agents Actually Do in Production: A Six-Month, Population-Scale Record from Two Fleets


83. Agents Trust Tools Too Much: Measuring Reliance on Unreliable Tools


84. EdgeMem: LLM-Free Agent Memory Construction and Retrieval via Evidence-Preserving Multi-Anchor Hypergraph


85. The Failure Happens Before the Drift: The Social Dynamics of Values in LLM Agent Societies


86. Reasoning-Aware Compression: Identifying and Protecting Vulnerable Reasoning Circuits for Energy-Efficient LLM Deployment


87. SciLitBench: Benchmark and Design Principles for LLM-Powered Systematic Literature Reviews


88. Compiling VGDL into Causal Models


89. When Does Memory Help? A Cost-Aware Evaluation of Long-Term Memory in Tool-Using LLM Agents


90. CriticGen: Generation-Aware Evaluation as Actionable Feedback


91. Beyond Right and Wrong: Evaluating Second-order Social Reasoning in Large Language Models


92. Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs


93. Measuring LLM Sycophancy under Sustained Multi-Turn Pressure


94. GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting


95. Performance of Clinical AI System and Physicians and Frontier Language Models in primary care diagnostics


96. Training-Free Task Vectors for LLM Behavioral Control


97. The Audit Decides the Verdict: Instrument Effects Rival Demographic Bias in LLM Decision Audits


98. Transformers as In-Context Samplers: From Closed-Form Diffusion to Estimation-Free Sampling


99. SQLMorph: Query Mutation and Fine-Grained Metrics for Text-to-SQL Evaluation


100. Evaluating and Improving Evidence-Grounded Fact-Checking in LLMs via Multi-Round Evidence Ablation


101. OntoKG-EQ: A provenance-grounded, competency-question-governed knowledge graph for auditable analyst querying


102. Evidence-Grounded Retrieval for Investigation Hunt Lead Generation from CTI Reports


103. Benchmark Scores Are Pipeline-Dependent: A Reliability Audit of Cybersecurity LLM Benchmarks


104. CausalChapter: Improving Long-Video Chaptering with Interventional Dependency Modeling


105. MoEMB: Scaling Universal Multimodal Embeddings with Efficient Mixture-of-Experts Models


106. CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation


107. Suan: Rectifying Direct Preference Safety Alignment in Large Language Models


108. The Unreliable Progress Bar: Can LLM Agents Reliably Report Task Progress Throughout Execution?


109. Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?


110. Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values


111. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks


112. Towards Embodied Air-Ground Cooperative Object Search: Benchmark, Dataset and Agentic Method


113. Noise Adaptive Streaming Audio-Visual Speech Token Enhancement for Robust Full-Duplex Spoken Dialogue Models


114. A Measurement Study of LLM Inference Trade-offs Across Edge Continuum Hardware


115. What Eviction Destroys: A Restore-Counterfactual Audit of Forgetting in Agent Memory


116. ACEA: An Adversarial Co-Evolution Arena for Head-to-Head Red-Team and Blue-Team LLM Testing


117. CS-CLIP: Compositional Scene Graph-guided CLIP for Robust Compositional Reasoning


118. 3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints


119. Dual-Layer Semantic-Spatial Belief Mapping for Aerial Object Goal Navigation


120. DISEIL: Demonstration Distillation for Sample-Efficient Imitation Learning


121. LLMs for Social Network Modeling: From Network Generation to Dynamic Processes


122. TDDN: Text-aligned Diffused DINO Network for Puzzle Understanding


123. SAFIRE: Safety-Critical Benchmark for Fine-grained Fire and Smoke Understanding in Multimodal LLMs


124. A*-Thought-V2: Efficient Latent Reasoning via Geometric Dynamics of LLM


125. Kalman Delta Networks: Uncertainty-aware Associative Memory


126. VoT: Vision-of-Thought for Unified Multimodal Representation Alignment


127. You Can’t Prefer Emotions You Don’t Sample: Intensity Undershoot in DPO-Tuned LLMs


128. Fine PT-PT Web: A High-Quality 41 Billion Tokens Data Collection of the European Portuguese Web


129. From Citations to Contributions: LLM-Assisted Credit Scoring of Research Articles


130. Accuracy is Not Enough: A Divergence-Based Approach to Evaluate Fidelity Loss in Quantized LLMs


131. Noēsis: Deterministic-First Retrieval with Two-Tier Context Hydration for Factuality-Critical Queries on Small Local Models


132. How AI Models Manage Epistemic Authority: A Taxonomy and Comparative Analysis of Responses to User Disagreement


133. Online Surrogate Repair: Decoupling High-Fidelity Feedback from Search Length in Closed-Loop Discovery


134. ObGynLongBench: Revealing the Evidence-to-EHR Gap in Longitudinal EHR Decision-Making


135. Mapping the Emerging Social Science of Large Language Models


136. We’re Cooked! - Probing LLM Political Alignment Via Conflict-Framed Recipe Translation


137. Parser-Free VLM Verification for Federated Weakly Supervised Video Anomaly Detection


138. Federated Binary Gating with Server-Side Vision-Language Inference for Surveillance Anomaly Classification


139. Beyond Single-Negative Preference: Multi-Negative DPO for LLM-Centric Historical Entity Linking


140. BlueprintAgent: Constraint-Triggered Targeted Revisits for Simulation-Ready Generation from Scanned Structural Blueprints


141. Staying on the Attack Path: Structured State for Long-Horizon Automated Penetration Testing


142. LANTERN: Language Model Assessment on Noisy and Transformed Tasks for Understanding Error and Robustness Nuances


143. Quality Metrics for LLM-Generated Asset Administration Shells: A Perturbation-Based Evaluation Approach


144. MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling


145. Parallelism Strategy Chaining for Fast Training Convergence


146. Recompilation Is Not Enough: Test-Guided Decompiled-C Repair


147. In-Place Instruction Following in Diffusion Language Models


148. FreqBLiMP: Frequency-Controlled Minimal Pairs Reveal Robustness and Fragility of LLMs Under Lexical Rarity


149. Flow3D-OPD: Multi-Teacher On-Policy Distillation for 3D Geometry Generation with Flow-Matching Diffusion Transformer


150. AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing


151. From LLM-Generated Specifications to Learned Quadruped Locomotion


152. Discovering Natural Transformation Vulnerabilities in Black-Box Vision Models


153. AstroSpecLM: A Spectrum-Language Model for Evidence-Grounded Astronomical Spectral Analysis


154. SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem


155. Aha-Flow Distillation: Flow Markers Matter in LLM Reasoning


156. Train Overcomplete, Deploy Compact: Scaling Recovery Capacity for Structured LLM Pruning


157. AgentDrift: A Step-Labeled Benchmark of Injection-Hijacked LLM Agent Trajectories


158. Re-calibrated Contrastive Loss for Transformation-Aware Prompt Conditioning in Vision-Language Models


159. Steering Interference Reflects the Model’s Defaults, Not the Behavior Directions


160. The Geometry of Refusal: Why Post-Hoc Safety Is Fragile and Pretraining-Time Safety Persists


161. AutoLexSteer: Automatic Contrast Construction for Lexical Activation Steering


162. Characterizing Contention-Induced Reliability Collapse in KV-Cache Timing Side Channels for Multi-Tenant LLM Serving


163. WAPP: Safe Learning of Positive Security WAF Policies from Live Traffic


164. Typed Federated Artifacts for the Agentic Web:Sharing Tool-Routing Knowledge Across Frozen,Heterogeneous LLM Agents


165. AURA-Eval: Evaluation Framework for Acting Under Risk Awareness in LLM Agent Trajectories


166. DrugReason: Dynamic Multi-View Reasoning over Knowledge Graph and Language Evidence for Drug Repurposing



168. A Trustworthy Watermarking Framework for LLM-Generated Food Safety Content


169. Counterfactual Tests for Measuring Chain-of-Thought Faithfulness in Visual Language Models


170. Detokenization Leaks: Reconstructing Local LLM Outputs From Cache Traces


171. ECOKV: Geometry-Aware KV Cache Eviction via Complementary Diversity Metrics


172. Inducing Emergent Misalignment from Reward Hacks with Iterative DPO


173. Mind the Gap: Exposing LLM Translation Blind Spots Using the AlphaMWE Multilingual Parallel Corpus


174. SAGE: A Hierarchical Framework for Evaluating Interpretive Literary Quality in Narratives


175. SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure


176. ProcArena: A Multi-Scenario Benchmark for LLMs on Direct and Interactive PL/SQL Development from Natural Language


177. Robust Conformal Consensus: Multi-Agent LLM-as-a-Judge Interval Evaluation with Conformal Prediction


178. Steering Geometry: Validating Human Value Geometry in LLM Steering Space


179. It is Not Yet Another Tool: Creating and Deploying an Agentic AI Companion in a Security Operations Center


180. VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification


181. SWE-Test: Benchmarking LLM Vulnerability Discovery via Input Prediction


182. Scratchy: Visual-Scratchpad Multimodal Reasoning for Cryptographic Proof Generation in EasyCrypt


183. All for 1-Bit: Towards Genuine 1-Bit Post-Training Quantization for LLMs


184. SCRIPTIOC-BENCH: A Benchmark for Recognizing Actionable Threat Intelligence from Script-Based Malware using LLMs


185. What the Window Does Not Contain: Auditing Provenance in a Document-Grounded Instability Benchmark


186. PAGR: Proof-Carrying Algebraic-Geometric Retrieval: A Quiver-, Provenance-, and Sheaf-Theoretic Framework for Grounded LLM Retrieval


187. PhenoBench: Mapping What a Deeply Phenotyped Human Cohort Can Tell Us


188. FedSubMuon: Communication-Efficient Federated LLM Fine-Tuning via Structured Subspace Muon


189. Evaluating Deep-Search Agents under Hierarchical Web Evidence Poisoning


190. Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts


191. Geometry-Aware Test-Time Learning for Quantitative Spatial Reasoning


192. Beyond Cross-Lingual Transfer: Benchmarking Propagation Boundaries in Multilingual LLM Unlearning


193. Solving versus Verifying: Catching Contradictions in Tax Reasoning Systems


194. STAR-Pro: Stage-Wise Token Adaptive Reduction with Progressive Refinement for Efficient Large Vision-Language Models


195. Structurally Close, Temporally Distant: Measuring Security Exposure in Long-Horizon LLM Agents


196. UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms


197. From Review to Authorization: Key-Isolated Threshold Signing for LLM Agents


198. AlignDiff: Exploiting Model-Intrinsic Information for Better Preference Data Selection


199. What if LLMs Ate Their Words: Causal History Effects in Multi-Turn Interaction


200. Grounded and Faithful P&ID Reasoning: Constraining Vision-Language Models with Recovered Evidence Graphs


201. Where Does the Sound Go? Tracing Acoustic Information Loss in Audio-Conditioned LLMs


202. SAFEGuard: Detect Optimization-Based Jailbreak Attacks Through Harmful Semantic Analysis and Fluency Measurement


203. Do Quantum AIs Dream in Paths? Path-Integral Slow Thinking through Grover Interference


204. AtomCite: Verification and Correction of Supplied Page-Level Citations in Multi-Page Documents


205. Bait-and-Recover: Poisoning Internal Refusal Signals to Defend LLMs against White-Box Editing Jailbreaks


206. Diffs vs. Whole Files: An Empirical Comparison of Iterative Edit-Based and Direct Generation for Flutter/Dart Code Models


207. Data Scout: Targeted Web Crawling for Domain-Specific Pretraining Corpora


208. Interface-Aware KV Cache Quantization for Dense On-Chip NVM in Long-Context LLM Decoding


209. GeoContext: One Context Ladder, Two Failure Modes in Vision-Language Geolocation: Flat Reliance on User-Provided Location Context and False Confirmation of Location Claims


210. Concord: A Video Relational Algebra for Cross-Modal Query Optimization


211. Who Maintains Agent Skills? A Longitudinal Study of Human-Governed, AI-Assisted Skill Maintenance


212. PAC-Private Autoregressive Generation: Calibrating Noise to Ensemble Disagreement


213. TamilEOT: A Dataset and Model for Semantic End-of-Turn Detection in Tamil Telephone Speech