LLM 관련 주요 논문 - 2026-08-11

1. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents


2. Mismatch Matters: On-Policy Distillation Beyond Token Agreement


3. Matryoshka Language Model Suites


4. Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models


5. Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching


6. From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization


7. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization


8. The Politician, the Liar, and the Obedient Worker: Emerging Behavior of LLM Agents in Hierarchical Games


9. Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents


10. One Adapter Pair per Model: A Universal Activation Interface for Language Models


11. Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents


12. Coupled Graph–Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity


13. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models


14. KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models


15. OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks


16. CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits


17. LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling


18. ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons


19. MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence


20. P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation


21. Entropy-based Code Adversarial Translation for Real-world Repository Migration


22. Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline


23. SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance


24. Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution


25. SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge


26. Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models


27. CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving


28. Signature-Guided Capacity Occupancy for Dense Expert Merging


29. Agentic Router: An Execution-Grounded Continual Learning Approach With Memory


30. From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents


31. CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment


32. ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models


33. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning


34. MELLON - Multimodal Enhanced LLM for Online Navigation


35. Motif 3: Technical Report


36. Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models


37. Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways


38. PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs


39. Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis


40. Decoding Phenotypes: A Framework for Fusing Genomic Language Models and Neuroimaging


41. LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing


42. AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups


43. Theory-Guided Deception Detection: A RAG-Based Artificial Intelligence Exploration


44. Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents



46. Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models


47. Improving Generalization Robustness of Multimodal RLVR


48. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs


49. SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification


50. Scale-to-Dialogue: Low-Burden Elicitation of Daily Premenstrual Symptom Ratings with Small Language Models


51. FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models


52. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling


53. EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility


54. The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task


55. SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests


56. Can Open-Weight Models Compete on Financial Text Comprehension?


57. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace


58. ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration


59. Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents


60. VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference


61. Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing


62. Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding


63. Understanding Calibration and Truncation Error Propagation in Training-Free Low-Rank Compression for LLMs


64. MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models


65. HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails


66. Yesterday’s Shield, Today’s Spear: A Self-Evolving Safety Guardrail in Production


67. LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs


68. Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses


69. What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files


70. TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation


71. Forgotten History or Test-of-Time? Retrospect and Prospect on RAG from an IR Perspective


72. CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception


73. LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving


74. StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning


75. Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning


76. Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders


77. Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios


78. OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents


79. Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?


80. LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems


81. Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue


82. Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models


83. Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets


84. Quantization Degradation in Large Language Models: A Signal-Noise Perspective


85. Agentic AI-driven Immersive Simulation: A Knowledge-Aware Virtual Training Platform forHigh Dose Rate (HDR) Brachytherapy


86. When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs


87. TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance


88. Improving Constraint Models with LLM Agents


89. Neurosymbolic Discovery of Algebraic Graph Constructions


90. Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework


91. Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?


92. CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models


93. H2: A Dual Hybrid Semantic Data Lake Architecture for Medical Data Harmonization with Human-In-the-Loop verified, LLM Driven Metadata Annotation System


94. SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents


95. JustLLMGRPO: Radiographic Control for Chest X-Ray Generation


96. Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities


97. SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution


98. The Authority Expectancy Effect in Multi-User Conflict


99. Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning


100. KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs


101. Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI Programs


102. ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration


103. TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents


104. GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning


105. TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?


106. Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills


107. GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering


108. Back to the Future: A workbook time machine for spread sheet creation benchmarks


109. Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge


110. When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines


111. CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR


112. Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space


113. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation


114. IntelliAudit: Using Large Language Models to Evaluate Audit Controls


115. An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography


116. Contextual Value Alignment via Multilayer Combinatorial Fusion


117. Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC–MD Campaigns


118. From Single Chatbots to Governed Agent Ecosystems: An Agentic AI Pattern Catalogue and Orchestration Framework for Mission-Critical Hospital Information Management Systems


119. Controlled Memory Interference in Continual LLM Agents


120. TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair


121. An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop


122. TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations


123. When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains


124. Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems


125. NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation


126. The Knowing-Saying Gap: When Probes See Errors that Confidence Misses


127. Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility


128. Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions


129. Multimodal Model Diffing for Feature Discovery and Control


130. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch


131. Fusion Training for Mathematical Generalization in Large Language Models


132. Stealing Reasoning Traces from Proprietary LLM APIs


133. Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy


134. MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation


135. Parameter Exploration for RLVR via Variational Learning


136. KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs


137. SR-OPSD: Self-Referenced On-Policy Self-Distillation


138. Rethinking Factor Sharing in Federated LoRA: A Rank-Aware Adaptive Approach


139. ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners


140. How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans


141. TSPORec: Token Selection via Preference Optimization for LLM-Based Sequential Recommendation


142. MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection


143. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models


144. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability


145. RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges


146. STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework


147. Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts


148. Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning


149. ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents


150. ZetaGPT: A Reference Implementation of Positional–Encoding–Free State–Space–Attention Language Models



152. Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute


153. SafeQL: Search-based Refinement for Safe and Efficient LLM-based Text-to-SQL


154. MoRSE: Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts


155. Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference


156. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training


157. SiriusDeliver: Automating Data Warehouse Delivery at Tencent


158. Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression


159. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs


160. Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments


161. Visual Distortion Detection in UGC Images Using Large Multimodal Models


162. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information


163. A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents


164. SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs


165. Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence


166. How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review


167. GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices


168. From Recovery to Drop-off: How Action Post-training Reduces a VLM’s Late-Layer Depth Decodability


169. DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference


170. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models


171. Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs


172. Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure


173. LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization


174. Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation


175. RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation


176. LegoLM: Structured Weight Sharing for Large Language Models


177. Enhancing Scientific Named Entity Recognition via Large Language Models: A Type-driven Multi-task Learning Approach


178. RAG-Based Auto-Configuration for Industrial Fieldbus Devices


179. Mitigating Gender Bias in English to Romanian Machine Translation


180. SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills


181. Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction


182. Private Etymology: Designing Relational Reuse of Shared Symbols in Long-Term Human-AI Interaction


183. Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?


184. On the Robustness of LLMs’ Internal Representation of Code Correctness


185. Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations


186. Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification


187. STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs


188. Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives


189. Compositional Threat Analysis of Latent Compromise in LLM Agent Systems: The Order 66 Scenario


190. NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs


191. Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection


192. Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations


193. HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection


194. Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States


195. Evidence-RL: Towards Evidence-intensive Visual Reasoning


196. Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation


197. Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design


198. Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions


199. Persistent Semantic Entities in Tool-Augmented LLM Systems


200. Metadata Reconstruction from Values Alone: Recovering Column Semantics in Undocumented Warehouses


201. Vision-Language Grounding as Bidirectional Concept Correspondence


202. Shape Mutating Expert Compression:LorExperts and BTExperts


203. The Anatomy of a Prompt Injection: A Component Model for Structured Analysis


204. CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting


205. Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding


206. SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment


207. Adversarial Attacks on Deep OCR Systems


208. PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue


209. Scaling Inherently Interpretable Language Models


210. Weather- and Location-Aware Agentic Dining Recommendation: Leveraging LLM World Knowledge for Region-Sensitive Contextual Reasoning


211. Multi-Branch Policy Optimization for Multimodal Large Language Models


212. COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping


213. AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization


214. Learning an Interior Layout Policy in a Domain Specific Language Action Space


215. DarwinX: Evolving Agent Harnesses Through Natural Selection


216. MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-based Automated Heuristic Design


217. Performance of large language models in the optical diagnosis of colorectal polyps


218. NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages


219. An evolutionary model of animats with VLM-based subjective evaluation


220. Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards


221. Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards


222. WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management


223. Unified Hallucination Fuzzing for Multimodal Large Language Models


224. From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations


225. KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants


226. EMMR: Emotion-Mediated Multimodal Reasoning for Personality Assessment in Asynchronous Video Interviews


227. How sensitive do we want AI to be? Socio-communicative competencies of large language models in healthcare


228. PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering


229. JaleesBench: Are AI Assistants Good Spiritual Company?


230. Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based Simulated Clients


231. Knowing You Is Everything: LLM Agents Achieve Near-Perfect Profile-Consistent Reaction Prediction in Social Media Simulation


232. EmoPatient: An Emotion-Directed Patient Simulator for Realistic Palliative Care Communication Training


233. How to Ask the AI: A User Perspective Survey for Large Language Model Prompting


234. Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents


235. Cross-Model Humor Preference Modeling with Cards Against Humanity


236. From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents