LLM 관련 주요 논문 - 2026-08-18

1. What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models


2. Policy Iteration with Human Feedback: Bringing Post-Training RL to In-context Learning


3. LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing


4. Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies


5. PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning


6. CACSurv: Concordance-Aligned Comparative Learning with Large Language Models for Cancer Survival Prediction


7. Large language models as synthetic clinical experts to inform longitudinal rare-disease modeling


8. HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents


9. The Value of a Prompt: An LLM-Relative Kolmogorov-Complexity Approach


10. A Policy Algebra for Trust-Preserving Agentic AI Execution


11. Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152


12. AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment


13. Competing at Every Price Point with Agentic Evolution over a Menu of LLMs


14. Beyond Asking: A Pipeline for Personalized Game Generation that Reads Players from Behavior


15. TRCA: Transition-wise Rubric Credit Assignment for Long-horizon LLM Agents


16. Assessing LLMs’ mathematical abilities requires understanding the various mechanisms of mathematical creativity


17. Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency


18. ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction


19. Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces


20. Augmenting Text to Increase Translation Difficulty


21. Breaking and Defending LLM-Powered Social Media Bot Detection Systems


22. Bounded Agents: Delegation Security for Multi-Agent AI Systems


23. Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation


24. RAGas: Retrieval-Augmented Gas Optimization for Smart Contracts with Continuous Knowledge Integration


25. Schema-Agnostic Graph Reasoning Agent for Hybrid Knowledge Graphs


26. RLCascadeRouter: Quality-Estimator-Free Cascade Routing via Reinforcement Learning


27. KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving


28. Broken Symmetry in LLM Refusal: Answer Release Is More Local Than Refusal Restoration


29. HyMem: Hierarchical Context Management for Long-Horizon Agents via Information Isolation


30. THESIS-MoE: Trainable Hierarchical Extraction and SteerIng of Sycophancy in Mixture-of-Experts


31. Argumentation for Common Ground: Finding Zones of Possible Agreement between Individuals in Conflict


32. VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation


33. When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction


34. Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback


35. From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM


36. Admission Without Answers: Label-Free Certification and Experience Learning for LLM-Based Optimization Modeling



38. Dynamic Multi-Byte Prediction With Hierarchical Language Models


39. Mental Model Management: An Operator-Based Framework for LLM Memory


40. Measuring Reward Hacking and Reasoning-Answer Decoupling Under Position-Confounded Optimization


41. OTel: Building Domain-Specialized Telecom LLM Foundations for Intelligent Networks


42. Does the Proof Prove It That Way? Faithful Formalization of Elements Proofs


43. Implementation of a Metacognition Framework for Self-Awareness and Self-Regulation in Ensembles of LLMs


44. Large Language Model Assisted Operational Monitoring for Battery Energy Storage System Integrated Power Distribution Networks


45. TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions


46. Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL


47. Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot


48. FedPA-LoRA: Product-Aligned Framework for Mitigating Aggregation and Initialization Errors in Heterogeneous Federated LoRA


49. MoE Router-Guided Clustering for Heterogeneous Federated Instruction Tuning


50. Understanding Cognition-Induced Risks in Agentic AI Systems


51. Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis


52. Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark


53. Demographic Injection in Medical Language Models under Diversity, Equity, and Inclusion Prompts


54. SkillCommit: Evolving Agent Skills through Behaviorally Validated Scope Expansion


55. Constitutive Priors for Machine Intelligence: A Legitimacy Theory of the Artificial Physical World


56. ACTS-SQL: Agentic and Critic-Oriented Tree-Structured SQL Correctness with Large Language Models


57. ReForge: Keeping ABR Algorithms Never Finished with Verified Large Language Model Edits


58. Anatomy of a Quantized Agent: VRAM Stability and Forecasting in Code-Synthesis Agentic Workloads


59. Constraint-Aware Synthetic Tabular Data Generation via Inter-Column Constraint Discovery with LLM Agents


60. Beyond Thresholds: A Quality-Aware Decision Intelligence Framework for Cold Chain IoT Systems


61. Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents


62. GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG


63. TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning


64. LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning


65. Gathered, Not Admitted: How Attention Brings a Latent Variable into Verbalizable Form


66. S2-MoE: Enabling Efficient Self-Speculative Decoding for Mixture-of-Experts on Edge Devices


67. T-LLM Compiler: Trusted LLM-based Code Optimization and Verification Framework


68. LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks


69. What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering


70. Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking


71. Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning


72. CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs


73. From Errors to Proofs: Minimal-Core-Guided Repair for Neuro-Symbolic Constraint Solving


74. Agentic Data Cleaning Without a Clean Reference: An Experimental Study of Capabilities and Trade-offs


75. Semantic Uncertainty-Guided Orchestration in Hierarchical Multi-Agent Systems


76. Synchronized Logit Steering: Real-world Steganography


77. When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry


78. Beyond Correctness: Toward Automated Novelty Verification with Lean 4


79. Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems


80. When Uncertainty Isn’t Enough: An Empirical Study of Self-Correction in Code Generation


81. Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance


82. Accuracy and Reliability of Large Language Models in Cosmetic Chemistry and Skin Health: A Benchmarking Study


83. Learning Agent Execution for KV-Cache Management in Agentic Serving


84. A Human-Centred Approach to Benchmarking LLMs for Parenting Advice


85. Large Language Models and their Awareness of Mechanics and Spatial Geometry


86. Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP



88. Toward Safe LLM Agents: A Survey of Specification, Verification, and Enforcement


89. The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines


90. An Agentic Framework Using Rules and LLMs for Embedding and Annotating Descriptive Document Layouts: A Plant Science Use Case


91. Euclid-Omni : A Unified Neuro-Symbolic Framework for Plane Geometry


92. SKILL: Self-correcting Knowledge-guided Iterative Large Language Model Agent for Logic Optimization


93. Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture


94. Large Language Models Show Metacognitive Sensitivity in Medical Reasoning


95. Don’t Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory


96. When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents


97. Diagnosing Dense Same-Class Attribute Misbinding in Large Vision-Language Models


98. Historical Backtesting for Scientific Question Discovery: A Protocol and Astronomy Pilot


99. Neurosymbolic Embodied Agents


100. Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis


101. Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments


102. TDD-Agent: Test-Driven Reasoning for Code Generation


103. GoalEvolve: From Handcrafted Algorithm Priors to Goal-Driven Evolution of Physical Design Algorithms


104. Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors


105. Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL


106. Toward Better Assessment of LLMs’ Performance in Clinical Error Detection


107. When Do Explanations Help In-Context Learning? A Comparative Study of Natural Language Explanation Types and Faithfulness


108. HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes


109. Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning


110. Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization


111. When Context Misleads: Intent-Guided Decoding for Robust Retrieval-Augmented Generation


112. Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans


113. MLLM-Guided Semantic Correction for Text-to-Video Generation


114. A Human-LLM Teaming Framework for Privacy Risk Analysis: An Illustration with CBDC-Based Welfare Schemes


115. PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data


116. Towards Risk-free AI Agent Deployment


117. Ventor-QTest: Threat-Model-Driven Verification of Vendor-Hosted LLM APIs


118. HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals


119. Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026


120. CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills


121. STAIR: Semantic-Temporal Automaton for Interpretable Reasoning in Temporal Question Answering


122. Securing AI-Generated Code: A Just-in-Time Vulnerability Detection and Remediation Pipeline


123. LENS: In-Context Search via Latent Evidence Exploration over Dynamic Raw Documents


124. MUSE: An Interactive Meta-Agent for Understanding and Steering LLM-powered Data Science Systems


125. Agent-Native Telemetry: Verifiable State-Delta Evidence for Autonomous Operations


126. Measuring Obedience to Authority Across Large Language Models with the Milgram Paradigm


127. QUMem: Personalized Memory for Query-Conditioned User-State Inference in LLM Agents


128. Learn What’s Left, Not What’s Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization


129. CAPO: Constraint-Aware Prompt Optimization for LLM Agents


130. Walk Before You Run: The Importance of Data Exploration for Data Analysis Agents


131. From Sequence to Structure: Relational Uncertainty Propagation for LLM Agents


132. A Scalable Pipeline for LLM-Teacher Distillation Labeling: Work-Stealing Job Scheduling and Memory-Aware GPU Concurrency


133. LLMs Get Smarter from Targeted Synthetic Multilingual Data


134. Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation


135. Noesis: Bidirectional Graph-RAG with Adaptive Parallelism and Cross-Knowledge-Base Semantic Discovery


136. Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning


137. Beyond Single Object: Learning 3D Relations with Large Language Models


138. PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails


139. When Stories Evolve: Benchmarking LLM Storytelling Across Agent Architectures in Open-Ended World Simulations


140. Do Assessment Instruments Measure the Same Thing for Humans and LLMs? A Latent Structure Analysis


141. EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input


142. FluxBin: Flexible LUT-based Ultra-low-bit LLM Inference by Algorithm-Kernel Synergy


143. Kozuchi Agent: A Language-Agnostic Open-Weight Agent for Software Repair


144. ARENA: Automated Red-Teaming for Large Audio Language Models


145. Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study


146. MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration


147. Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off


148. NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models


149. ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems


150. FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge


151. Chameleon: An Adaptive AI-Driven Honeypot Architecture Using Threat-Calibrated Particle Swarm Optimization and Semantic Deception Rapidly-Exploring Random Trees


152. AudioTQ: A Data-Oblivious 6-Bit CPU Audio Codec via Randomized Hadamard Rotation and Lloyd-Max Quantization


153. SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning


154. MAPLE: MoE Adaptive Plug-and-play Layer-wise Expert allocation


155. No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage


156. Valhalla: A Layered Knowledge-State and Service-Governance Framework for Long-Term Scientific Knowledge Work


157. LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset


158. Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models


159. From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems


160. Beyond Direct Access: Resource Hijacking in LLM Agents


161. WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing


162. Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints


163. Hierarchical Agentic Incident Response with Digital-Twin-Validated Attack Inference


164. SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system


165. MetaReason: Precise Interleaved Multimodal Reasoning via Editing Meta Information for Solving Geometry Problems


166. FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making


167. RamseyGadgets: A Graph Construction Dataset for LLMs


168. The Open-Strategy Dictator Game: Cooperation Under Mutual Transparency


169. Evaluating Agentic Code Repair Capabilities in Distributed Systems


170. Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce


171. Prompting is not enough: supervised baselines and leakage control for measuring shared decision-making with LLMs in pediatric encounters


172. Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening


173. Class Imbalance and Batch Effects in LLM-Based Screening for Systematic Reviews


174. Tail-Aware Top-$k$ On-Policy Distillation


175. Domain Agnostic Text Redaction from Natural Language Rules using Instruction Tuning


176. Mitigating Rubric Interference in LLM Judges via On-Policy Self-Distillation


177. Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans


178. BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement


179. Do Uncertainty Signals Help? A Systematic Study of Uncertainty-Aware Decoding with Rollback Mechanisms


180. DeMTS: Denoising Trajectories as Multivariate Time Series for Hallucination Detection in Diffusion Language Models


181. Characterizing Rhetorical Misalignment in Decision-Making with Language Models


182. Inference-Time Mitigation of Adversarial Political Bias in Large Language Models


183. LLM Safety Alignment in Low-Resource Languages: A Systematic Literature Review


184. Local AI pre-screening for human triple-blind peer review in health sciences



186. Calibrated Trust, Not Sharper Prediction: An Empirical Test of Uncertainty Fusion


187. DumpsterCluster: From Dumpster Diving to Serving LLaMA-70B on $60 GPUs


188. Plausible but Not Valid: A Psychometric Audit of LLMs as Synthetic Survey Respondents


189. Wiola 13M, a Gated Spiral Attention Architecture for Parameter Efficient Small Language Models


190. Efficient Block-Layer Parallel Inference for Vision-Language-Action on Hybrid Architectures


191. HarmProfile: Characterizing Harmful Distributions in Frontier LLMs


192. WARA: Toward Automated Wireless Optimization Research with Closed-Loop LLM Agents


193. Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation)