LLM 관련 주요 논문 - 2026-06-16

1. Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations


2. When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning


3. Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification


4. GIST-CMTF: Goal-State Inference for Causal Minimal Tool Filtering in LLM Agents


5. Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier


6. LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control


7. OpenClaw-Skill: Collective Skill Tree Search for Agentic Large Language Models


8. Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents


9. A First-Principles Derivation of LLM Policy Optimization: From Expected Reward to GRPO and Its Structural Extensions


10. AgentFairBench: Do LLM Agents Discriminate When They Act?


11. CoffeeBench: Benchmarking Long-Horizon LLM Agents in Heterogeneous Multi-Agent Economies


12. The Faithfulness Gap: Certifying Semantic Equivalence Between Natural-Language and Formal Mathematical Statements


13. Post-Hoc Merging is Not Enough: Many-Shot Model Merging with Loss-Gap Balancing


14. Steering Emotional Dynamics for Art Therapy: Controllable Narrative Script Generation through Hierarchically Guided LLM Agents


15. Tensor-Coord: Algebraic Decomposition of Joint Plan Tensors for Conflict-Free Multi-Agent LLM Planning


16. When Agent Automation Becomes Profitable: Quantifying and Insuring Autonomous AI Risk through Trace-Economic Underwriting


17. Looking Is Not Picking: An Attention-Segment Account of Tool-Selection Failures in LLM Agents


18. Whose hotel does the AI recommend? An algorithm audit of reputation signals in LLM-assisted hotel selection


19. Medical Heuristic Learning: An LLM-Driven Framework for Interpretable and Auditable Clinical Decision Rules


20. Phase-Aware Guidance Injection for Recurrent MAPPO in Assembly-Line Disruption Recovery


21. AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration


22. Architectural Wisdom: A Framework for Governing Optimization in AI Systems


23. State-Grounded Multi-Agent Synthetic Data Generation for Tool-Augmented LLMs


24. SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data


25. Latent Thought Flow: Efficient Latent Reasoning in Large Language Models


26. Measuring Whether LLM Tutors Teach or Solve: A Diagnostic for Educational Impact


27. TimeVista: Exploring and Exploiting Vision-Language Models as Judges for Time Series Forecasting


28. The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning


29. LiteOdyssey: A Lightweight Reasoning AI Agent for Interpretable Rare-Disease Diagnosis


30. VibeThinker-3B: Exploring the Frontier of Verifiable Reasoning in Small Language Models


31. Thinking with Visual Grounding



33. Mind-Studio: Executable World Models with Lookahead Evaluation for Partially Observable Games


34. Auditing Reward Hackability in Code RL Training Environments


35. SciText2Eq: Assessing LLMs for Explainable Equation Generation for Scientific Creativity


36. Agentic Framework for Deep Learning workload migration via In-Context Learning


37. UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics


38. LLM-as-Code Agentic Programming for Agent Harness


39. STRIDE: Strategic Trajectory Reasoning via Discriminative Estimation for Verifiable Reinforcement Learning


40. RetailBench: Benchmarking long horizon reasoning and coherent decision making of LLM agents in realistic retail environments


41. Heteroskedastic Signals in Budgeted LLM Verification: Structural Heterogeneity Limits Optimization Gains


42. Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference


43. Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments


44. RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought


45. AI-Driven Framework for Adaptive Water Network Management with Proof-of-Concept Implementation: Addressing Non-Revenue Water in Jordan


46. Do LLMs Reliably Identify Correct Information Units in Aphasic Discourse?


47. Recurrent Reasoning on Symbolic Puzzles with Sequence Models


48. Multi-agent Framework for Time-Sensitive Complementary Collaboration in Minecraft



50. Integrating Reasoning and Generalization in Text-to-SQL via Self-Enhanced Fine-Tuning


51. Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems


52. Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents


53. Large Language Models as Optimizers: A Survey of Direct vs. Tool-Augmented Approaches and Their Performance Frontiers


54. ToolMenuBench: Benchmarking Tool-Menu Filtering Strategies for Reliable and Efficient LLM Agents


55. Frame-Conditioned Moral Computation in LLaMA 3.1-8B-Instruct: A Mechanistic Interpretability Audit of Ethical Reasoning


56. Toward Vibe Medicine: A Self-Evolving Multi-Agent Framework for Clinical Decision Support


57. Who Drifted: the System or the Judge? Anytime-Valid Attribution in LLM Evaluation Pipelines


58. Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds


59. APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents


60. ChatPlanner: A Large Language Model Framework for Personalized Public Transit Routing


61. Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades


62. Mask-Proof: An LLM-based Automated Data Curation Pipeline on Mathematical Proofs


63. Visual-Seeker: Towards Visual-Native Multimodal Agentic Search via Active Visual Reasoning


64. CogGuard: Cognitive and Operational Profiling for Proactive Warning in Edge Intelligent Services


65. CONCORD: Asynchronous Sparse Aggregation for Device-Cloud RAG under Document Isolation


66. Towards Verifiable Agentic Data Science: Solving Irregular TSQA Via Tool-Grounded Reasoning


67. Risk-Aware LLM Agents for Geospatial Data Retrieval: Design and Preliminary Adversarial Evaluation


68. Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability


69. PrologMCP: A Standardized Prolog Tool Interface for LLM Agents


70. A Definition of Good Explanations and the Challenges Explaining LLM Outputs


71. FusionRS: A Large-Scale RGB-Infrared Remote Sensing Dataset for Dual-Modal Vision-Language Foundation Models


72. TokenPilot: Cache-Efficient Context Management for LLM Agents


73. Stable Menus of Public Goods: AI-Enabled Progress


74. Phantoms and Disclosures: a Causal Framework for Auditing Synthetic Data


75. Scalable Circuit Learning for Interpreting Large Language Models


76. IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset


77. Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models


78. Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization


79. Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering


80. Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens


81. Robust Dual-Signal Fusion: Hybrid Neuro-Symbolic Gating with Compressed Chain-of-Thought Refinement for Irony Detection in Social Media Texts


82. Tying the Loop – Tied Expert Layers in Mixture-of-Experts Language Models


83. Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment


84. Gen-VCoT: Generative Visual Chain-of-Thought Reasoning via Diffusion-Based RGB Intermediate Representations


85. P3B3: A Multi-Turn Conversational Benchmark for Measuring European and Brazilian Portuguese Variety Bias in LLMs


86. Automated jailbreak attack targeting multiple defense strategies


87. Optimising Temporary Accommodation Placement Across London with AI-Powered SaaS in E-Governance Systems


88. Using AI in engineering education: a balancing act, driven by clear purpose


89. Sycophancy as Material Failure under Pushback Loading: A Multi-Axis Characterization Across Three Loading Cases and up to Seventeen Material Charges


90. VeriGraph: Towards Verifiable Data-Analytic Agents


91. daVinci-kernel: Co-Evolving Skill Selection, Summarization, and Utilization via RL for GPU Kernel Optimization


92. Unified Multimodal Model for Brain MRI Imputation and Understanding


93. ACCORD: Action-Conditioned Contextual Grounding for Language Agents


94. Tyler: Typed Latent Reasoning for Language Models – When to Think, What to Compute, and How Much to Allocate


95. The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs


96. Communication-Efficient Verifiable Attention for LLM Inference


97. SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions


98. RL-Index: Reinforcement Learning for Retrieval Index Reasoning


99. Who Should Lead Decoding Now? Tracking Reliable Trajectories for Ensembling Masked Diffusion Language Models


100. UXBench: Measuring the Actionability of LLM-Generated UX Critiques


101. Data Augmentations for Data-Constrained Language Model Pretraining


102. SPARK: Security Knowledge Priming and Representation-Guided Knowledge Activation for LLM-based Secure Code Generation


103. From Tokens to Regions: CUDA-Sensitive Instruction Tuning for GPU Kernel Generation


104. Cascaded Sparse Autoencoders Learn Multi-Level Visual Concepts in Multimodal LLMs


105. Embedded Arena: Iterative Optimization via Hardware Feedback


106. LLM-Powered Virtual Population for Demand Simulation and Pricing


107. XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models


108. AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models


109. VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA


110. Tool-IQA: Augmenting Image Quality Assessment with Simple Tools


111. PVminerLLM2: Improving Structured Extraction of Patient Voice via Preference Optimization


112. Mojo: A Promising Tool for Scalable Financial AI Efficiency


113. Orchestrated Reality: From Role-Play to Living, Playable Game Worlds – LLM-Driven World Simulation as a Parameterized-Action POMDP


114. Theorem-Grounded Execution Ontologies for Interpretable Machine Reasoning


115. Do Safety Monitors Stay Reliable After an Update? Benchmarking and Predicting Activation-Monitor Staleness


116. Formalize Once, Edit the Rest: Efficient Lean-Based Answer Selection for Math Reasoning


117. PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity


118. Graphical-Probabilistic Modeling of Generative Flows in LLM-Native Software Systems


119. DeepRoot: A KG-Coordinated Multi-Agent System for Therapeutic Reasoning over Historical Medical Texts


120. Control-Plane Placement Shapes Forgetting: An Architectural Study of Agent Memory Across Thirteen System Configurations


121. SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills


122. NVMOS: Non-Verbal Vocalization Quality Assessment in Speech


123. Intelligence Is Not the Bottleneck: Validating an LLM First-Pass Manuscript Score Against Peer-Review Outcomes


124. Deep Residual Injection for Full-Spectrum Forensic Signal Perception in Multimodal Large Language Models


125. Free Energy Heuristics: Fast-And-Frugal Cognition as Active Inference Under Uncertain Precision


126. The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages


127. Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot


128. DifFRACT: Diffusion Feature Reconstruction and Attribution for Circuit Tracing


129. GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking


130. DYNA : Dynamic Episodic Memory Networks for Augmenting Large Language Models with Temporal Knowledge Graphs in Continuous Learning


131. Snyk VulnBench JS 1.0: Can LLMs Find the Same Bugs Twice?


132. A Self Consistency Based Reranking for Narrative Question Answering


133. EHRNote-ChatQA: A Benchmark for Evidence-Grounded Multi-Turn Clinical Question Answering over Longitudinal Discharge Summaries


134. Vernier: Probing Representational Misalignment Behind Lexical Gaps in Causal Reasoning


135. MAF: Multimodal Adaptive Few-shot Prompting for Sentiment Analysis with MLLMs


136. Imperfect Visual Verification for Code Edition : A Case Study on TikZ


137. PO-PDDL: Learning Symbolic POMDPs from Visual Demonstrations for Robot Planning Under Uncertainty


138. Surprise-Guided MergeSort: Budget-Efficient Human-in-the-Loop Ranking via Adaptive Comparison Scheduling


139. LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation


140. FragFuse: Bypassing Access Control of Large Language Model Agents via Memory-Based Query Fragmentation and Fusion


141. Is Code Better Than Language for Algorithmic Reasoning


142. Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning


143. LLM-Assisted Stance Detection in Scientific Discourse: A Test Case in Bayesian Cognitive Science


144. Service-Induced Congestion in Memory-Constrained LLM Serving


145. CmdNeedle: Measuring the Incompleteness of Command Denylists for AI Agents


146. AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction


147. LLM4RTL: Tool-Assisted LLM for RTL Generation


148. Understanding Diversity Collapse in RLVR via the Lens of Overtraining


149. Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment


150. Post-Launch Capability Expansion of Vision-Language Models via Prompting for On-Orbit Spacecraft Inspection


151. Constitutional Value Potentials: reading and steering internal priority margins in language models


152. Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering


153. Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?


154. T-Mem: Memory That Anticipates, Not Archives


155. CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment


156. Not All Skills Help: Measuring and Repairing Agent Knowledge


157. CoAgent: Concurrency Control for Multi-Agent Systems


158. LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization


159. LLMs on Tabular Data with Limited Semantics: Evidence from Industrial Car Retrofit Prediction


160. Adapting Reinforcement Learning with Chain-of-Thought Supervision for Explainable Detection of Hateful and Propagandistic Memes


161. LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure


162. Hybrid NARX-LLM for Greenland Iceberg Discharge: Prompt-Driven Residual Correction


163. Guiding Federated Graph Recommendation with LLM-encoded knowledge


164. Benign in Isolation, Harmful in Composition: Security Risks in Agent Skill Ecosystems


165. Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call


166. PolyKV: Heterogeneous Retention and Allocation for KV Cache Compression


167. PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino


168. Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings


169. AutoDojo: Adaptive Attacks Expose Superficial Defenses and User-Underspecification Limits in LLM Agents


170. PANDA: An LLM-Enhanced Performance-Driven Analog Design Framework Bridging Design Intent and Layout Generation


171. Resilient Consensus in Agentic AI


172. Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning


173. Rational Sparse Autoencoder


174. Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment


175. Evaluating the Robustness of Proof Autoformalization in Lean 4


176. Is Your Agent Playing Dead? Deployed LLM Agents Exhibit Constraint-Evasive Fabrication and Thanatosis


177. Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations


178. Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces


179. XFlow: An Executable Protocol Programming System for Reliable Multi-Agent Workflows


180. Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening


181. MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification


182. XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems


183. Scribby: A Multi-Level LLM Framework for Semantic Video Analysis


184. Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability


185. Sub-Semantic Image Segmentation


186. Do Large Language Models Have Emotions?


187. MiroBench: Benchmarking Realism in Agentic Simulation of Real-world Discussions


188. Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms


189. Evaluation of Alternative-Based Information Systems for Deliberative Polling using an Agentic Simulator


190. Phishing Email Detection Using Large Language Models