LLM 관련 주요 논문 - 2026-06-02

1. SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment


2. Bridging the Last Mile of Time Series Forecasting with LLM Agents


3. RASER: Recoverability-Aware Selective Escalation Router for Multi-Hop Question Answering


4. Iteris: Agentic Research Loops for Computational Mathematics


5. MCP-Persona: Benchmarking LLM Agents on Real-World Personal Applications via Environment Simulation


6. Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback


7. LLM-Evolved Pattern Generators for Optimal Classical Planning


8. Bridging the Sim-to-Real Gap in Semiconductor Visual Program Synthesis via Input Binarization


9. AgentPLM: Agentic Protein Language Models with Reasoning-Augmented Decoding for Protein Sequence Design


10. COMAP: Co-Evolving World Models and Agent Policies for LLM Agents


11. MOC: Multi-Order Communication in LLM-based Multi-Agent Systems


12. SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training


13. POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems


14. BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning


15. Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories


16. eMoT: evolving Memory-of-Thought via Symbolic Anchoring and Memory Corrosion


17. SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning


18. An NLP-Driven Framework for Curriculum-Labor Market Alignment: Schema-Constrained LLM Extraction, ESCO-Anchored Semantic Matching, and Multi-Dimensional Gap Quantification


19. Algorithmic algorithm development with LLMs: A Case Study on LLM-Usage for Contraction Order Optimization in Tensor Networks


20. SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes


21. Bayesian Spectral Emotion Transition Discovery from Multi-Annotator Disagreement


22. Absorbing Complexity: An Interaction-Native Knowledge Harness for Financial LLM Agents


23. WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis


24. Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction


25. CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback


26. Consistency evaluation of benchmarks used for causal discovery


27. TriAlign: Towards Universal Truth Consistency in Personalized LLM Alignment


28. TrafficRAG: A Multimodal RAG Framework for Traffic Accident Liability Determination


29. Evidence-Gated LLM Priors for Multi-Objective Bayesian Optimization


30. MobEvolve: An Agentic Self-Evolving Heuristic System for Interpretable Human Mobility Generation


31. ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL


32. Revisiting Ripple Effects in Knowledge Editing through Pressure-Aware Joint Neighborhood Optimization


33. S-SPPO: Semantic-Calibrated Self-Play Preference Optimization


34. RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents


35. Joint Agent Memory and Exploration Learning via Novelty Signals


36. Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts


37. Don’t Ask the LLM to Track Freshness: A Deterministic Recipe for Memory Conflict Resolution


38. Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems


39. GuidaPA: Privacy-Preserving Chatbot for Public Administration via Federated Learning


40. Early Diagnosis of Wasted Computation in Multi-Agent LLM Systems via Failure-Aware Observability


41. Recognize Your Orchestrator: An Entropy Dynamics Perspective for LLM Multi-Agent Systems


42. SIRIUS-SQL: Anchoring Multi-Candidate Text-to-SQL in Execution Feedback


43. HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation


44. The Shape of Wisdom: Decision Trajectories in Language Models


45. Can LLM Agents Sustain Long-Horizon Organizational Dynamics?


46. Expected Value Alignment for Generative Reward Modeling in Formal Mathematics Verification


47. Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches


48. SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision


49. Diagnosing LLM Arbitration Behavior over Pre-evidence Epistemic States in RAG-based Fact-Checking


50. DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts


51. AnyEdit++: Adaptive Long-Form Knowledge Editing via Bayesian Surprise


52. TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents


53. TriLens: Per-Layer Logit-Lens Entropy for White-Box Hallucination Detection


54. Tackling the Root of Misinformation by Teaching Laypeople about Logical Fallacies via Socratic Questioning and Critical Argumentation


55. Subliminal Learning Is Steering Vector Distillation


56. Large Language Models in Transportation Systems Management and Operations: From Text Reasoning to Multi-modal Decision Support


57. Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition


58. Relational Intervention During Functional Collapse in Large Language Models: A Lexical-Statistical Ablation and a Structure x Register Factorial


59. Adversarial Feeds Steer LLM Agent Decisions Against Their Defaults


60. Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers


61. Subliminal Learning is a LoRA Artifact


62. Mitigating Hallucinations in Large Language Models Via Decoder Layer Skipping



64. CoMIC: Collaborative Memory and Insights Circulation for Long-Horizon LLM Agents in Cloud-Edge Systems


65. Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs


66. LLM-Driven Co-Evolutionary Automated Heuristic Design for Bi-Component Coupled Combinatorial Optimization


67. MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition


68. AXIOM: A Trust-First Neuro-Symbolic Execution Architecture for Verifiable Mathematical Reasoning


69. ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment


70. Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs


71. TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety


72. PropLLM: Propagation-Aware Scene Reconstruction for Network Fault Diagnosis


73. Probe Before You Edit: Probing-Guided Molecular Optimization for LLM Agents in Structure-Based Drug Design


74. KACE: Knowledge-Adaptive Context Engineering for Mathematical Reasoning


75. Threshold-Based Exclusive Batching for LLM Inference


76. Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents


77. SDR: Set-Distance Rewards for Radiology Report Generation


78. Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight


79. VESTA: Visual Exploration with Statistical Tool Agents


80. From “Weak” Signals to Strong Models: Preference Delta Aggregation with LoRA Merging


81. Coupling Language Models with Physics-based Simulation for Synthesis of Inorganic Materials


82. Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture


83. Evaluating Bivariate Causal Statements Based on Mutual Compatibility



85. Capability Self-Assessment: Teaching LLMs to Know Their Limits


86. MindZero: Learning Online Mental Reasoning With Zero Annotations


87. CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO


88. A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems


89. Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games


90. Grokers: Bottom-Up Inductive Comprehension and Write-Time Intelligence over Typed Knowledge Graphs


91. MindGames Arena Generalization Track: In2AI Solution with Delayed Per-Step Reward Attribution


92. Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis


93. Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling


94. AdaCodec: A Predictive Visual Code for Video MLLMs


95. From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression


96. SimSD: Simple Speculative Decoding in Diffusion Language Models


97. Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events


98. Learning When to Translate for Multilingual Reasoning


99. MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence


100. PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning


101. ODTQA-FoRe: An Open-Domain Tabular Question Answering Dataset for Future Data Forecasting and Reasoning


102. Not All Errors Are Equal: A Systematic Study of Error Propagation in Large Language Model Inference



104. AutoForest: Automatically Generating Forest Plots from Biomedical Studies with End-to-End Evidence Extraction and Synthesis


105. Policy and World Modeling Co-Training for Language Agents


106. SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence


107. When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures


108. Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment


109. SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents


110. Cross-modal linkage risk in clinical vision-language models


111. Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025


112. AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations


113. Consistency Training while Mitigating Obfuscation via Rate Matching


114. Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis


115. Jailbreaking Multimodal Large Language Models using Multi-Clip Video


116. The Role of Ambiguity in Error Prediction via Uncertainty Quantification


117. PlanarBench: Evaluating LLM Spatial Reasoning via Planar Graph Drawing


118. MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?


119. A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision


120. KliniskVestBERT: BERT Model Specialised to Norwegian Clinical Texts


121. The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue


122. RadioMaster: Multi-Agent System for Autonomous Radio Signal Generation


123. Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses


124. LayerRoute: Input-Conditioned Adaptive Layer Skipping via LoRA Fine-Tuning for Agentic Language Models


125. Dynamic Trust-Aware Sparse Communication Topology for LLM-Based Multi-Agent Consensus


126. “I’ve Seen How This Goes”: Characterizing Diversity via Progressive Conditional Surprise


127. ProbeScale: Probing Analysis to Optimize Neural Scaling Laws for Efficient Small Language Model Inference


128. MOSS-Audio Technical Report


129. Multilinguality of Large Language Models From a Structural Perspective


130. STaR-KV: Spatio-Temporal Adaptive Re-weighting for KV Cache Compression in GUI Vision-Language Models


131. Breaking the Information Silo: Semantic Personas for Cross-Domain Recommendation


132. FLARE: Diffusion for Hybrid Language Model


133. Adaptive Auto-Harness: Sustained Self-Improvement for Agentic System Deployment on Open-Ended Task Streams


134. Construction of Historical Knowledge Graphs Based on BERT and Graph Neural Networks


135. THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models


136. Argument Collapse: LLMs Flatten Long-Form Public Debate


137. Shortcut to Nowhere: Demystifying Deep Spurious Regression


138. Two-Fidelity Best-Action Identification for Stochastic Minimax Tree


139. JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions


140. Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning


141. DOT-MoE: Differentiable Optimal Transport for MoEfication


142. Easier to Mislead Than to Correct: Harmful and Beneficial Revision in LLM Conformity


143. AlphaToken: Decoupling Adaptation and Stability for Path-Aware Response Token Valuation in LLM Post-Training


144. EvoPool: Evolutionary Programmatic Annotation for Label-Efficient Specialized Supervision


145. TechGraphRAG: An Agentic Graph-Augmented RAG Framework for Technical Literature Reasoning


146. Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents


147. Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents


148. On the Limits of Token Reduction for Efficient Unified Vision Language Training


149. TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning


150. LLM Consortium for Software Design Refinement: A Controlled Experiment on Multi-Agent Collaboration Topologies


151. Hierarchical Online Prompt Mutation with Dual-Loop Feedback for Guardrailed Evidence Document Generation: A Production-Evaluation Case Study


152. Consistent and Distinctive: LLM Benchmark Efficiency via Maximum Independent Set Prompt Selection on Similarity Graphs


153. Dr. DocBench: A Comprehensive Benchmark for Expert-Level and Difficult Document Parsing


154. Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory


155. Efficient Exploration for Iterative Nash Preference Optimization


156. Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics


157. Needles at Scale: LLM-Assisted Target Selection for Windows Vulnerability Research


158. TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages


159. A Communication-Centric 6G-LLM Architecture for Scalable Tactical Autonomous Defense Vehicle Networks


160. SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories


161. Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning


162. BenchEvolver: Frontier Task Synthesis via Solution-Centric Evolution


163. RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning


164. IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages


165. Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization


166. Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs


167. Implicit Geographic Inference in LLM Medical Triage: Language-Driven Disparities in Emergency Recommendations


168. CA-BED: Conversation-Aware Bayesian Experimental Design


169. When Data Is Scarce: Scaling Sparse Language Models with Repeated Training


170. Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context


171. MiCU: End-to-End Smart Home Command Understanding with Large Language Model


172. ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks


173. MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models


174. 3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code


175. Plausibility Is Not Prediction: Contrastive Evidence for LLM-Based Cellular Perturbation Reasoning


176. OPD+: Rethinking the Advantage Design for On-Policy Distillation


177. DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs


178. ProductWebGen: Benchmarking Multimodal Product Webpage Generation


179. Hybrid Verified Decoding: Learning to Allocate Verification in Speculative Decoding


180. PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects



182. FVSpec: Real-World Property-Based Tests as Lean Challenges


183. An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation


184. Lodestar: An Online-Learning LLM Inference Router


185. Accuracy, Stability, and Repeated-Run Reliability of Large Language Models on Deterministic Programming Tasks


186. MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models


187. Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling


188. Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated


189. GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing


190. SkillPager: Query-Adaptive Intra-Skill Navigation via Semantic Node Retrieval


191. Certificates without Electrons? Theory and Evidence on Impacts from AI-Driven Power Demand


192. WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering


193. EPIC: Efficient and Parallel Inference under CFG Constraints for Diffusion Language Models


194. Information-Theoretic Lower Bounds for Bit-Constrained Stochastic Optimization via a Reduction to Compressed Gaussian Mean Estimation


195. The Paradox of Outcome Optimization: A Causal Information-Theoretic Bound on Reasoning Shortcuts in LLMs


196. Scaling Behavior of Single LLM-Driven Multi-Agent Systems


197. MESA: Improving MoE Safety Alignment via Decentralized Expertise


198. Pause and Think: A Dataset and Benchmark for Video-Grounded Assistive Action Suggestion


199. Linguistics-Aware Non-Distortionary LLM Watermarking


200. MemGraphRAG: Memory-based Multi-Agent System for Graph Retrieval-Augmented Generation


201. SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering


202. Revisiting Parameter-Based Knowledge Editing in Large Language Models: Theoretical Limits and Empirical Evidence


203. CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery


204. CodeCytos: AI-assisted spatial molecular imaging analysis via code-augmented agent action space


205. On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance


206. Short-form Text Rewriting with Phi Silica


207. When Safe Skills Collide: Measuring Compositional Risk in Agent Skill Ecosystems


208. Detect Before You Leap: Mirage Detection in Vision-Language Models


209. AgentxGCore: Agentic AI for Next-Generation Mobile Core Network


210. A Distribution-Free Framework for Rewrite-Based Human-text Detection via Knockoff Filtering


211. PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning


212. Detector-Evasive LLM Paraphrasing via Constrained Policy Optimization


213. Zamba2-VL Technical Report


214. Agentic Authoring of Interactive Multiview Visualizations in Genomics


215. Isolating LLM Lexical Bias: A Curation-Free Triangulated Metric for Preference-Stage Learning


216. LLMs Need Encoders for Semantic IDs Too


217. How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval


218. Rethinking the Role of Temperature in Large Language Model Distillation


219. Bridging Reasoning Trajectories in On-Policy Distillation via Near-Future Guidance


220. Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems


221. Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models


222. StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement


223. ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate


224. Effects of Varying LLM Access on Essay Writing Behavior


225. Continuous Reasoning for Vision-Language-Action


226. BAGEN: Are LLM Agents Budget-Aware?


227. Learning to Construct Practical Agentic Systems


228. DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning


229. A Protocol-Language Model for Network Intrusion (Without Deep Packet Inspection)


230. Benchmarking Multimodal LLMs on Code Generation for Complex Interactive Webpages


231. PrivacyPeek: Auditing What LLM-Based Agents Acquire, Not Just What They Say


232. Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models


233. StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning