LLM 관련 주요 논문 - 2026-05-28

1. CORE: Contrastive Reflection Enables Rapid Improvements in Reasoning


2. Multi-Adapter Representation Interventions via Energy Calibration


3. LiveBrowseComp: Are Search Agents Searching, or Just Verifying What They Already Know?


4. Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor


5. The Importance of Being Statistically Earnest: A Critical Re-evaluation of GSM-Symbolic


6. TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning


7. An LLM-Based Assistance System for Intuitive and Flexible Capability-Based Planning


8. The Ethics of LLM Sandbox and Persona Dynamics


9. Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation


10. LACUNA: Safe Agents as Recursive Program Holes


11. Satisfiability Solving with LLMs: A Matched-Pair Evaluation of Reasoning Capability


12. MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation


13. Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns


14. A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks


15. Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations


16. Cultural Binding Heads in Language Models


17. Entropy-aware Masking for Masked Language Modeling


18. Let Relations Speak: An End-to-End LLM-GNN Soft Prompt Framework for Fraud Detection


19. GS-FUSE: Granger-Supervised Gated Fusion and Multi-Granularity Alignment for Event-Driven Financial Forecasting


20. ProvMind: Provenance-grounded reasoning for materials synthesis


21. From Learning Resources to Competencies: LLM-Based Tagging with Evidence and Graph Constraints


22. Diffusion Large Language Models for Visual Speech Recognition


23. DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy Prefixes


24. Efficient Post-training of LLMs for Code Generation With Offline Reinforcement Learning


25. HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs


26. Mechanistically Interpreting the Role of Sample Difficulty in RLVR for LLMs


27. Prompt Codebooks: Discrete Compositional Optimization for Language Model Instruction Refinement


28. From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets


29. Plan Before Search: Search Agents Need Plan


30. FedMPT: Federated Multi-label Prompt Tuning of Vision-Language Models


31. SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models


32. Better Accuracies, Worse Reasoning: A Step-Level Audit of Medical Chain-of-Thought Distillation


33. Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning


34. Entropy Distribution as a Fingerprint for Hallucinations in Generative Models


35. When Does Memory Help Multi-Trajectory Inference for Tool-Use LLM Agents?


36. Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers


37. Learning When to Optimize: Verified Optimization Skills from Expert GPU-Kernel Lineages


38. Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents


39. Localizing Input Uncertainty Quantification for Large Language Models via Shapley Values


40. OccuReward: LLM-Guided Occupant-Centric Reward Shaping for Demographic Equity in Grid-Interactive Buildings


41. Look on Demand: A Cognitive Scheduling Framework for Visual Evidence Acquisition in Multimodal Reasoning


42. OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents


43. Deconstructing Spatial Complexity: Hierarchical Decomposition for LLM Spatial Reasoning


44. Data-Efficient On-Policy Distillation for Automatic Speech Recognition


45. CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models


46. Human-like in-group bias in instruction-tuned language model agents


47. Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification


48. Training Stratigraphy: Persistent Behavioral Artifacts in Large Language Models Observed Through Longitudinal AI-Human Interaction


49. Examining Agents’ Bias Amplification versus Suppression in Multi-Agent Systems


50. MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing


51. ZipRL: Adaptive Multi-Turn Context Compression with Hindsight Response Replay


52. MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation


53. PetroBench: A Benchmark for Large Language Models in Petroleum Engineering


54. MIRA: A Bilingual Benchmark for Medical Information Response Audit


55. Confidence-Orchestrated Self-Evolution against Uncertain LLM Feedback


56. Zipping the Thought: When and How Compressed Reasoning Data Works in LLM Post-Training


57. Reward Bias Substitution: Single-Axis Bias Mitigations Redirect Optimization Pressure


58. AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios


59. STAB: Specification-driven Testing for Algorithmic Bottlenecks


60. Geometry of Human Perceptual Domains Emerges Transiently in LLM Representations


61. Do Agents Think Deeper? A Mechanistic Investigation of Layer-Wise Dynamics in Sequential Planning


62. Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows


63. SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats


64. SKILLC: Learning Autonomous Skill Internalization in LLM Agents via Contrastive Credit Assignment


65. A Unified Framework for the Evaluation of LLM Agentic Capabilities


66. PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management


67. Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness


68. AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models


69. FundaPod: A Multi-Persona Agent Pod Platform with Knowledge Graph Memory for AI-Assisted Fundamental Investment Research


70. C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning


71. MolLingo: Molecule-Native Representations for LLM-Powered Scientific Agents


72. When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models


73. Revealing Algorithmic Deductive Circuits for Logical Reasoning


74. A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test


75. A Query Engine for the Agents


76. Diagnosing Live Within-Policy Instruction Conflicts in LLM Agents with Witnessed Resolution Profiles


77. Got a Secret? LLM Agents Can’t Keep It: Evaluating Privacy in Multi-Agent Systems


78. PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft


79. SkillGrad: Optimizing Agent Skills Like Gradient Descent


80. Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration


81. A Policy-Driven Runtime Layer for Agentic LLM Serving


82. Prefix-Safe Bayesian Belief Tracking for LLM Reasoning Reliability:Separating Calibration from Ranking


83. DeepSciVerify: Verifying Scientific Claim–Citation Alignment via LLM-Driven Evidence Escalation


84. Hierarchical Prompt-Domain Control and Learning for Resource-Constrained Agentic Language Models


85. Cross-Entropy Games and Frost Training


86. Voluntary Collusion with Secret Tools in Competing LLM Agents


87. Discovery Agents for Real-Time Analytics: Toward Proactive Insight Systems


88. LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation


89. Why LLMs Fail at Causal Discovery and How Interventional Agents Escape


90. DynaSchedBench: Calibrated Dynamic Scheduling Benchmarks and Observability Paradox in LLM-based Scheduling Agents


91. Soro: A Lightweight Foundation Model and Chatbot for Tajik


92. Identifying and Understanding Human Values in Text: A Tailorable LLM-based Architecture


93. OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration


94. Skill-Conditioned Gated Self-Distillation for LLM Reasoning


95. Do Agents Need Semantic Metadata? A Comparative Study in Agentic Data Retrieval


96. Rethinking Memory as Continuously Evolving Connectivity


97. Reverse Probing: Supervised Token-level Uncertainty Quantification for Large Language Models in Clinical Text


98. MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems


99. Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study


100. Sense Representations Are Inducible Interfaces


101. The Attentional White Bear Effect in Transformer Language Models


102. Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking


103. Measuring Form and Function in Language Models


104. Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification


105. Evaluating the Realism of LLM-powered Social Agents: A Case Study of Reactions to Spanish Online News


106. Position: Retire the “Positive Backdoor” Label – Secret Alignment Requires Strict and Systematic Evaluation


107. SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving


108. Efficient Pre-Training of LLMs through Truncated SVD Layers


109. Semantic Optimal Transport for Sparse Autoencoder Feature Matching and Circuit Compression


110. Token Optimization Strategies for LLM-Based Oracle-to-PostgreSQL Migration


111. Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation


112. Efficient and Scalable Provenance Tracking for LLM-Generated Code Snippets


113. Functional Entropy: Predicting Functional Correctness in LLM-Generated Code with Uncertainty Quantification


114. SSR3D-LLM: Structured Spatial Reasoning via Latent Steps for Fine-Grained Grounding in Unified 3D-LLMs


115. Learning the Error Patterns of Language Models


116. Multi-Agent LLM-based Metamorphic Testing for REST APIs


117. Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models


118. Revisiting Anthropomorphic Reflection Markers in Large Language Model Reasoning


119. How Far Can Disaggregation Go? A Design-Space Exploration of Attention-FFN Disaggregation for Efficient MoE LLM Serving


120. PrunePath: Towards Highly Structured Sparse Language Models


121. IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage


122. VidPrism: Heterogeneous Mixture of Experts for Image-to-Video Transfer


123. Pruning and Distilling Mixture-of-Experts into Dense Language Models


124. Whose Name Comes Up? III: Persona Prompting Effects in LLM-Based Scholar Recommendation



126. DEPART: DEcomposing PARiTy across Multilingual LLMs


127. DeltaMCP: Incremental Regeneration via Spec-Aware Transformation for MCP servers



129. MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content


130. SMILE-Next: Teaching Large Language Models to Detect, Classify, and Reason about Laughter


131. PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting


132. Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts


133. Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts


134. SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection


135. MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models


136. Integrated and Cross-Architecture Interpretation of LLM Reasoning


137. Tool Forge: A Validation-Carrying Toolchain for Governed Agentic Execution


138. Where Does Toxicity Live? Mechanistic Localization and Targeted Suppression in Language Models


139. KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs


140. Periodic RoPE for Infinite Context LLMs


141. Semantic Flow Regularization: Teaching LLMs to Generate Diverse Yet Coherent Responses


142. Multi-Teacher Knowledge Distillation via Teacher-Informed Mixture Priors


143. ROVER: Routing Object-Centric Visual Evidence for Grounded Multi-Image Reasoning


144. Pressure-Testing Deception Probes in LLMs: Scaling, Robustness, and the Geometry of Deceptive Representations


145. When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?


146. Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking


147. The Fragility of Chain-of-Thought Monitoring Across Typologically Diverse Languages


148. VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild


149. Fine-Tuned LLM as a Complementary Predictor Improving Ads System


150. FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation


151. Snippet-Driven Supply Chain Discovery with LLMs: Scaling Visibility in China


152. Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security


153. ChildEval: When large language models meet children’s personalities


154. Locality-Aware Redundancy Pruning for LLM Depth Compression


155. Do Models Know Why They Changed Their Mind? Interpretability and Faithfulness of Chain-of-Thought Under Knowledge Conflict


156. UniMaia: Steering Chess Policies with Language for Human-like Play


157. Restoring the Sweet Spot: Pass-Rate Weighted Self-Distillation for LLM Reasoning


158. Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought


159. Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions


160. CiteCheck: Retrieval-Grounded Detection of LLM Citation Hallucinations in Scientific Text


161. Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting


162. Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression



164. Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks


165. The Future of Facts: Tracing the Factual Generation-Verification Gap


166. Detection Without Correction: A Two-Parameter Decomposition of Multi-Stage LLM Pipelines


167. Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?


168. Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems


169. HARP: Measuring Harm Amplification in Multi-Agent LLM Systems


170. BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Serving


171. AssertLLM2: A Comprehensive LLM Benchmark for Assertion Generation from Design Specifications


172. AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems


173. When prompt perturbations break your A/B test: A valid statistical test for generative surveying


174. Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval


175. RAGe: A Retrieval-Augmented Generation Evaluation Framework


176. A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations


177. MGRetrieval: Memory-Guided Reflective Retrieval for Long-Term Dialogue Agents


178. When NPUs Are Not Always Faster: A Stage-Level Analysis of Mobile LLM Inference


179. FD-RAG: Federated Dual-System Retrieval-Augmented Generation


180. Ocean4Rec: Offline LLM-Derived OCEAN Profiles for Request-Time VOD Reranking


181. Ligand-Conditioned Discrete Diffusion for Protein Sequence-Structure Co-Design


182. Smaller, Younger, and More Impactful: How AI-Assisted Writing Transforms Research Teams


183. LLM-assisted sentiment analysis for integrated computational and qualitative mixed methods education research: A case study of students’ written reflection assignments


184. REC-CBM: Rubric-Aware Error-Correction Concept Bottleneck Models for Trustworthy Open-Ended Grading


185. Using Zero-Shot LLM-Generated Survey Data for Geographically Explicit Population Synthesis


186. Informing AI Policy Assessment using Large-Scale Simulation of Interventions


187. StoryMI: Steerable Multi-Agent Therapeutic Dialogue Generation


188. EvoSpec: Evolving Speculative Decoding via Real-Time Vocabulary and Parameter AdaptationTarget


189. Modeling Community Attitude through Reaction Tone: A Human-AI Collaborative Framework for Evaluating LLM Alignment with Linguistic Behaviors in Online Communities


190. From AR to Diffusion: Efficiently Adapting Large Language Models with Strictly Causal and Elastic Horizons


191. Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models


192. BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking


193. RAG-Coding: Enhancing LLM Medical Coding with Structured External Knowledge