LLM 관련 주요 논문 - 2026-06-05

1. MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery


2. Benchmark Everything Everywhere All at Once


3. Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents


4. Agent Memory: Characterization and System Implications of Stateful Long-Horizon Workloads


5. Humans’ ALMANAC: A Human Collaboration Dataset of Action-Level Mental Model Annotations for Agent Collaboration


6. An Infectious Disease Spread Simulation Based on Large Language Model Decision Making


7. TokenMizer: Graph-Structured Session Memory for Long-Horizon LLM Context Management


8. LLM Self-Recognition: Steering and Retrieving Activation Signatures


9. ToolChoiceConfusion: Causal Minimal Tool Filtering for Reliable LLM Agents


10. RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention


11. From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents


12. Evaluating Agentic Configuration Repair for Computer Networks


13. Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems


14. CogManip: Benchmarking Manipulative Behavior in Multi-Turn Interactions with Large Language Model


15. Beyond Semantic Organization: Memory as Execution State Management for Long-Horizon Agents


16. Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation


17. When Should Memory Stay Silent: Measuring Memory-Use Boundaries in Memory-Augmented Conversational Agents


18. Beyond Similarity: Trustworthy Memory Search for Personal AI Agents


19. Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents


20. RedditPersona: A Modular Framework for Community-Conditioned LLM Adaptation from Reddit


21. Beyond Vector Similarity: A Structural Analysis of Graph-Augmented Retrieval for Industrial Knowledge Graphs


22. The Self-Correction Illusion: LLMs Correct Others but Not Themselves


23. Towards World Models in Biomedical Research


24. Retrospective Harness Optimization: Improving LLM Agents via Self-Preference over Trajectory Rollouts


25. QCFuse: Query-Aware Cache Fusion via Compressed View for Efficient RAG Serving


26. Agentic Molecular Recovery via Molecule-Aware Exploration


27. Statistical Priors for Implicit Preferences: Decoupling Skill Selection as a Local Harness in Personal Agents


28. When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents


29. From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents


30. Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation


31. When AI Says It Feels


32. Critic-Guided Heterogeneous Multi-Agent Reasoning for Reliable Mathematical Problem Solving


33. Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models


34. PerceptUI: LLM Agents as Human-Aligned Synthetic Users for UI/UX Evaluation


35. Beyond Output Matching: Preserving Internal Geometry in NVFP4 LLM Distillatio


36. Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows


37. Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments


38. FIDES: Faithful Inference via Deep Evidence Signals for Retrieval-Memory Conflict in RAG


39. Answer Presence Drives RAG Rewriting Gains


40. Evaluation of LLMs for Mathematical Formalization in Lean


41. Self-Commitment Latency: A Reward-Free Probe for Prompted Implicit Hacking


42. Safety Paradox: How Enhanced Safety Awareness Leaves LLMs Vulnerable to Posterior Attack


43. Multilingual Fine-Tuning via Localized Gradient Conflict Resolution


44. GuardNet: Ensemble Strategies of Shallow Neural Networks for Robust Prompt Injection and Jailbreak Detection


45. SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations


46. EpiEvolve: Self-Evolving Agents for Streaming Pandemic Forecasting under Regime Shifts


47. Severity-Aware Curriculum Learning with Multi-Model Response Selection for Medical Text Generation


48. Step-by-Step Optimization-like Reasoning in LLMs over Expanding Search Spaces


49. PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage


50. Brick-Composer: Using MLLMs for Assembly with Diverse Bricks


51. Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison


52. Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models


53. Mutation Without Variation: Convergence Dynamics in LLM-Driven Program Evolution


54. Harnessing Generalist Agents for Contextualized Time Series


55. Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges


56. What Should Agents Say? Action-state Communication for Efficient Multi-Agent Systems


57. How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment


58. Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution


59. RREDCoT: Segment-Level Reward Redistribution for Reasoning Models


60. Self-Augmenting Retrieval for Diffusion Language Models


61. PC Layer: Polynomial Weight Preconditioning for Improving LLM Pre-Training


62. Will the Agent Recuse Itself? Measuring LLM-Agent Compliance with In-Band Access-Deny Signals


63. HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes


64. EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models


65. F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation


66. Subspace-Aware Sparse Autoencoders for Effective Mechanistic Interpretability


67. Learning What to Forget: Improving LLM Unlearning via Learned Token-Level Importance


68. LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs


69. Adapting Diffusion Language Models for Lossless Pixel-Level Image Transmission


70. DAST: A VLM-LLM Framework for Cross-Interface Anomaly Detection in O-RAN


71. OneReason Technical Report


72. TOKI: A Bitemporal Operator Algebra for Contradiction Resolution in LLM-Agent Persistent Memory


73. Design a Reliable LLM-Integrated Interface for Mortality Forecasting


74. Towards the Readability of LLM-Generated Codes through Multitask Representation Engineering


75. Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs


76. Improving Answer Extraction in Context-based Question Answering Systems Using LLMs


77. Learning to Route LLMs from Implicit Cost-Performance Preferences via Meta-Learning


78. TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation


79. OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation


80. LatentSkill: From In-Context Textual Skills to In-Weight Latent Skills for LLM Agents


81. On Advantage Estimates for Max@K Policy Gradients


82. EGTR-Review: Efficient Evidence-Grounded Scientific Peer Review Generation via Multi-Agent Teacher Distillation


83. OPRD: On-Policy Representation Distillation


84. Measuring the sensitivity of LLM-based structured extraction to prompt, model, and schema choices in clinical discharge summaries


85. Causal Scaffolding for Physical Reasoning: A Benchmark for Causally-Informed Physical World Understanding in VLMs


86. Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach


87. Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation (long version)


88. Staying with the Uncertainty: Uncertainty-Scaffolding Strategies for Artificial Moral Advisors in LLM-to-LLM Simulated Conversations


89. LLMCodec: Adapting Video Codecs for Efficient Weight Compression of Large Language Models


90. GenTI: Benchmarking LLMs for Autonomous IDPS Rule Generation for Unseen Attacks


91. Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads


92. Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models


93. Emotion-Aware Image Generation from Korean Diary Text via LLM-based Prompt Translation and LoRA Fine-Tuning


94. CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement


95. DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models


96. UNIVID: Unified Vision-Language Model for Video Moderation


97. Microskill Architecture: A Modular Skill-Driven Framework for AI-Native Code Generation


98. LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video


99. Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval


100. Enhancing Software Engineering Through Closed-Loop Memory Optimization


101. When New Generators Arrive: Lifelong Machine-Generated Text Attribution via Ridge Feature Transfer


102. SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks


103. The End of Software Engineering: How AI Agents Are Fundamentally Restructuring the Software Paradigm


104. Cross-Epoch Adaptive Rollout Optimization for RL Post-Training


105. ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer


106. Noise-Aware Visual Representation Learning for Medical Visual Question Answering


107. Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models


108. Exploring LLMs for South Asian Music Understanding and Generation


109. Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models


110. Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval


111. When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories


112. Trust, but Don’t Verify: Epistemic Blind Spots in LLM Source Evaluation


113. ReasoningFlow: Discourse Structures for Understanding LLM Reasoning Traces


114. Willing but Unable: Separating Refusal from Capability in Code LLMs via Abliteration


115. VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents


116. Pattern Selectivity is Not Task-Causal Structure: A Cross-Architecture Mechanistic Study of Composed-Task Circuits in 1B-Class Language Models


117. A Taxonomy of Runtime Faults in Model Context Protocol Servers


118. A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing


119. LoRi: Low-Rank Distillation for Implicit Reasoning


120. Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference


121. Agentic Monte Carlo: Simulating Reinforcement Learning for Black-Box Agents


122. Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation


123. From Attack Simulation to SIEM Rule: Deterministic Detection-as-Code Synthesis with Probe-Level Traceability


124. Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation


125. Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature


126. Temporal Preference Concepts and their Functions in a Large Language Model


127. Geographic Bias and Diversity in AI Evaluation


128. The Granularity Gap: A Multi-Dimensional Longitudinal Audit of Sycophancy in Gemini Models


129. From Scoring to Explanations: Evaluating SHAP and LLM Rationales for Rubric-based Teaching Quality Assessment


130. MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models


131. PEFT of SLM for Telecommunications Customer Support: A Comparative Study of LoRA Configurations with Energy Consumption Analysis


132. Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO