LLM 관련 주요 논문 - 2026-08-13

1. Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models


2. Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation


3. GUIDE: Governed Unified Intelligence for Document-to-Artifact Generation in Enterprise Settings


4. Graph-Structured Rubrics: Compiling Rubrics into Typed Evaluation Graphs for LLM Judges


5. Retry, Switch, or Abstain? Learning Strategy-Aware Tool-Use Policies via Controlled Error Injection


6. ExRole: From Team Trajectories to Executable Roles in Multi-Agent Language Models


7. OEIS Open: How many conjectures can language models turn into theorems?


8. Policy-as-logic for robust reasoning over rules


9. Agent Skills Can Be Harmful: An Empirical Study of Skill-Induced Failures in LLM Agents


10. The Sleeping Agent: What Gist-Based Context Compression Loses and Why


11. Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning


12. HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting


13. FrontierFinance: A Challenging Benchmark for Measuring Frontier Intelligence of Finance Agents


14. AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection


15. XBridge: Entity-Grounded Latent Bridge for Heterogeneous LLM Communication


16. CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement


17. MBA: Multimodal Benchmark and Agents for Real-World Business Ideation


18. Learning from Online User Feedback for Shopping Agents


19. CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications


20. EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval


21. Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models


22. From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation


23. A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization


24. Benchmarking LLM Judges for Mobile Agent Evaluation


25. Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology


26. From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate


27. Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces


28. Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval


29. Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning



31. Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier


32. BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model


33. RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle


34. Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability


35. CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference


36. LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs


37. Forecasting Side Effects of Activation Steering


38. Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet


39. LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs


40. From Monolithic to Modular: Segment-level Automatic Prompt Optimization


41. Poor Man’s Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptop


42. Distribird: Literature-Informed Prior Distribution Design for Bayesian Model Calibration


43. Dynamic Governance of Multi-LLM Agent Systems for Collaborative Conversational Outcomes


44. Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence


45. Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents


46. Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams


47. One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL


48. SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward


49. Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge


50. NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation


51. A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench


52. Do LLMs Take Care of Their Own? Similarity Signals Can Induce Cooperation


53. Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control


54. From Safety Documentation to Safety Knowledge Support: An Evidence-Grounded LLM Framework for Medical Devices


55. RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks


56. LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation


57. Accuracy and Order Sensitivity Diverge Under Label-Free Strategies


58. Hamilton-Zero: A Neural Tensor-Network Foundation Model for Ground States of Arbitrary Quadratic Qubit Hamiltonians


59. Do You See What You Draw? A Semantic Closed-Loop Framework for Holistic Evaluation of Unified Multimodal Models


60. DexterSQL: Deep Schema Exploration and Rule-based Correction for Text-to-SQL Generation


61. LookBack: Where and How to Score LVLM Responses via Visual Reference Usage


62. How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment


63. TELLME: Test-Enhanced Learning for Language Model Enrichment


64. GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation


65. JieZi: A Large-Scale Expert-Audited Dataset and Benchmark for Ancient Chinese Character Exegesis


66. Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System


67. Locating and Controlling Implicit Personalization in Large Language Models


68. When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use


69. The Wording Effect: Quantifying Two-Way Drift in LLM Benchmark Performance


70. Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation


71. GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs


72. Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL


73. Low-Interaction-Rank Learning: Unifying Multiplicative Dual-Encoder Heads


74. Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing


75. Semantic Lenia: Emergence of Homeostatic Solitons within the Semantic Space of Large Language Models


76. Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting


77. Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs


78. FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting


79. Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs


80. Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agents


81. Do Influence Tactics Matter? Investigating Prompt Framing Effects in LLM Code Generation


82. Conflict and Congruency Effects in Large Language Models: In-Weight and In-Context Competition in a Verbal Conflict Task


83. TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs


84. AI Guardrail Survival under Single-Cycle Agentic Self-Summarization


85. Backdoor Decontamination Dynamics in LLM Agents


86. Chemically Meaningful Textualization Enables Explainable Validation of Metal-Organic Frameworks by Large Language Models


87. Agent Safety Should Be a Runtime Contract


88. Methodologies for Improving the Quality of AI Tutoring in K-12 Education


89. Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression


90. Lost in Compaction: Evaluating Side-Constraint Loss under Context Compaction


91. Retrofitting Recurrent Depth into a Pretrained Language Model: Installation, Extrapolation, Transfer, and Retention at Two Parameter Budgets


92. Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs


93. Evaluating LLM Generated Detection Rules in Cybersecurity