LLM 관련 주요 논문 - 2026-06-12

1. Automated reproducibility assessments in the social and behavioral sciences using large language models


2. Agents-K1: Towards Agent-native Knowledge Orchestration


3. EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery


4. AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility


5. Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning


6. Reward Modeling for Multi-Agent Orchestration


7. A Three-Layer Framework for AI in Scientific Discovery


8. Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models


9. Neuro-Symbolic Agents for Regulated Process Automation: Challenges and Research Agenda


10. A Quantitative Experimental Repeated Measures Study of Training Dynamics in a Small Llama Style Language Model Under a Compute-Aware Token Budget


11. ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning


12. From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification


13. Multi-Field Hybrid Retrieval-Augmented Generation for Maritime Accident Root Cause Analysis


14. EPIG: Emotion-Based Prompting for Personalised Image Generation


15. Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm


16. LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis


17. ARMOR-MAD: Adaptive Routing for Heterogeneous Multi-Agent Debate in Large Language Model Reasoning


18. Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach


19. Mental-R1: Aligning LLM Reasoning for Mental Health Assessment


20. TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?


21. AAbAAC: An Annotated Corpus for Autoimmunity Information Extraction


22. Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior


23. Structured Testbench Generation for LLM-Driven HDL Design and Verification-Oriented Data Curation


24. OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models


25. Learning What to Remember: A Cognitively Grounded Multi-Factor Value Model for Agentic Memory


26. MARS: Margin-Adversarial Risk-controlled Stopping for Parallel LLM Test-time Scaling


27. Iterating Toward Better Search: A Two-Agent Simulation Framework for Evaluating Agentic Search Architectures in E-Commerce


28. MDForge: Agentic Molecular Dynamics Pipeline Design under Sparse Simulator Feedback


29. Zero-source LLM Hallucination Detection with Human-like Criteria Probing


30. HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness


31. DailyReport: An Open-ended Benchmark for Evaluating Search Agents on Daily Search Tasks


32. WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning


33. (Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable


34. Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement


35. Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics


36. GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models


37. Teach-and-Repeat: Accurately Extracting Operational Knowledge from Mobile Screen Demonstrations to Empower GUI Agents


38. MLUBench: A Benchmark for Lifelong Unlearning Evaluation in MLLMs


39. The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements


40. Prefill Awareness in Large Language Models


41. Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior


42. Deployment-Centered Evaluation: Predicting Query-Level Rejection Risk in a Clinical LLM System


43. Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents


44. TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation


45. “Did you lie?” Evaluating Lie Detectors across Model Scale and Belief-Verified Model Organisms


46. PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation


47. Arbor: Tree Search as a Cognition Layer for Autonomous Agents


48. ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs


49. Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning


50. SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning


51. Valid Inference with Synthetic Data via Task Exchangeability


52. One Polluted Page Is Enough: Evaluating Web Content Pollution in Generative Recommenders


53. Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models


54. ArogyaSutra: A Multi-Agent Framework for Multimodal Medical Reasoning in Indic Languages


55. Adaptive Turn-Taking for Real-time Multi-Party Voice Agents


56. AgentRivet: an automated system for producing Rivet routines from journal publications


57. Mod-Guide: An LLM-based Content Moderation Feedback System to Address Insensitive Speech toward Indigenous Ethnic and Religious Minority Communities


58. Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents


59. An LLM System for Autonomous Variational Quantum Circuit Design


60. IVIE: A Neuro-symbolic Approach to Incremental and Validated Generation of Interactive Fiction Worlds


61. HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers


62. Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality


63. Humor Style Drives Laughter, Topic Shapes Acceptability: Evaluating Bilingual Personal and Political Robot-Delivered AI Jokes


64. MemRefine: LLM-Guided Compression for Long-Term Agent Memory


65. NTS-CoT: Mitigating Hallucinations in LLM-based News Timeline Summarization with Chain-of-Thought Reasoning


66. Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback


67. G-Long: Graph-Enhanced Memory Management for Efficient Long-Term Dialogue Agents


68. Functional Cache Grafting: Robust and Rapid Code-Policy Synthesis for Embodied Agents


69. The Emergence of Autonomous Penetration Capabilities in Large Language Model-Powered AI Systems


70. TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization


71. Democracy in the Era of Artificial Intelligence


72. scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing


73. Order Is Not Control


74. Bounding Boxes as Goals: Language-Conditioned Grasping via Neuro-Symbolic Planning


75. Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming


76. TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models


77. Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning


78. Localizing Anchoring Pathways in Language Models


79. Exploring How Agent Voice Accents Shape Human-AI Collaboration in K-12 Group Learning


80. Agentic MPC for Semantic Control System Resynthesis


81. LLMs Can Better Capture Human Judgments–With the Right Prompts


82. PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections


83. SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems


84. LLM-Powered Personalized Glycemic Assessment in Type 2 Diabetes with Wearable Sensor Data


85. M*: A Modular, Extensible, Serving System for Multimodal Models


86. Keep Policy Gradient in Charge: Sibling-Guided Credit Distillation for Long-Horizon Tool-Use Agents


87. Bag of Dims: Training-Free Mechanistic Interpretability via Dimension-Level Sign Patterns


88. HybridCodeAuthorship: A Benchmark Dataset for Line-Level Code Authorship Detection


89. Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs


90. EDEN: A Large-Scale Corpus of Clinical Notes for Italian


91. Foresight: Iterative Reasoning About Clues that Matter for Navigation


92. A Mathematical Theory of Value: a synthesis on goal-directed agency under resource constraints


93. Representing Time Series as Structured Programs for LLM Reasoning


94. ReCal: Reward Calibration for RL-based LLM Routing


95. SAIGuard: Communication-State Simulation for Proactive Defense of LLM Multi-Agent Systems


96. Occupational Prompting Reveals Cultural Bias in Large Language Models


97. Position: Generative Engine Optimization Creates Underexamined Risks, Governance Must Target Concentration, Disclosure, and Academic Blind Spots


98. Muse Spark Safety & Preparedness Report


99. An Explainable AI Assistant for Introductory Programming Education: Improving Feedback Reliability with Instructor-AI Collaboration


100. Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering


101. GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns


102. Divination by Prompt: LLM-Mediated Xuanxue on Chinese Social Media


103. AI SciBrief as a Gateway to Research: A Framework for Onboarding Students into New Research Areas