LLM 관련 주요 논문 - 2026-06-01

1. LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories


2. AutoSci: A Memory-Centric Agentic System for the Full Scientific Research Lifecycle


3. FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning


4. Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration


5. Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation


6. COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation


7. LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability


8. GraphARC: A Comprehensive Benchmark for Graph-Based Abstract Reasoning


9. UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling


10. Distilling LLM Feedback for Lean Theorem Proving


11. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents


12. SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning


13. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges


14. Learning Agent-Compatible Context Management for Long-Horizon Tasks


15. MAVEN: Improving Generalization in Agentic Tool Calling


16. Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response


17. EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs


18. Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents


19. PhyDrawGen: Physically Grounded Diagram Generation from Natural Language


20. Stateful Online Monitoring Catches Distributed Agent Attacks


21. Language Models Learn Constructional Semantics, Not To Mention Syntax: Investigating LM Understanding of Paired-Focus Constructions


22. LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards


23. What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text Generation


24. Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization


25. Vision-Language Models Suppress Female Representations Under Ambiguous Input


26. If LLMs Have Human-Like Attributes, Then So Does Age of Empires II


27. Skill Reuse as Compression in Agentic RL


28. GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization


29. PithTrain: A Compact and Agent-Native MoE Training System


30. Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction


31. Used Car Salesbots? Honesty and Credulity of LLMs as Bargaining Agents under Partial Information


32. DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs


33. The Sword, Shield, and Achilles’ Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning


34. Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models


35. FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection


36. Neither Replacement nor Panacea: Comparing LLM-Based Conversational and Graphical Decision Support in Industrial Tasks


37. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models


38. Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval


39. EchoRL: Reinforcement Learning via Rollout Echoing


40. Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study


41. Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models


42. Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration


43. Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines


44. Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion


45. D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training


46. Developing a UXR Point of View for Cognitive Accessibility in Mobile Learning with Generative AI


47. SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes


48. FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization


49. On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets


50. Not All Synthetic Data Is Yours to Learn From


51. KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning


52. SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition


53. A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models


54. Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA


55. From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors


56. Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation


57. Variational Adapter for Cross-modal Similarity Representation


58. AMix-2: Establishing Protein as a Native Modality in Large Language Models


59. Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity


60. TUX: Measuring Human–AI Tacit Understanding


61. De-attribute to Forget for LLM Unlearning


62. Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits


63. What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness


64. BlueFin: Benchmarking LLM Agents on Financial Spreadsheets


65. Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach


66. PatchWorld: Gradient-Free Optimization of Executable World Models


67. Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences


68. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning


69. Safe Equilibrium Policy Optimization for Strategic Agent Policies


70. Fine-Tuning Improves Information Conveyance in Language Models


71. Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage


72. Differentially Private Preference Data Synthesis for Large Language Model Alignment


73. Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution


74. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding


75. On the impact of retrieved content representations in RAG Pipelines


76. XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks


77. GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation


78. OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning


79. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?


80. Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation


81. SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs


82. Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence


83. Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty


84. CobSeg: Coherence Boundary Modeling for Dialogue Topic Segmentation


85. Automatically Attacking Software Reverse Engineering AI Agents


86. EUDAIMONIA: Evaluating Undesirable Dynamics in AI


87. Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs


88. COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models


89. PInVerify: An Offline Embodied Benchmark for Active Instance Verification


90. The Architecture of Errors: From Universal Impossibility to Patch-Local LLM Reliability


91. An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations


92. ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law


93. Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode


94. VLM3: Vision Language Models Are Native 3D Learners


95. Seeing Isn’t Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?


96. Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages


97. The Surface You Test Is Not the Surface That Breaks


98. Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology


99. Exploring Autonomous Agentic Data Engineering for Model Specialization


100. CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models


101. Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate


102. Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market


103. When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL