LLM 관련 주요 논문 - 2026-06-09

1. SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research



3. (Auto)formalization is supposed to be easy: Trellis process semantics for spelling out rigorous proofs


4. Correlation Is Not Enough: Embedding Human Metadata for Individual Causal Discovery


5. SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks


6. Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text


7. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs


8. PRISM: Recovering Instruction Sets from Language Model Activations


9. AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation


10. From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs


11. Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture


12. LLM-Orchestrated Conformance Checking in Stroke Care Without Computer-Interpretable Guidelines


13. AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning


14. SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance


15. RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour


16. Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs


17. MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation


18. Vision Language Model Helps Private Information De-Identification in Vision Data


19. Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation


20. A Regret Minimization Framework on Preference Learning in Large Language Models


21. ComplexConstraints and Beyond: Expert Rubrics for RLVR


22. Graph2Idea:Retrieval-Augmented Scientific Idea Generation with Graph-Structured Contexts


23. REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces


24. Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs


25. A Multi-Agent System for IPMSM Design Optimization via an FEA-AI Hybrid Approach


26. LATTEArena: An Evaluation Framework for LLM-powered Tabular Feature Engineering (Extended Version)


27. RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models


28. Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models


29. An Effective Router for Vision-Language Model Selection


30. Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human


31. Order Matters: Unveiling the Hidden Impact of Macro Placement Sequences via Proxy-Guided LLM Evolution


32. Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents


33. Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations


34. ZIPP:Zero-shot Image Personalization from Personas


35. Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models


36. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization


37. Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution


38. RAILS: Verification-Native Clearing For Agentic Commerce


39. Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery


40. ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems


41. Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models


42. InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs


43. Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration


44. PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR


45. AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions


46. DN-Hypo-Pipeline: An AI-Driven Workflow for Hypothesis Generation via Large Language Models and Scientific Explanations


47. VESTA: A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents


48. Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets


49. Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs


50. A Variability-Based Framework for Interpretable Naming in Formal and Relational Concept Analysis


51. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning


52. Trajectory-Refined Distillation


53. Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control


54. Benchmarking Open-Ended Multi-Agent Coordination in Language Agents


55. To Nuke or Not to Nuke: LLMs’ (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation


56. Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems


57. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding


58. SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents


59. Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents


60. Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents


61. SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection


62. Cross-LLM Consistency in Inference: Evidence from Shared Interactions


63. Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction


64. When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference


65. Efficient Skill Grounding via Code Refactoring with Small Language Models


66. PAFO: Pareto Fairness Optimization for Personalized Reward Modeling


67. Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline


68. Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs


69. Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines


70. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy


71. MemToolAgent overview with a simple restaurant booking scenario where the agent retrieves similar memories, receives feedback on an invalid time format, and generates a reflection to update its memory


72. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents


73. Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators


74. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression


75. Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models


76. Beyond Goodhart’s Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems


77. Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion


78. Automatic Extraction of Structured Information from Brain MRI Reports Using an Open-Weight Large Language Model


79. Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning


80. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs


81. PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow


82. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics


83. FASE: Fast Adaptive Semantic Entropy for Code Quality


84. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO


85. Observability for Delegated Execution in Agentic AI Systems


86. End-to-End Context Compression at Scale


87. Muon Learns More Robust and Transferable Features than Adam


88. ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies


89. AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving


90. FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing


91. SecureClaw: Clawing Back Control of LLM Agents


92. Emergence of Context Characteristics Sensitivity in Large Language Models


93. Closing the Prior-Posterior Loop: Self-Reflective Molecular Design with Analysis-Driven LLM Iteration


94. Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents


95. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short


96. Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents


97. Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation


98. End-to-End Training for Discrete Token LLM based TTS System


99. Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis


100. Unified Energy for Invariant and Independent Decoding in Diffusion Language Models


101. SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance


102. Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models


103. Steganography Without Modification: Hidden Communication via LLM Seeds


104. From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs


105. Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges


106. Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps


107. See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding


108. Stage-1 Controls the Entropy Regime, Not the Outcome


109. INFUSER: Influence-Guided Self-Evolution Improves Reasoning


110. TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs


111. SafeRun: Enabling Determinism in LLM Planning for Running


112. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech


113. Understanding Quantization-Aware Training: Gradients at Quantized Weights Bias to the Low-Loss Basin


114. CARE: A Conformal Safety Layer for Medical Summarization


115. Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops


116. NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis


117. PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus


118. Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection


119. Cheap Reward Hacking Detection


120. Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors


121. Governance Controls for AI-Generated Test Artifacts in Autonomous Software Testing


122. How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects


123. RadOT-Eval: Auditable Structured-Evidence Transport for Radiology Report Evaluation


124. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing


125. Structuring agentic AI for HPC code modernization


126. Agentic Search for Counterfactual Recourse under Fixed LLM Budgets


127. Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation


128. Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks


129. Data Agents Under Attack: Vulnerabilities in LLM-Driven Analytical Systems


130. Sample-Efficient LLM-Based Detection of Malicious Web Server Logs with Forensically Explainable Reasoning


131. A retrieval conditioned rebinding circuit for dynamic entity tracking in large language models


132. Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents


133. Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models


134. EinSort: Sorting is All We Need for Tensorizing LLM


135. Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation


136. PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems


137. FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training


138. More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs


139. Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models


140. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models


141. Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics


142. TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering


143. Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection


144. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses


145. Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard


146. Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy


147. Pre-Intervention Prediction of Sparse Autoencoder Steering Side Effects


148. “So There’s a Catch-22 Here”: How Early Adopters Who Build Multi-Agent LLM Systems Conceptualize Transparency


149. Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures


150. Contemporary AI lacks the imagination to diverge or negate in science


151. AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals


152. GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models


153. The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In


154. CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning


155. Closing the Sim-to-Real Gap: An Evaluation Framework for Autonomous Cyber Defense Configuration of Commercial EDR


156. Constrained Paraphrase Consistency for LLM Hallucination Detection


157. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI


158. Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method


159. Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions


160. “I understand your perspective”: LLM Persuasion and Sycophancy through the Lens of Communicative Action Theory


161. Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?


162. What’s the Point? Spatial Grammar & Index Resolution for Sign Language Processing


163. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective


164. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research


165. Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure


166. Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation


167. Summarization is Not Dead Yet


168. Enhancing AI Interpretability and Safety through Localised Architectures


169. MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models


170. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks


171. Neutrality Bites: Gender Representation in AI-Generated Animal Stories


172. RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks


173. Minibatch Selection via Partition Matroid Constrained Gradient Matching


174. From May' to Is’: Certainty Distortion in Language Model Rewriting


175. POISE: Position-Aware Undetectable Skill Injection on LLM Agents


176. Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation


177. Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation


178. Larch: Learned Query Optimization for Semantic Predicates


179. Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories


180. The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models


181. Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices


182. Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese


183. Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method


184. Does Persona Make LLMs K-pop Fans? A Pilot Study of LLM-Based Online Concert Audience Agents


185. Cherry-pick Override: Unsafe Directional Commitment in LLM Judges under Mixed Evidence


186. The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust


187. SLMJury: Can Small Language Models Judge as Well as Large Ones?


188. MatMind: A Structure-Activity Knowledge-Driven Generative Foundation Model for Materials Science


189. Rosetta Memory: Adaptive Memory for Cross-LLM Agents


190. WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing


191. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models


192. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models


193. FunctionEvolve: Structure-Guided Symbolic Regression with LLMs


194. Adversarial Robustness of Activation Steering in Large Language Models


195. HARP: Efficient Data Selection for Finetuning Large Language Models


196. TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation


197. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching


198. Systematic LLM Translation of Legacy Scientific Code to Differentiable Frameworks: Application to a Land Surface Model


199. DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment


200. MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios


201. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference


202. MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework


203. A Dataset for Dynamic Human Preferences for Vision Language Models


204. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs


205. Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences


206. Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation



208. LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training


209. Contribution Weights: A Geometrical Analysis of Self-Attention Transformers


210. MetaEvo: A Meta-Optimization Framework for Experience-Driven Agent Evolution


211. Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning


212. Reachability and asymptotics of Gaussian Transformer dynamics


213. A Topological Characterization of Graph Neural Networks via Stochastic Block Model Embeddings on the n-Sphere


214. ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research


215. From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs


216. Enabling KV Caching of Shared Prefix for Diffusion Language Models


217. SurfDesign: Effective Protein Design on Molecular Surfaces


218. Phantom transitions in language model fine-tuning


219. Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings


220. Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA


221. Liberating LLM Capabilities in Full-Duplex Speech Models


222. Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation


223. Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents


224. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis


225. Principled Agent Debate: Adversarial Arbitration for Sycophancy Reduction in Large Language Models


226. mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models


227. CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models


228. BEACON: Behavioral Entropy Aggregation for Cross-Model Hallucination Detection in Large Language Models


229. Post-training is (Massive) Supervised Learning