LLM 관련 주요 논문 - 2026-07-07

1. LLM-as-a-Verifier: A General-Purpose Verification Framework


2. Evaluating and Understanding Model Editing for Medical Vision Language Models


3. MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution


4. EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer


5. Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models


6. Rethinking On-Policy Self-Distillation for Thinking Models


7. AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments


8. DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation


9. TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios


10. ASSEMCAD: Production-Ready CAD Assembly Generation from Natural Language


11. Toward Trustworthy Large Language Model Agents in Healthcare


12. STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training


13. Medi-Gemma: A Hybrid Clinical Decision Support System Integrating Deterministic EMR Analytics and Retrieval-Augmented Generation


14. CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs


15. AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization


16. Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs


17. Detecting Answer-Driven Reasoning in LLM-Based Educational Tutors via Truncated Chain-of-Thought Auditing


18. Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models


19. Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents


20. Why Pure Reasoning is Not Enough: Nature as the Source of Mathematical Innovation


21. ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes


22. Agent Step Value: State-Transition Measurement with State-Grounded LLM Evaluators


23. LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL


24. MechMath Agent Team: LLM Driven Agents for Mathematical Research


25. Decentralized Aggregation of LLM Predictions via Wagering Mechanisms


26. HAS-Bench: Evaluating LLM-Based Human-Agent Systems under Configurable Human Participation



28. Progress- and Reliability-Oriented Group Policy Optimization for Agentic Reinforcement Learning


29. Biological Motifs for Agentic Control


30. Unsupervised Features Mining via Activation Geometry



32. Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming


33. What is Left for Us? Second Scholarship Against the Degradation of Research by AI


34. Online Linear Programming for Multi-Objective Routing in LLM Serving


35. Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth


36. Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process


37. Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry


38. Demonstrating Generalization Failures via Mixtures of Conditional Policies


39. When Aggregate Alignment Misleads: Auditing Policy Repair Without Per-State Expert Actions


40. Reflective Dialogue or Prompt Refinement? Effects of Tutor Scaffolding on Students’ Independent LLM Use for Programming


41. Organizational Memory for Agentic Business Process Execution


42. APeB: Benchmarking Personalization Ability of Large Language Model Agents


43. Silicon Sampling via Cross-Survey Transfer


44. Human-Centric Reflective Architecture for Human-AI Collaborative Decision-Making


45. Reinforcement Learning for Evidence-Seeking Diagnostic Reasoning with Large Language Models


46. Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models


47. MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents


48. Object-Centric Environment Modeling for Agentic Tasks


49. SwarmResearch: Orchestrating Coding Agents for Open-Ended Discovery


50. ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability


51. SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models


52. Selective Disclosure Watermarking for Large Language Models


53. Unified Audio Intelligence Without Regressing on Text Intelligence


54. Localized LoRA-MoE: Block-wise Low-Rank Experts With Adaptive Routing


55. LLM-Based Test Oracles: Source-of-Authority Taxonomy – A Systematic Literature Review


56. Your Agent’s Memories Are Not Its Own: Forged Reasoning Attacks on LLM Agent Memory and Defenses


57. TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction


58. LLM for the development of FCM


59. Multi-Turn On-Policy Distillation with Prefix Replay


60. RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities


61. Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment


62. Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards


63. RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents


64. Strategic Buying Agents


65. URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment


66. ToolFailBench: Diagnosing Tool-Use Failures in LLM Agents


67. Elastic Gang: Per-Token Membership Change for a Hard-Barriered LLM Inference Gang Co-Scheduled with OS Processes


68. Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations


69. TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models


70. LLM-Driven CI-CD Workflow Intelligence for Cyber Systems Engineering


71. A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training


72. EEG-SpikeAgent: Agentic Closed-Loop Program Synthesis for Automated EEG Spike Detection


73. Auto: The AGI Compiler


74. Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse


75. Language Models Represent and Transform Concepts with Shared Geometry


76. Failures and Successes to Learn a Core Conceptual Distinction from the Statistics of Language


77. Transplanting, inverting, and preventing a misalignment persona: method-conditional emergent misalignment in Qwen2.5


78. Regime-Conditional Stabilisation of LLM-Augmented Cooperative Multi-Agent Reinforcement Learning


79. A Retrieval-Augmented Framework for Detecting and Resolving Pragmatic Ambiguities in Natural Language Requirements


80. evalci: A Python Library for Statistically Rigorous Comparison of Language Model Evaluations


81. dOPSD: On-Policy Self-Distillation for Diffusion Language Models


82. Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention


83. Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding


84. IRIS: An Intelligent Vision-Language System for Ocular Surface Diseases via Topic Tree and Scene-Driven VQA Generation


85. HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference


86. CausalGame: Benchmarking Causal Thinking of LLM Agents in Games


87. Agentic-V2X: Small Language Model Agents for Deadline-Aware V2X Scheduling in 5G/6G Networks


88. Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs


89. Self-Reference in Large Language Models: The Introspection Threshold for Recursive Self-Improvement


90. LBR: Towards Mitigating Length Bias in Large Language Models for Recommendation


91. CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving


92. SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering


93. HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding


94. Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering


95. Benchmarking API Drift in LLM-Generated Quantum Code Across Successive SDK Versions


96. Speaker-Disentangled Chunk-Wise Regression for Syllabic Tokenization


97. Telescope: Improving Zero Shot Detection of LLM Generated Content By Measuring Token Repetition Probability


98. The “I Don’t Know” Filter: Enhancing Agentic Reliability in Function Calling


99. OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers


100. Full Glyph Images Beat Token Embeddings: A Controlled Study for Transformers


101. Scalable Semantic Steering of Embedding Projections


102. Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents


103. NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO


104. The Remarkable Effectiveness of Providing AI Agents with Natural Language Tools: A Replication Study Validating NLT Performance Across 14 Models


105. Probe, Don’t Prompt: A Hidden-State Probe for Metadata Filtering in Multi-Meta-RAG


106. Advanced Topic Modeling Techniques for Categorizing Software Vulnerabilities


107. Enhancement of E-commerce Sponsored Search Relevancy with LLM


108. Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language


109. GeoSelect: Spatial-Program Execution for Training-Free Referring Remote Sensing Image Segmentation


110. When Simpler Is Better: Evaluating Translation Pipelines for Medieval Latin Manuscripts


111. Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL


112. How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation


113. DualView: Preventing Indirect Prompt Injection in Personal AI Agents


114. Punching Above Their Weight: Classification-Head Fine-Tuning of Tiny Language Models (TLMs) for Verifiable Multiple-Choice Tasks


115. FedACT: Federated Adaptive Coordinate Trust Modulation for Robust Transformer Training under Data Heterogeneity


116. Attending to Multimodal Generation One Token at a Time


117. Don’t Blame the Large Language Model: How Scaffolding Evolution Shapes Coding Agent Quality


118. ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation


119. AutoCedar: An Agentic Framework for Verifier-Guided Access Control Policy Synthesis


120. ELiTeFormer: An Efficient Transformer for FPGAs


121. ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation


122. Revealing Hidden Model Behaviors with Task-Specific Self-Reports


123. RADIO1D: Elastic Representations for Condensed Vision Modeling


124. They Infer What You Meant: Models Represent Communicative Intent More Reliably Than They Act On It


125. Token-Based Affordance Grounding with Large Vision-Language Models


126. Responsibility Distribution Estimation in Ego-View Accident Videos with Multimodal Large Language Models


127. Differentiate the Evaluator, Not the Program: An Efficient Runtime Representation for Neuro-Symbolic Learning


128. Aligning Language Models with Selective Prediction


129. Reading Between the Dots: Decoding Hidden Computation across Filler Tokens


130. Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning


131. TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation


132. No Time Like the Present: Agentic Test-Time Training for LLM Agents


133. Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs


134. Spectral Signatures of Large Language Models


135. Brand-as-Memory: Vision-Language Models Encode Causal, Mechanistically Localizable Credibility Priors for News Sources


136. LLM-Enhanced Hierarchical Heterogeneous Graph Representation Learning for Malicious Python Package Detection


137. SPORK: Self-Speculative Forking to Accelerate Agentic LLM Inference



139. Is Agentic Code Review Helpful? Mining Developers’ Feedback to CodeRabbit Reviews in the Wild


140. Unbiased Alignment for Large Language Models with Noisy Preferences


141. Agentic and Generative AI for Open-Source Intelligence and Cyber Investigations: Taxonomy, Evaluation, Challenges, and Future Directions


142. CONTRA: Red-Teaming Configurations of Personalizable Agents


143. AnchorVLA: Bridging Discrete Decisions and Continuous Trajectories for Vision-Language-Action Planning


144. Effectiveness of LLM-based Software Diversity for Reliability Improvement – an Empirical Study


145. KARMA: Knowledge graph-based Automated Reasoning Materialization and Alignment


146. The Role of Prompt Language and Translation-Theory-Driven Prompts in Large Language Models: A Case Study on Spanish-Chinese Journalistic Translation


147. Which Algorithm Specification Formats Help Language Models Implement Machine Learning Algorithms?


148. Detecting Architectural Drift in Safety-Critical Firmware through Runtime Trace Analysis


149. ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy


150. Don’t Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking


151. STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition


152. Spectral Rewiring for Exploration, Purification, and Model Merging


153. LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression


154. OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models


155. Can Model Merging Improve Aggregation in DiLoCo?


156. Back to Basics: Improving Molecular Understanding in LLMs via SMILES-Graph Translation


157. VISTA: Auditing Semantic Divergence in Vision-Language Models


158. Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling


159. Individual Parameters in Weight-Sparse Transformers Appear Interpretable


160. Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning


161. A Precedent-Guided Co-Scientist for Side-Effect-Aware Drug Redesign


162. PromptPET: Privacy-Utility Optimized Prompt Obfuscation


163. VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning


164. R3D: Quantitative 3D Spatial Reasoning for Egocentric Wearables


165. CoACT: Action-Preserving Observation Compression for Coding Agents


166. Learning Taxonomic Trees with Hierarchical Representation Regularization for Large Multimodal Models


167. PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement


168. Where do LLMs Fall Short in CBT-Guided Affective Reasoning?


169. Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI


170. Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models


171. Training Hybrid Block Diffusion Language Models with Partial Bidirectionality


172. A Preliminary Study on Explaining Risk of Code Changes using LLM-Based Prediction Models


173. Safe Inference-Time Alignment via Lagrangian Reward Augmentation


174. Gemma 4 Technical Report


175. Out-of-Distribution Generalization of Risk Aversion in Language Models


176. Diagnosing Aerial-View Object Detectors with Foundational Image Generative Models


177. Not All Refusals Are Equal: How Safety Alignment Fails Cybersecurity at Scale


178. K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos


179. The agent creates, we validate: A Lightweight Framework for Agentic Artifact Generation


180. Knowledge-Centric Information Systems


181. AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents


182. Homer: Understanding Long-form Videos with Hierarchical Memory and Agentic Reasoning


183. Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models


184. From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving


185. DELTAVID: Enhancing Fine-Grained Spatiotemporal Perception with Cross-Video Differences


186. PEEK: Predictive Queue-Informed KV Cache Management for LLM Serving


187. Specific Domain Ontology Construction Using Large Language Models