LLM 관련 주요 논문 - 2026-07-08

1. DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression


2. Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment


3. FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference


4. Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade


5. Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory


6. DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail


7. From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution


8. Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale


9. Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents


10. PolyWorkBench: Benchmarking Multilingual Long-Horizon LLM Agents


11. Information Limits and Attractor Dynamics in Economies of Frontier LLM Agents: A Pre-Registered Test


12. AgoraSim: A Hybrid Agent-Based Modeling Framework


13. Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation


14. Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH


15. PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation


16. Onnes: A Physics-Grounded Multi-Agent LLM Simulator for Cryogenic Fault Diagnosis in Quantum Computing Infrastructure


17. Controlling Tool Use with Heading-Specific Activation Steering


18. Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents


19. Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning


20. Synthetic Consumer Insight Generation with Large Language Models


21. Akashic: A Low-Overhead LLM Inference Service with MemAttention


22. FirstResearch: Auditable Question Formation for LLM Scientific Discovery Agents


23. Foundation Models for Automatic CAD Generation


24. CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming


25. Prompt-to-Paper: Agentic AI System for Bioinformatics


26. RSF-GLLM: Bridging the Semantic Gap in Multi-Hop Knowledge Graph QA via Recurrent Soft-Flow and Decoupled LLM Generation


27. AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models


28. Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities


29. From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b


30. Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders


31. An Experimental Design Approach to Evaluating Agentic AI’s Autonomous Model Discovery


32. What Images Cannot Say: Language-Guided Olfactory Representation Learning


33. Harnessing Code Agents for Automatic Software Verification


34. Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs


35. UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation


36. VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection


37. Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows


38. Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design


39. LongCrafter: Towards Diverse Long-Context Understanding via Evidence-Graph-Guided Instruction Synthesis


40. LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability


41. Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries


42. LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference


43. From Blueprint to Reality: Modeling and Applying Putnam’s Social Capital Theory with LLM-based Multi-agent Simulations


44. Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development


45. PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages


46. Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention



48. i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler


49. Harrison.Rad 1.5 Technical Report: A radiology foundation model that can draft reports from images, priors and clinical context


50. Think Before You Grid-Search: Floor-First Triage for LLM Serving


51. Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns


52. Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis


53. Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning


54. LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding


55. When Should LLMs Search? Counterfactual Supervision for Search Routing


56. SCOReD: Student-Aware CoT Optimization for Recommendation Distillation


57. Depression Symptoms and Relational Patterns in 187k ChatGPT Histories


58. RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs


59. What Do AI Agents Actually Change? An Empirical Taxonomy of Mutation Patterns in Performance-Improving Pull Requests


60. EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems


61. BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension


62. ResonatorLM: Causal Resonant Field Mixing for Efficient Long-Context Language Modelin


63. Harnessing Generative Image Models for Training-Free Primitive Shape Abstraction


64. Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation


65. The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment


66. Most LLM Conformity Needs No Speaker: Measuring the Speaker-Free Floor in Peer-Pressure Benchmarks


67. Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation


68. aiAuthZ: Off-Host, Identity-Bound Authorization for AI Agents


69. PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates


70. Decision Protocols in Multi-Agent Large Language Model Conversations


71. Is Your NPU Ready for LLMs? Dissecting the Hidden Efficiency Bottlenecks in Mobile LLM Inference


72. Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning


73. PORTS: Preference-Optimized Retrievers for Tool Selection with Large Language Models


74. Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG


75. CANONIC: Governance Is Compilation


76. A Guiding Framework for K-12 Teachers in Creating AI-powered Learning Technologies through Vibe Coding


77. CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries


78. Catalyst Papers in Artificial Intelligence Research: A Landscape on ICLR from 2017 to 2025


79. Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving