LLM 관련 주요 논문 - 2026-07-15

1. Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution


2. Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model


3. Win by Silence: Deletion Non-Monotonicity, Autonomous Exploitation, and Typed-State Gating in LLM Plan Evaluation


4. Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs


5. FormalAnalyticGeo: A Neural-Symbolic Based Framework for Multimodal Analytic Geometry Problem Generation


6. MemOps: Benchmarking Lifecycle Memory Operations in Long-Horizon Conversations


7. Visual Access Boundaries in Vision-Language Model Reasoning


8. Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents


9. Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?


10. Tracing Agentic Failure from the Flow of Success


11. LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos


12. MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku


13. A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism


14. Atomic Units of X: The Compression Layer of Intelligence


15. Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing


16. Evidence-Grounded AI for Musculoskeletal Care


17. TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments


18. EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading


19. Accepted Prefixes Are Not All You Need: A Negative Result on PEFT-Based Block-Diffusion Drafting


20. Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions


21. Critic Experience Bank: Self-Evolving Step-Level Confidence Estimation for LLM Agents


22. PM-Bench: Evaluating Prospective Memory in LLM Agents


23. How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks


24. Rethinking the Evaluation of Harness Evolution for Agents


25. A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models


26. Cost-Governed RAG: Unified Per-Tenant Cost Attribution Across Retrieval and Generation in Multi-Tenant LLM Systems


27. The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning


28. Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking


29. Graph Feedback Controls Consensus and Clique Formation in Open-Weight Language-Model Populations


30. GRID: Grammar-Railed Decoding for Enterprise SQL Generation


31. Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study


32. PalmClaw: A Native On-Device Agent Framework for Mobile Phones


33. Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models


34. Accelerating Masked Diffusion Large Language Models: A Survey of Efficient Inference Techniques


35. The One-Word Census: Answer-Choice Conformity Across 44 Language Models


36. Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels


37. Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation


38. Bulkhead: Automated Semantic Detection and Remediation of Container Escape Vulnerabilities


39. Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts


40. Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs


41. Can Induced Emotion Bias LLM Behaviors in Sequential Decision Making?


42. Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs


43. An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge


44. The Computational Basis of Confidence in Large Language Models


45. IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment


46. Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)


47. The Sound of Absence: Audio-Language Embedding Models Struggle with Negation


48. Code-MUE: Measuring Code LLMs’ Uncertainty through Execution-based Semantic Interaction Graphs


49. Fin-Analyst at FinMMEval 2026 Task 3: A Live Hybrid Trading Agent with LLM Specialists and Rule-Based Signals


50. RCWT: Measuring Task-Budget Displacement from Coordination Content in LLM Calls


51. Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing


52. Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning


53. PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs


54. AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration


55. An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering


56. Graph-Constrained Policy Learning for Extreme Clinical Code Prediction


57. Sensitivity to Subjective Expected Utility Maximization: A Methodological Study, with an Illustrative Application to LLM Decision-Making


58. Do You Remember? Toward Memory-Centric Multimodal AI


59. AAAI-26 Dual Submissions: Novel Challenges


60. QDEvo: A Multi-Objective Quality-Diversity Framework for Automated Heuristic Design


61. I’m Sorry, but I Can’t Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs


62. G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis


63. CANDI: Contextual Alignment for Niche Domains Question Answering


64. So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis


65. Scaling Point-in-Time Language Models


66. FAIR GraphRAG: A Retrieval-Augmented Generation Approach for Semantic Data Analysis