LLM 관련 주요 논문 - 2026-09-28

1. Multi-agent Scaling Across Disjunctive and Compensatory Tasks


2. Prompt Minimization: Reducing Input Redundancy Without Sacrificing Output Fidelity


3. Game Arena: Strategic LLM Evaluation in Competitive Environments


4. Segment-Level Agentic Topic Modeling for Improved Data Exploration and Resource Efficiency


5. Mutable Transcripts: Mitigating Context Pollution through Editable Conversation State


6. The Right Information Extraction Pipeline Depends on the Document: Accuracy-Energy Trade-offs for Small, Local Models


7. DIAL: Position-Debiased LLM Judges with Adaptive Human Preference Calibration


8. Which Influence Are We Estimating? The Role of Counterfactual Specifications in Data Attribution


9. Accounting for Bias Enables Sustainable LLM Evaluation


10. SPO: Discovering Adaptive Large Neighborhood Search Operators via Stackelberg Program Optimization


11. Semantic Navigation for Issue Localization in Code Repository


12. Can Linguistic Reasoning Vectors Enhance Multimodal Reasoning Ability?


13. OmouAI: Argumentative Human-AI Policy Deliberation with Simulated Personas


14. Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents


15. Externalized CPDAG Summaries Improve LLM Causal Deduction


16. Cheap, open agents make LLM pollution harder to mitigate


17. Same Text, Different Numbers: The Divergence of LLM-Based Measures


18. MoMHa: Multi-Objective Optimization of LLM Harnesses over Accuracy, Safety, and Tokens


19. FTB Graph: Determining and Validating First-token Broadcasters and Language-Identity Head Circuits in Multilingual Language Models


20. LogicTree-RAG: Logic Tree-guided Retrieval-Augmented Generation for Long-form Patent Drafting


21. Financial Fragility in Societies of LLM Agents: Coordination Failures and Stabilizing Mechanisms


22. MACBT: A Multi-Agent Cognitive Behavioral Therapy Decision Support System with Longitudinal Memory


23. Self-Play Search Distillation for Large Language Model Reasoning


24. Why Jailbreaks Succeed in Diffusion Language Models: An Energy Landscape Analysis


25. PTC-Decoder: Towards Intelligent SLMs on Offline Resource-Constrained Edge Devices


26. HasMem: Hard-Origin Adaptively Softened Memory for Long-Term LLM Agents


27. Does Thinking Help Fairness? Reasoning Tokens Resolve Some Biases but Create More


28. HCOE: Hyperbolic Clinical Ontology Embeddings from Biomedical Language Models


29. Backbone-Adaptive Evidence Routing for Robust Pairwise LLM Judging


30. ORCA: Evaluating LLMs on Data Science Code Translation


31. Learning What to Skip: Counterfactual Credit Assignment for Efficient Multi-Agent LLM Workflows


32. LAVOIR: Teaching a Single-Pass Decision Encoder When and What to Ask with Amortized Value of Information


33. The Price of Thought: Does Test-Time Reasoning Pay in LLM Trading?


34. LLM Parkinsonism: Executive-Control Failure, Token-Inefficient Persistence, and an Uncertainty-Aware Global Executive Control Architecture for Autonomous Language-Model Agents


35. Audio LLMs Know When They Can’t Hear You


36. T-RoPE: Time-Aware Rotary Position Embedding for Sequential Recommendation


37. HARDEN: Constrained Evolutionary Search for Harder, Answer-Preserving Evaluation Cases


38. Thinking Less to Simulate Better: Intuitive Prompting Improves LLM Agents Simulating Individual Social Media Reactions, Including Unfamiliar Content


39. BioEVAL: A global, multi-institutional benchmark of large language and multimodal models for bioengineering


40. Do LLMs Understand Context? A Knowledge Graph-Based Evaluation Framework


41. Pretrained ASR Pseudo-labeling for Noisy Police Audio


42. Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems


43. Bridging LLM Agents and Data Spaces: An Architectural Mediation Approach using the Model Context Protocol


44. When Is a Multi-Agent Code Judge Actually Grounded? Two Label-Free Measurements, and a Judge That Declines to Guess


45. Can You Check That? The Checkability Boundary for Local LLM Network Automation


46. Evaluating Cultural Awareness of LLMs for Haitian Creole


47. PriceBench: A Diagnostic Benchmark for Price, Quality, and Brand Preferences in LLM Booking Agents


48. From Reward Signal to Visual Utility: A Controlled Audit of Medical VLM Post-Training


49. ViSTA: A Simple Bridge Extends Visual Alignment to Clinical Time-Series Understanding in Multimodal LLMs


50. Towards Mitigating Fabricated Consensus: The Active Provenance Gate for Multi-Agent Debate Synthesis


51. Sorry Robot, Happy Human: Vision-Language Models Read Only One of Two Legible Typographic Layers


52. Intent2Tc: Automated Intent-to-Traffic Control Translation with Language Models


53. ActKV: Efficient LLM Agents through Action-Guided KV Cache Management


54. Highlight-Then-Summarize: Learning to Compress Evidence for Long-Context Understanding


55. AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents


56. Beyond Approved Actions: Runtime Validation of Persistent Outcomes in Agent Workflows


57. Softmax Reparameterization for Output-Head Quantization


58. Resource-Optimized and Energy-Aware Agentic AI Framework Anchored on Blockchain for Secure Software Supply Chains


59. Acoustic-to-Text KV Compression for Full-Duplex Speech Models


60. Improving Visual Sensitivity of LLMs on Multimodal Machine Translation with Metric-based Loss Weighting


61. AgentRecommender: LLM Agents Enable Customizable Recommender Systems on the User Side


62. Pocket-STVG: lightweight architecture for Spatio-Temporal Video Grounding


63. DepthEvidence: Unifying Metric Depth Prediction and Geometric Reasoning in Multimodal Language Models


64. DynBranch: Speculative Subgraph Reuse for Dynamic Agentic LLM Serving


65. G$^2$PTQ: Improving LLM Post-Training Quantization with Generalized Gradient Compensation


66. The Linear Representation Hypothesis for Vision-Language-Action Models


67. FLIP: Final Layer Inference-Time Probing for Vision-Language Models


68. MVVBench: Benchmarking 4D Reasoning in Vision-Language Models


69. Estimating and Orthogonalizing Unknown Pre-training Gradients for Continual Fine-tuning of Large Language Models


70. UltraG-Bench: A Multi-task Benchmark for assessing Large Vision-Language Models on Pixel-level Evidence Grounding in Ultrasound


71. Skip the Talk, Re-Focus on Vision: Latent Reasoning for Reasoning Segmentation in Multimodal Large Language Models


72. Beyond the Last Truffula Tree: SustainAI - A Water-Aware, Closed-Loop Framework for Environmentally Accountable AI


73. Words Speak Louder Than Order: A Behavioral Evaluation of Gemma 4


74. VLALight: Lightweight Vision-Language-Action Models for Emergency-Aware Traffic Signal Control


75. A Framework for Identifying, Categorizing, and Explaining Bias in AI-Generated Code


76. Subjects, Not Authors: The Authorship Hazard in Agentic Dataspaces


77. The Hard Part Comes After Search: Benchmarking Web Agents on Synthesizing, Organizing, and Displaying Knowledge


78. Breaking Homogeneity: Diversifying Persona Sets for Creative LLM Outputs


79. CARGO: Context-Aware Retrieval-Gated Evaluation of Agentic AI in Production


80. A Benchmarking Framework for Context-aware XR Interfaces


81. Actively Resolving Contextual Uncertainty for Underspecified Tasks in Natural Language


82. Cost-Aware Best-LLM Identification using Dueling Feedback


83. Strategic Self-Consistency


84. SignTrace: Describe a Sign, Find the Word


85. Cartograph: Federated Tool Discovery with Operator-Attested Retrieval for AI Agents


86. A Survey on Fake Review Detection: From Pre-trained Language Models to Large Language Models