LLM 관련 주요 논문 - 2026-08-21

1. An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction


2. AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement


3. Pandora’s AI Model Routing Box: Efficient Allocation with Costly Value Estimation


4. MidTool: Mid-training Data Synthesis for Agentic Tool Use


5. Phantom Gains: Auditing Self-Improvement Against a Measured Null


6. Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents


7. Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation


8. Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models



10. MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use


11. DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing


12. What You Can’t See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies


13. Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees


14. ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance


15. EXIMO: VLM Guided Exploration of VLA Policies


16. Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures


17. EnvHarness: Awakening Static Worlds for Agent Learning


18. PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents


19. SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning


20. Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents


21. LLMs as Acquisition Policies for Finite-Pool Materials Optimization: A Controlled Study


22. Rethinking the Evaluation and Optimization of LLM-Based Social Simulation


23. Frequency-Aware Continual Learning for Smart Contract Vulnerability Detection with Large Language Models


24. Can Agent Memory Systems Track Evolving State?


25. Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics


26. Beyond Imitation: Filtering On-Policy Distillation by Reasoning Progress


27. Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation


28. Active Inference as Context Acquisition for AI Agents


29. Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization


30. Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference


31. Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection


32. Evidence-Gated Task and Motion Planning with Vision-Language Models


33. EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models


34. Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training


35. MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection


36. Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models


37. A knowledge-guided agentic framework for mitigating patient-context ambiguity in health queries


38. Repo0: Design-Driven Zero-to-All Code Generation


39. MileGPO: Milestone Inference with Local Evidence for Graph-Based Policy Optimization of Long-Horizon LLM Agents


40. Distilling Aggregate Mobility Statistics into a Language Model Policy for Post-Event Crowd Simulation


41. Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay


42. TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling


43. Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation


44. PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment


45. When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models


46. Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)


47. Measuring What a Specification Determines: A Formal Semantic-Block Model and an Execution-Judged Benchmark


48. Are LLMs becoming similarly creative? Evidence from three years of models


49. HYDRA: A Heterogeneous Chiplet DSE Framework for Serving Dynamic Hybrid LLM Workloads


50. Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?


51. Improved Confidence Estimates for Black-Box Large Language Models


52. Incident-Data Robustness Analysis of the OWASP Top 10 for LLM Applications (2026): How a Community-Expert Ranking Holds Up Against a Large-Scale LLM Incident Corpus


53. When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models


54. Can Conversational AI loosen Us-Versus-Them Boundaries? The Effects of Common, Dual, and Separate Identity Framings on Pro-Immigrant Intergroup Helping


55. Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life


56. Represented but Ignored: A Causal Account of Prosodic Underuse in Audio-Language Models


57. Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses


58. Automatic bioinformatic software named entity recognition from literature


59. Transformer Models for Text Summarization: A Comparative Study of BART, BERT, and RoBERTa