LLM 관련 주요 논문 - 2026-09-18

1. An Empirical Study of Harness Design for Coding Agents


2. Q&A on Any Spreadsheet Requires Interpreting Its Grid Structure


3. Deep Noir: Autonomous Steering Discovery via Architectural Chronometry in Transformer Models


4. Language-model groups overstate consensus when replaying human deliberation on a reasoning task


5. How Do Agent Harnesses Create Value? Planning Information and Release Control in Stateful LLM Agents


6. SkillAA: Attribution-Guided Skill-Graph Updating with Targeted Validation and Rollback


7. MTVA-Bench: Evaluating the Language Model Inside Cascaded Voice Agents


8. Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents


9. Tailored to you: longitudinal effects of personalising language models


10. Marginal utility, matrix factorization, and the Key-Value (KV) cache: a unified information-economic framework for sovereign geo-mining inference


11. WiCleanData: Guaranteeing the Type Consistency of Wikidata by Taxonomy Refinement and Constraint Enforcement


12. Can Data Attribution Filter Out Subliminal Learning? Not Reliably


13. Geopolitical Divisions Across Languages in Large Language Models


14. Not All AI Agents Are Equal: Characterizing Resource and Performance Dynamics


15. MaSCoD: A Multi-Agent Framework for Structural-Context-Guided Candidate Causal Graph Generation


16. Beyond Depth Truncation: Controlled Evaluation of Depth Utilization in Recursive Language Models


17. From “Who Is This User?” to “What Does This Purchase Mean?”: A Deployed Pipeline for Semantic User Profiling at Bank Scale


18. Reproducibility is not construct validity: LLM measurement of institutionally situated communication


19. A Dual-Process Perspective on Nudge Susceptibility in LLM-Based GUI Agents


20. Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization


21. Contagion on the Trading Floor: How Adversarial Signals Spread in Multi-Agent Trading Systems


22. Rethinking Multi-Agent Collaboration: When More Is Less


23. AutoData: Agentic Search for Pre-training Data Selection


24. Replan, Repair, or Edit? A Unified Empirical Evaluation of Travel Agents for Itinerary Revision under Resource Disruptions


25. From Intent to Action: Benchmarking LLM Safety in Vehicle Voice Command Authorization


26. Agentic AI Networking for Heterogeneous Unmanned Aerial Systems in Low-Altitude Wireless Networks



28. A Unified Evaluation Framework for Trustworthy Large Language Models, Agentic AI, and Multimodal Systems


29. LLM-as-an-Improver: Turning Verification into Better Candidates


30. QVAC Genesis III: A Large-Scale, High-Quality Open Synthetic STEM Corpus for Efficient Language Model Pre-Training


31. Safety Beyond the Interface: Detecting Harm via Latent States in Large Language Models


32. Compositional Reasoning in Language Models under Reinforcement Learning Post-Training


33. Closed-World Resolution Against Tool Hallucination in LLM Agents


34. MAGS: Multi-agent Auto-formalization Guarantees Safety for Agentic Outputs


35. Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses


36. What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks


37. BioPhys-Bridge: A Benchmark for Interdisciplinary Scientific Reasoning in Physics-Grounded Biological Research


38. Coding Agents with an Obstacle-Aware Harness for Safe Robot Manipulation


39. Paint-Anything: Unified Any-Color Control for Image Generation and Editing


40. Quantifying Overclaiming Propensity in Frontier LLM Agents


41. Harm Laundering in GPT Models: Evidence That Gender Discrimination Is Transformed Rather Than Reduced Across Safety-Trained Generations


42. Large Language Models as Falsifiers for Cyber-Physical Systems


43. Chronicle: Cut-Point Replay for Regression Testing of LLM Agents


44. A Simulation Platform for AUV Fault Recovery: Exploring LLM-Based Diagnostic Strategies


45. Fingerprinting Multimodal Large Language Models


46. Xeno-Interpretability: Investigating the Alien Minds of LLMs


47. STR-Agent: An LLM-Driven Agent for QoS-Aware Routing in LEO Satellite Networks


48. LLM-Guided Transformation of Non-Critical Driving Scenes into Safety-Critical Scenarios Using Augmented Reality


49. Lens: Bringing the Right Semantic Perspective into Focus for Training-Free Multimodal Representation Learning


50. Is It Still Worth Training a Classical Model in the Era of LLMs? A Crossover Benchmark on Tabular Data


51. Music Hallucination in Audio-Language Models: A Hierarchical Formulation and Empirical Study


52. Designing Against Deskilling: Metacognitive Feedback Reduces Cognitive Offloading to LLM Assistants


53. Cross-Modal Attention Acts as a Frequency Filter: Why Verbose Prompts Improve Robustness in Vision-Language Models


54. AdaRepair-Mem: Adaptive Experience Orchestration for Repository-Level Program Repair


55. Local Sparsity Enables Unsupervised LLM Safety Detection


56. Multi-Dimensional Prosody Judgment For Live Streaming Speech Synthesis


57. MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards


58. Reading Emotions in the Token Space: Discriminative Adaptation of SpeechLLMs for Emotion Recognition


59. EPIG-Tree: Compute-Optimal Branching for Gradient-Efficient Reinforcement Learning


60. KoNeoBench: A Curated Evaluation Dataset for LLM Understanding of Korean Neologisms


61. PetriBench: Benchmarking LLM Reasoning over Dynamic State Spaces


62. Zarya: A Hybrid Autoregressive–Masked Diffusion Language Model with Flexible Training and Dual-Mode Inference



64. Learn Your Own Thoughts: Abstract Token Curriculum


65. SoK: Trading Agents or Market Crashers? Dissecting Robustness and Security Failures in Academic Financial LLM Trading Schemes


66. Self-Evolving Search Index


67. DataCanvas-EDU: An Agentic Framework for Instructor-Guided Synthetic Data Generation in Business Analytics Education


68. Semantic Layer Induction from Raw Telemetry via Hierarchical LLM and RAG Abstraction


69. Form Over Content In Gradient-Based Data Attribution Methods


70. CliniCIRCA: A Modular LLM Framework for Constructing Longitudinal Mental Health Patient Journeys from Raw EHR Narratives


71. Large Language Model Agents for Evidence Based Genetic Disease Severity Classification


72. Detecting Soft Errors in Parallel Software with LLM-tuned Instruction Duplication


73. AURORA: A Natural Language-Driven Agentic Framework for Understanding, Reasoning, and Orchestrating Reliable Air-Ground Co-Simulation


74. For Your Eyes Only: Evaluating Coordination Between Isolated Language Model Instances


75. Efficiently Linking Unstructured Data for Multi-step Reasoning


76. From Models to Systems: A Comprehensive Survey of Efficient Multimodal Learning


77. From Rollout to Reset: A Graph-Based Harness for Autonomous Long-Horizon Manipulation Evaluation


78. How to Guide Your Language Flow


79. Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment


80. Kinematics-Grounded Agentic AI for Robotic Additive Manufacturing Process Planning


81. GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning


82. Why Pretraining Fails to Share Cross-Lingual Knowledge


83. Robust Conformal Intrusion Detection via Traffic-Aware Calibration and Attack-Orbit Invariance


84. PAPC: Platform Mediation for Privacy-Propagation Externalities in AI-Mediated Workflows


85. Layer-wise Curriculum Learning for Efficient LLM Compression


86. Code-as-Auditor: Executable Compliance Reasoning via Regulation-to-Code