LLM 관련 주요 논문 - 2026-09-03

1. Large Language Models (LLMs) for Telecom Root Cause Analysis (RCA): A Structured Reasoning Framework for Evidence-Grounded Diagnosis


2. SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment


3. Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems


4. Door-in-the-Face Requests and Refusal Behaviour in Large Language Models


5. Loom: Weaving Diagnostic Strands into Free-Text Consensus via Embedding-Space Reweighting


6. CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI


7. UTP-Bench: Uncertainty-aware Travel Planning Benchmark


8. Diagnosing with Insights: Structured Analysis of Agent Failures via Behavioral Abstractions


9. SCX Router: Streaming Zero-Shot Model Selection with a Decoder-KV Classifier and a Real-World Task Ontology


10. CoMerge: Conflict-Driven Preference Optimization for Multi-Task Model Merging


11. Codebook Agent: Amortized Topology Design for LLM Multi-Agent Systems


12. APEx: Distillation of Agent Procedural Experience for Adaptive Deep Research Question Answering


13. LLM-as-a-Judge Is Not an Oracle: Why Self-Improving Agents Need Deterministic Guardrails


14. Task-Level Natural Language Priors as Learning Signals for Low-Resource LLM Training


15. PGPO: Potential-Guided Policy Optimization for Multi-Turn Agentic Tasks


16. SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams


17. PEARL: Path-Entity Aligned Relational Learning with Contextual Subgraphs for Inductive Knowledge Graph Completion


18. ASCII Attack: Recontextualising Harmful Requests as Artistic Critique in Large Language Models


19. EmoStance: Response-Side Affective-Orientation Control for Empathetic Response Generation via Emoji Weak Supervision


20. Semantic Signal-Assisted Inspection and Recovery Allocation in Reverse Logistics


21. MASkills: Continual Skills Optimization for Multi-Agent LLM Systems


22. Beyond Outcome Gaps: Process-Aware Fairness Diagnosis for LLM-based Multi-Agent Decision Systems


23. ToolGate: An Executable Acceptance Pipeline for Tool-Dependent Scientific Benchmark Construction


24. DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents


25. HeadWiseKV: Budgeted Per-Head Cache Residency for Hybrid Long-Context Language Models


26. When Agents Implement Systems: A Case Study in Defects, Detection, and Evaluation Rigor


27. Benchmarking Language Models for Statistical Problem Formulation


28. Post-Training Ternarization of Qwen3-4B Capability, Effective Bit Budget, Storage Compression, and Deployment


29. Epistemic Sybil Resistance: Multiplying AI Agents Without Multiplying Evidence


30. Belief-Calibrated Optimization: An Explicit World Model for Agentic Optimization


31. Architecting Conversational Data Systems for Stateless LLM APIs: The Hydration Proxy Pattern


32. Induction and Inquiry via Probabilistic Reasoning over Language and Code


33. EvalDetectBench: A Benchmark for Measuring Evaluation Awareness in Frontier Language Models


34. Post-Training Language Models for Gold-Medal Performance in Coding Competitions


35. Dutch Books for Language Models


36. Untangling the Mechanisms of Misleading Context in Medical Question Answering


37. Language Models Can Control Their Own Attention


38. RVSD: Retrieval Vision Sparse Decoding for Mitigating Visual Hallucinations in Large Vision-Language Models


39. DKL: Decoupled Knowledge Learning for Instruction-Tuned Language Models


40. From Tokens to Semantics: Leveraging Complementary Signals for Hallucination Detection in Black-Box LLMs


41. Automated Vulnerability Injection in Smart Contracts Using Large Language Models


42. Competitive Market Behavior of LLMs


43. Learn from Whoever Is Right: Answer-Verified Multi-Teacher Distillation for Multi-Domain LLMs


44. ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering


45. DeepAffinity: Long-Term Aspect Preference Prediction in eCommerce using Small Language Models


46. Scalable Kronecker-Fisher Approximation: Efficient Hessian Analysis for Billion-Parameter Language Models Compression


47. PolERo: Studying Political Evasion in Romanian


48. MultiGhostBench: A Multilingual Benchmark for Long-Form LLM-Generated Text Attribution under Distribution Shifts


49. NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning


50. What Is Worth Representing? Representational Empowerment for Continual Model Construction


51. SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment


52. Auditory Illusion Benchmark for Large Audio Language Models


53. Do Large Language Models Capture the Diversity in their Training Data?


54. InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models


55. OmegaUse-SOP: SOP Engineering for Professional Computer Use from Human Demonstrations


56. C$^{3}$T: Counterfactual Causal Reasoning for Sentiment Shifts in Social-Media Conversation Trees


57. text2ql: Multi-Target Natural Language Querying via a Language-Agnostic Intermediate Representation


58. MeanField Surrogate Modeling for Scalable Runtime Scheduling of Concurrent Heterogeneous AI Inference on Shared GPUs


59. Predict, Don’t Iterate: Efficient Adaptive-Length Infilling for Diffusion Language Models


60. Git4Data: Database-Native Version Control for AI Agents


61. Federated LoRA Adaptation of BiomedCLIP Across Four International Chest X-Ray Cohorts


62. Transfer Safety Awareness for Cross-Modal Safety Drift in Multimodal Large Language Models


63. Seed-Anchored Budget-Bounded Graph Rendering for Question Answering on Industry-Standard Power-Grid Information and Exchange Models


64. Knowing Is Not Enough: Information Retrievability as a Precondition to Effective LLM Oversight


65. On-Policy Distillation Meets Off-Policy GRPO: Training Compact Instruction-Following Rerankers


66. Sparse Readout Prism: Explaining Logit-Lens Scores in Features Instead of Tokens


67. Accurate in space, unreliable in time: how LLMs represent national cultural change


68. Thinking effort aligns between humans and reasoning models in abductive reasoning


69. Agent Memory Is a Surface for Endogenous Authorization Laundering


70. Interpretable Symptom Vectors for Depression in a Large Language Model


71. hLLM: Single Pass Decoding for Generative Reranking


72. VakyArth: Evaluating Pragmatic Competence in LLMs across Indic Languages


73. Agents That Model Agents: Five Principles Toward a Theory of Mind for 6G Networks


74. Harness Engineering in LLM Tool Use via Agent-Native Reusable Tool Primitives


75. HEAT: Faster Fully Homomorphic Inference via Approximations-Weights Co-Adaptation


76. Public-Sharing Labels and Verbatim Field Egress in an MCP-to-A2A Agent Configuration: A Controlled Multi-Model Study


77. Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports


78. How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making


79. PRO-Step: Step-level Process Reward Optimization for Retrieval-Augmented Generation


80. NeoMME: A Single-Tower Multimodal-Native Multilingual Foundation Encoder for Efficient Fine-Tuning and Inference


81. The Utility of LLMs in Recommender Systems Explanation Evaluation



83. WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling


84. Two Centuries of Sexism in British Parliament: A Computational Analysis of Women’s Representation in the Hansard Corpus