LLM 관련 주요 논문 - 2026-09-16

1. Verifiable Social Reasoning for LLM Assistants


2. JustFit: 200K-Token LLM Serving on a 24 GiB Laptop with Just-in-Time State Management


3. World Model Science: Self-Organized Criticality, Weak Chaos, and Metastable Belief Dynamics in Long-Horizon LLM Agents


4. Never Stop Thinking: Continuous-Time Language Agents


5. Self-Emergence Agent Architecture:Behavior-Inertia HMM, Reflexive Metacognition,and Social-Contrastive Self-Modeling


6. Extracting ontology-compliant knowledge from scientific text describing irradiated materials using large language models


7. End-to-End Latency-Minimizing and Load-Balanced Request Scheduling for Edge LLM Inference in Agentic AI Services


8. FirmCORe: A Benchmark for Structured Reasoning about Inter-Firm Collaboration Opportunities


9. Symbolic Separation: Grounding Deep Agents in Knowledge Graphs for Trustworthy Operational Data Analytics


10. Interactive Memory Learning for Long-Term Conversations


11. Sparse MLLM Anchors, Dense Adaptation: Breaking the Self-Referential Loop in Wild Test-Time Adaptation


12. SKIP: a Self-knowledge-guided Step-wise Preference Learning Framework for Concise Reasoning


13. FlexEE: Self-Speculative and KV-Compatible Early Exiting for Offloading-Aware LLM Inference


14. Affect-Prototype Guided Fusion for Open-Vocabulary Incomplete Multi-modal Emotion Recognition


15. QART: A Quantum-Classical Hybrid Architecture for Long-Horizon Reasoning – Exploring a Conditional Path toward Quantum Scaling


16. Bridging Learned Visual Perception and Symbolic Belief-Space Planning


17. CoAdapt: An LLM-based Framework for Adaptive Collaborative Perception in IIoT Robotic Swarms


18. Can We Do Interpretable NLI with Graphs Based on Atomic Propositions?


19. Layers, Sinks, and Scaling: Adaptive Evidence Selection for Multimodal Large Language Models


20. Integrating the Analytic Hierarchy Process with Large Language Models for Transparent Multi-Criteria Decision-Making


21. Turn-level Multiscale Density Ratio Estimation for LLM Agents


22. VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs


23. little m: An AI Agent for Industrial Process Optimization


24. ANIMASK: What the Model Contributes to Role Play in Simulated Story Worlds


25. A Framework for Generating Valid Context-Specific Benchmarks through Expert Guidance


26. Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models


27. AquiLLM: Evaluating Faithfulness in Open-Weight RAG-LLM Systems for Scientific Research


28. Skill-based Agentic Evaluation for Real-time Data Science Tasks


29. Fine-Tuning Fixes Mode Collapse and Over-Dispersion in LLMs


30. Breaking the 1.58-bit Barrier for Ternary LLMs


31. BLINDSPOT: A Benchmark for Safety and Refusal Calibration in Long-Horizon Tool-Using Agents


32. CLEAR: Cross-Source Evidence Adjudication for Large Language Models in Medicine


33. The Pain Axis: LLMs Represent Self-Directed Harm and Act to Relieve It


34. Metacognitive Steering: Learning the Structure of Scientific Judgment


35. Toward Governance-Aware Autonomous GIS: A Narrative Review of Ethical and Privacy Risks in LLM-Enabled GeoAI


36. Artificial intelligence and biosecurity: capabilities, threat pathways, and defense-in-depth governance


37. Calibrate, Then Route: A Measured Study of Learned Request Routing for Disaggregated LLM Serving


38. Position: AI Is Not Ready for Strategic Conflicts


39. Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation


40. When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control


41. Coupled Calibration and Learning: Mitigating Teacher Bias in LLM Distillation without Target-Domain Reward Feedback


42. Where Should a Document Live: Context, Representations, or Parameters?


43. Vroom-Vroom at SHROOM-Visions: A Multi-Judge Committee for Detecting Hallucinated Spans in Vision-Language Outputs


44. Mo’ Models, Mo’ Problems: How to best select model pools when designing Multi-Agent Systems


45. Easy to Catch a Liar, Hard to Clear an Honest One: Language Models Diagnosing a Corrupted Reward Channel from a Verified Record


46. ResLRP: The Role of Residual Cancellation in Attribution Instability in Vision Transformers


47. Finding Common Mistakes In Modelling With Mathematical Formalisms Using LLMs


48. Beyond “ChatGPT Can Make Mistakes”: Designing Interventions to Support Metacognitive Monitoring in AI-Assisted Work


49. The Role of Implicit and Explicit Demographic Signals in Large Language Model-based Student Assessment


50. Beyond Token-Local Imitation: Reward-Compatible Temporal Credit Assignment for On-Policy Distillation


51. RepoAtlas: Guiding Coding Agents via Evolving Multimodal Repository Views


52. When Confidence Signals Disagree: Local and Global Confidence in Autoregressive Language Models


53. StackTok: Accelerating VLMs Inference with Budget-Adaptive Visual Token Selection


54. Available but Unclaimed: An Empirical Study of Human-AI Synergy


55. TAME: Token Attribution and Masking for Emergent misalignment


56. RoleBreak: Benchmarking Long-Horizon Role-Playing Robustness in Spoken Dialogue


57. Large Language Models in the Loop: A Stability- and Network-Aware Survey in Networked Control, Cyber-Physical, and Multi-Agent Systems


58. Competence-Preserving Resume Perturbations Expose Presentation Sensitivity in LLM Screening


59. Beyond the Name: Demographic Leakage in De-Identified Résumés and Evaluation Artifacts in LLM Bias Audits


60. Geospatial Metadata Improves Discoverability by Connecting Datasets Across Scientific Disciplines


61. AI Policies: Help or Hindrance? A Software Developer’s Perspective


62. Protocol-Preserving Context Trimming for Agentic Workflows: Benefits, Failure Regimes, and Budget Guardrails


63. Early-Bird Decoding: Accelerating Diffusion LLMs with Learnable Block Sizes and Parallel Sampling


64. Interpreting and Steering LLM Agents for Social Simulations


65. UDAV: Uncertainty-Driven Adaptive VLM Waypoint Planner


66. ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement


67. Efficient Reasoning Distillation: Small Video-Language Models via Synthetic CoT and Difficulty-Aware Fine-Tuning


68. SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes


69. Permutation-Based Stegomalware in Large Language Models: Threats and Countermeasures


70. LLMs as Master Forgers: Generating Synthetic Time Series Data for Manufacturing


71. Universal Defenses for Tool-Integrated LLM Agents Against Adversarial Attacks


72. Coaching Qwen3 Coder 30B to Think Like a CodeClash Arena Agent


73. RAG-CT: Mitigating Privacy Risks on Retrieval-Augmented Generation Systems via Scanning Prompt Distribution


74. MUUNRiver-Bench: Diagnosing Relation-Dependent Music Retrieval with Multimodal Instructions


75. The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis


76. Beyond Distribution Matching: Semantics-Consistent Tabular Diffusion with Weak Semantic Priors


77. You Don’t Need To Train: Agentic Heuristic Learning Studio for Executable Human Activity Recognition


78. POSPAN: Position-Constrained Span Masking for Language Model Pre-training


79. HintMiner: Automatic Question Hints Mining From Q&A Web Posts with Language Model via Self-Supervised Learning


80. OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning


81. State of Thought Enables Endogenous Reasoning


82. Retrieval-Driven Memory Reconsolidation for Long-Term LLM Agents