LLM 관련 주요 논문 - 2026-07-03

1. ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning


2. What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates


3. Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach


4. Text-Driven 3D Indoor Scene Synthesis in Non-Manhattan Environments


5. Fast Multi-dimensional Refusal Subspaces via RFM-AGOP


6. Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems


7. DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models


8. Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics


9. A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets


10. AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents


11. Purified OPSD: On-Policy Self-Distillation Without Losing How to Think


12. UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development


13. A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks


14. A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction


15. Enhancing Fitness Intelligence through Domain-Specific LLM Post-Training


16. PACE: A Proxy for Agentic Capability Evaluation


17. Hidden Forgetting in Continual Multimodal Learning: When Accuracy Survives but Grounding Fails


18. InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories


19. Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing


20. OntoLearner: A Modular Python Library for Ontology Learning with Large Language Models


21. Atomic Task Graph: A Unified Framework for Agentic Planning and Execution


22. A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory


23. ContextSniper: AntTrail’s Token-Efficient Code Memory for Repository-Level Program Repair


24. Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code


25. SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use


26. Safety Targeted Embedding Exploit via Refinement


27. Pre-Flight: A Benchmark for Evaluating Large Language Models on Aviation Operational Knowledge


28. MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support


29. Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification


30. Subliminal Clocks: Latent Time Modelling in Diffusion Language Models


31. Verifiable Knowledge Expansion through Retrieval-Grounded Formal Concept Analysis


32. Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts


33. SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation


34. Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction


35. Meta-Benchmarks for Financial-Services LLM Evaluation


36. Distributionally Robust Listwise Preference Optimization


37. Generic Expert Coverage for Pruning SparseMixture-of-Experts Language Models


38. COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows


39. Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing


40. Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling


41. SemHash-LLM: A Multi-Granularity Semantic Hashing Framework for Document Deduplication


42. Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model


43. Hawk: Harnessing Hardware-Aware Knowledge for High-Performance NPU Kernel Generation


44. EO-Agents: A Three-Agent LLM Pipeline for Earth Observation Hypothesis Generation


45. OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration


46. Revisiting Chain-of-Thought Reasoning under Limited Supervision: Semi-supervised Chain-of-Thought Learning


47. Procedural Memory Distillation: Online Reflection for Self-Improving Language Models


48. Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows


49. Discrete Diffusion Language Models for Interactive Radiology Report Drafting


50. CreativityNeuro: Steering Language Model Weights to Improve Divergent Thinking and Reduce Mode Collapse


51. Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases


52. The Wiola Architecture for Efficient Small Language Models


53. LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning


54. Program-as-Weights: A Programming Paradigm for Fuzzy Functions


55. Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas


56. DemoPSD: Disagreement-Modulated Policy Self-Distillation


57. Neuron-Aware Data Selection for Annotation-Free LLM Self-Distillation


58. VisionAId: An Offline-First Multimodal Android Assistant for People with Visual Impairment, Featuring Personalized Object Retrieval


59. The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry


60. SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces


61. AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models


62. Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages


63. Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring


64. An Efficient vLLM-Based Inference Pipeline for Unified Audio Understanding and Generation


65. ESC: Emotional Self-Correction for Reliable Vision-Language Models


66. kNNGuard: Turning LLM Hidden Activations into a Training-Free Configurable Guardrail


67. Prompt Coverage Adequacy


68. SPLIT: Cross-Lingual Empathy and Cultural Grounding in English and Ukrainian LLM Responses


69. Towards Load-Aware Prefill Deflection for Disaggregated LLM Serving


70. MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding


71. Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias


72. Object Aligner: A Configurable JSON Schema Similarity Score for Graphs, Applied to LLM Prompt Optimization


73. Robust for the Wrong Reasons: The Representational Geometry of LLM Robustness to Science Skepticism


74. AIriskEval-edu: New Dataset for Risk Assessment in AI-mediated K-12 Educational Explanations


75. SABER: A Semantic-Aligned Brain Network Analysis Framework via Multi-scale Hypergraphs


76. Rank-Then-Act: Reward-Free Control from Frame-Order Progress


77. SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models


78. An Exploratory Study on LLM-Generated Code and Comments in Code Repositories


79. Evaluating Chunking Strategies for Retrieval-Augmented Generation on Academic Texts


80. MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models


81. Expander Sparse Autoencoders: Parameter-Efficient Dictionaries for Mechanistic Interpretability


82. MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding


83. AgenticDataBench: A Comprehensive Benchmark for Data Agents


84. ADVENT: LLM-Driven Automatic Predicate Invention for ILP


85. DiPS: Dialogue Policy Selection for High-Stakes Persuasion Agents


86. Evolutionary Feature Engineering for Structured Data


87. Don’t Let Gains FADE: Breaking Down Policy Gradient Weights in RL


88. Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting


89. Token Geometry


90. IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs


91. Black-Box Inference of LLM Architectural Properties with Restrictive API Access


92. Generative AI and Federated Learning for Intrusion Detection Systems: A Survey


93. CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection


94. Adaptive Companionship for Group-Following Robots: Handling Dynamically Changing Group Formations


95. AI Assistance for Human Review of Default Judgments


96. How Indian Dermatologists are Utilizing Artificial Intelligence for Clinical Practice and Workflow Management: A Nationwide Survey with a Special Focus on atopic dermatitis


97. A Practice Auditing Framework for Large Language Model Use: Collective Empiricism, Pseudo-Rational Cognition, and Governance of AI-Generated Content


98. LLMs as Teaching Assistants for Mathematics Exam Grading: Reliability, and Practical Usability


99. Office Comprehension Benchmark


100. ExPerT: Personalizing LLM Responses to Users’ Domain Expertise via Query-Wise Semantic and Keystroke Behavioral Cues


101. Mapping Text to Multiplex Graph: Prompt Compression as Lévy Walk-Guided Graph Pruning


102. Prompt Framing Distorts Count-Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring


103. Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment


104. Kara: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression


105. Safeguarding LLM Agents from Misalignment through Provenance Analysis


106. TokenScope: Token-Level Explainability and Interpretability for Code-Oriented Tasks in Large Language Models