LLM 관련 주요 논문 - 2026-07-31

1. AISPA: User-Centric System Prompt Auditing for Large Language Model Applications


2. OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models


3. MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems


4. InfoOps Bench: A live information operations safety benchmark


5. A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks


6. A report-grounded vision-language foundation model for colonoscopy from 280000 routine reports


7. Metaphor Tracer: A Theory-Informed Analysis of Hidden States


8. A foundation model of numerical intelligence with cross-disciplinary generalization


9. When Derived Measurements Mislead: Quantifying and Mitigating LLM Over-Trust with Privileged-Modality Reliability Evidence


10. WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning


11. GLM-RAG: Graph Language Models for Graph-Based Retrieval-Augmented Generation


12. When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences


13. Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents


14. PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?


15. One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence


16. MemHarness: Memory Is Reconstructed, Not Replayed


17. LLM-Guided Evolutionary Search for Constraint Model Reformulation to Improve Solver Efficiency


18. CDAE: Enhancing Perturbation Robustness in Pretrained Language Models with Contrastive Denoising


19. ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs


20. BlueprintRepair: Typed Local Edits for Failed Lean Proof Blueprints


21. Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training


22. MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck


23. SciDataSailor: Deep Scientific Data Exploring


24. An Instrument to Evaluate Governance Proposals: AI Policy Analysis at Scale


25. Distilling Answer Set Programming Theories from Large Language Models


26. Group-Reflective Self-Distillation for Agentic Reinforcement Learning


27. SKILL-KD: Contrastive Skill Distillation for LLM Agents


28. DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness


29. MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware


30. Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation


31. From Scoring to Acting: Outcome-Verified Comparative Self-Distillation for LLM Agents


32. Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training


33. One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs


34. IFHierBench: Hierarchical Instruction Following for Large Language Models


35. A Cross-Architecture Audit of Direction-Based Inference-Time Defences in Vision-Language Models


36. MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos


37. Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning


38. Crossing the Margin Cliff: Toward Relearn-Robust LLM Unlearning via Margin Calibration


39. MemTxn: A Transaction Boundary for Source-Supported Updates and Complete-State Recovery in Agent Memory


40. Sign Language Question Answering: A New Task, Benchmark, and Baseline for Sign Language Understanding


41. STEREODISCO: Discovering Stereotypicality in LLMs


42. MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes


43. VeriSkill: A Self-Evolution Framework for Program Verification Skills


44. Baikal: Structured Search for Deep Research over Data Lakes


45. Albilich: Steerable Proof-State Orchestration for LLM-Based Mathematical Research with CAS Integration


46. SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them


47. Guiding Large Language Models with Genetic Programming-Evolved Heuristic Knowledge for Dynamic Multi-Mode Project Scheduling


48. Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch


49. Evaluating and Pricing Advertisements in AI-Generated Responses


50. ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning


51. Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures


52. World Action Planner: Generalizable Decision-Making with Action-Conditioned World Models


53. From Minds to Models: The Intersection of Psychology and LLM Behaviours


54. DeepResearch Agent System


55. Evaluating Agentic Bioinformatics through Function, Evidence, and Validation


56. Using Large Language Models for Idea Generation in Innovation


57. A dataset of rated conceptual arguments


58. MedLLM: An Open Medical Language Model at the Sub-Billion Scale


59. Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents


60. Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems


61. Dimensionality and Measurement Precision in HLE’s Multiple-Choice Subset


62. Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs


63. Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models


64. SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis


65. Divergence Decoding: Training-Free Capability Fusion


66. KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation


67. ReToken: One Token to Improve Vision-Language Models for Visual Retrieval


68. PAIChecker: Uncovering and Checking PR-Issue Misalignment in SWE-Bench-Like Benchmarks


69. Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B


70. ORCA-bench: How Ready Are Language Model Agents for Oncall?


71. TCA-SIR: Learning Target-Conditioned Abstractions for Scientific Inspiration Retrieval


72. ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding


73. From Textual Requirements to Microservice Architectures - A Comprehensive Evaluation of LLM-Based Design Synthesis


74. CACHE-UK: A Stability-Aware Memory Editor for Sequentially Updated Quantized LLMs in Finance


75. Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation


76. EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents


77. Vibe-FDTR: An agent-oriented framework for reproducible frequency-domain thermoreflectance data analysis


78. The MADRS Pipeline: Supporting Depression Assessment in Clinical Trials


79. Where and When to Commit: Candidate-Aware Decoding for Diffusion Language Models


80. Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game


81. Asymmetric Communication: Large Language Models and Language Games


82. Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models


83. VISA: A Structured Description Protocol for Agent-Based Simulation Models Towards Machine Reproducibility


84. Flux-OPD: On-Policy Distillation with Evolving Contexts


85. RepBench: Compiling Benchmarks into Capability Representations for Large Language Models


86. TAPO: Transition-Aware Policy Optimization for LLM Agents


87. Specification-Guided Synthesis of Deadlock-Free Communication Protocol Refinements with Large Language Models


88. $Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems


89. SciSchema.org: A Multidisciplinary Collection of Schemas for Structured Scientific Process Descriptions


90. Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs


91. Interpretable Representation via LLM-Driven Generative Disentanglement for Local-Life Service Recommendation


92. ARES: Adaptive Reasoning-Effort Steering for PPA- and Cost-Aware RTL Optimization with LLM Agents


93. AutoSupervision: Closing the Feedback Loop in Scientific Workflows with Grounded Revision Verification


94. Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation


95. Semantic-Aligned Structural Abstraction for Multimodal Sentiment Analysis


96. Reasoning Consensus: Structural Ensembling of LLM Reasoning via Weighted DAG Aggregation


97. Hierarchical Latent Reasoning for LLM-based Recommendation


98. Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities


99. Towards joint scaling laws with optimal batch size schedules


100. RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation


101. JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles


102. From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models


103. DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation


104. A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response


105. Beyond Similarity: Grounded Agentic Extraction and Expert-Adjudicated Evaluation of Intertextuality in Classical Chinese Histories


106. Drawing-Recode: Annotation Grounding for Parametric CAD Code Generation from Raster 2D CAD Drawings


107. Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games


108. ThreatForest: Multi-Agent Attack Tree Generation with Pluggable TTP Framework Mapping


109. Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models


110. Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models


111. Benchmarking LLM Competence on Logical Inference over Probability Operators


112. AHA-Memes: A Fine-Grained Multimodal Benchmark for Understanding Hate in Arabic Memes


113. FunL2O: LLM-Guided Feature Function Design for Learning to Optimize


114. Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models


115. RoguePrompt: Dual-Layer Encoding for Self-Reconstruction to Circumvent LLM Moderation


116. Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents


117. FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs


118. LLM-Guided Initialization for Accelerated Hybrid Quantum-Classical Medical Image Classification


119. Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups