LLM 관련 주요 논문 - 2026-07-30

1. OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding


2. Linguistic Monoculture in LLM-Assisted Language Use


3. AgentMap: Joint Equivalence and Subsumption Discovery for Ontology Matching


4. On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment


5. Setoka: A Benchmark for Hierarchical User Understanding in Personalized Agents over Heterogeneous Data


6. Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM


7. UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks


8. AgenticCANN: Automated Ascend C Operator Generation via Knowledge-Augmented Agentic Evolution


9. Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting


10. AlphaSchema: Exploring the Space of Trading Semantics for LLM-Based Alpha Mining


11. Eco3S: Complex Socio-Economic System Simulation via Agent-Based Models


12. EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks


13. MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning


14. CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games


15. Exploring Structures in Physics Problems: Can AI Agents Discover Statistical Mechanical Mappings?


16. TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning


17. Position: Evaluation Scores Are Perishable Knowledge Claims


18. GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure


19. GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning


20. Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems



22. MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning


23. SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context


24. Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents


25. MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair


26. SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence


27. Progressive Multimodal Alignment for Continual Instruction Tuning


28. Human diversity fuels collective creativity that large language models cannot simulate or sustain


29. Hearsay: Vision-Language Medical Diagnoses Without an Image


30. Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents


31. ReCo: Reweighting GRPO Against Distributional Concentration


32. From Representations to Behaviors: Exploring the Person-Situation-Behavior Triad in LLMs


33. Budget-Aware LLM Discovery via Cost-Calibrated Frontier Utility


34. SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response


35. SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution


36. See2Think: Do Multimodal Models Really Use Intermediate Visual States?


37. Phoneme- vs. Character-Level Targets and Selective State-Space Models for Intracortical Brain-to-Text


38. Dual Inversion for Text-to-Image Diffusion Models: From Both Prompt and Noise Perspectives


39. Scientific Knowledge Discovery in the Age of Large Language Models


40. Filesystem-Based Memory for LLM Agents: Organization, Evolution, and Sustainability


41. WhisperRec: Latent Reasoning for Efficient Foundation Recommendation Models


42. Living-Harness Is an Interactive-Agent Evolver


43. Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution


44. A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents


45. Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks


46. HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models


47. LLMET: Enabling Cross-Layer Evaluation of Emerging M3D Memories for Energy-Efficient LLM Serving


48. ForgetBench: Benchmarking Forgetting Dynamics of Long-Term Parametric Memory in Language Models


49. Mergeable Model-Side Aggregation States for Long-Context Language Models


50. Voice Memory for Agentic Speech Recognition


51. Misalignment Has a Personality: A Big Five Account of Emergent Misalignment


52. Diagnosing Fine-Grained Inconsistency Classification in Financial Disclosure Text


53. Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning


54. When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses


55. Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach


56. StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents


57. Model-Driven Requirements Configuration with Three-Valued Uncertainty Scoring


58. Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges


59. (EC)2: Event-Centric Explainability for Cybersecurity Through Multi-Agent LLM Investigations


60. Cognitive Convergence: Deep Similarities Between Large Language Models and Human Cognition


61. GPT-Red: Automated Red Teaming via Self-Play at Scale


62. A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models


63. FinCacheServe: Dependency-Consistent Answer Reuse for Cost-Efficient RAG Serving over Mutable Enterprise Documents


64. IDP AutoOpt: Agent-Driven Optimization of Document Processing Pipeline Configurations


65. IFCMemoryBench: Evaluating Long-Term Memory of LLM-Based Agents in BIM Information Retrieval



67. The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty


68. Do Methods Support the Claims? Intra-Paper Verification for Peer Review


69. Identifying Implicit Bias in LLM-based Chat AI Toward People with Intellectual Disabilities


70. Large-Scale ChatBot Validation Through Customer Digital Twin Simulations


71. Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact