LLM 관련 주요 논문 - 2026-07-10

1. Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation


2. AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding


3. Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows


4. The Illusion of Equivalency: Statistical Characterization of Quantization Effects in LLMs


5. SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets


6. Formal Mechanisms for Market Stability in Self-Interested Agent Societies: A Marketplace Simulation Study


7. The complexities of patient-centred conversational artificial intelligence


8. Towards Precision Therapy in Hepatocellular Carcinoma: A Clinical-Reasoning LLM for Risk Stratification and Treatment Guidance


9. OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice


10. Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination


11. Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning


12. Understanding Axes of Difficulty For Long Context Tasks Via PredicateLongBench


13. PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs


14. MentalHospital: A Virtual Environment for Evaluating Psychiatric Clinical Encounters


15. Compete Then Collaborate: Frontier AI Teachers Build a Verifiable Curriculum to Improve a Coding Student Beyond Imitation


16. A First-Principles Theory of Slow Thinking and Active Perception


17. Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets


18. CausalDS: Benchmarking Causal Reasoning in Data-Science Agents


19. When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals


20. A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis


21. From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents


22. Concretized Proposition Prompting Resolves Composition-Knowledge Dichotomy in Large Language Models



24. Persona Cartography: Charting Language Model Personality Traits in Weight Space


25. Nigeria Machinery: A Low-Resource Industrial Dataset with a Domain-Grounded Reasoning Layer


26. Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting


27. VectorizationLLM: Smart Vectorization Based AI Assistant


28. Alignment Plausibility: A New Standard for Assuring AI in Healthcare


29. Aligning Clinical Needs and AI Capabilities: A Survey on LLMs for Medical Reasoning


30. Adversarial Social Epistemology for Assemblies of Humans and Large Language Models


31. Context Graphs for Proactive Enterprise Agents


32. SLORR: Simple and Efficient In-Training Low-Rank Regularization


33. Validity of LLMs as data annotators: AMALIA on authority


34. A Practical Investigation of Training-free Relaxed Speculative Decoding



36. UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing


37. When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities


38. SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling


39. DocMaster: A Hierarchical Structure-Aware System for Document Analysis


40. When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability


41. VEGAS: Human-Aligned Video Caption Evaluation via Gaze


42. Two Axes of LLM Abstention: Answer Correctness and Question Answerability


43. When Synthetic Speech Is All You Have: Better Call GRPO


44. DrugGen 2: A disease-aware language model for enhancing drug discovery


45. TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories


46. Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition


47. FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation


48. From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure


49. Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models


50. Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs


51. Out of Sight: Compression-Aware Content Protection against Agentic Crawlers


52. LEXIC: Lightweight Eye-tracking eXtension via Injected Complexity


53. ICDAR 2026 HIPE-OCRepair Competition on LLM-Assisted OCR Post-Correction for Historical Documents


54. When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models


55. Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization


56. Reinforcing the Generation Order of Multimodal Masked Diffusion Models


57. Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA


58. What LLM Forecasters Know but Don’t Say: Probing Internal Representations for Calibration and Faithfulness


59. PLURAL: A Global Dataset for Value Alignment


60. Structured Pruning of Large Language Models via Power Transformation and Sign-Preserving Score Aggregation with Adaptive Feature Retention


61. Can We Trust LLM’s Logic? Quantifying Uncertainty, Coherence, and Robustness via a Graph-Based Framework


62. Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions


63. Reaction-network reasoning with frontier models for experimentally confirmed catalyst-selectivity hypotheses


64. Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems


65. 3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse


66. When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning


67. A Multi-cluster Boundary Learning Method for Out-of-Scope Intent Detection via MiniLM Embedding


68. Efficient Safety Alignment of Language Models via Latent Personality Traits


69. Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs


70. How Do I Know What to Say Next? Barenholtz’s Autogenerative Theory as an Enrichment of Harrisean Integrationism


71. From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue


72. From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier


73. ReCoLoRA: Spectrum-Aware Recursive Consolidation for Continual LLM Fine-Tuning