LLM 관련 주요 논문 - 2026-08-24

1. VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences


2. From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry


3. CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment


4. Enhancing LLMs in Predictive Political QA with Semi-Structured Data


5. Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda


6. ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models


7. When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge



9. Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance


10. Don’t Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents


11. Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models


12. Deep Learning Models Also Recall Features


13. Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning


14. The Logic of Machine Self-Preservation


15. UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists


16. MGAL: A Multilingual Granularity-Aware Long-Context Benchmark


17. RAG Deserves an Index: Why Ingest-Time Compilation Beats Query-Time Interpretation


18. TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding


19. Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence


20. Knowing but Not Saying: Preventing Factual Access Failures in LLM SFT via Recall-Anchored Distillation


21. Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring


22. Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization


23. Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design


24. Calibrating Criterion Revision in LLM Agents: Failure Modes and a Trace-Anchored Protocol


25. DirEAG: Dirichlet Evidence Aggregation for Calibrating Verbalized Confidence in Mathematical Reasoning


26. VortexChat: An agentic framework for autonomous multi-objective integrated photonic design


27. Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance


28. Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents


29. Dual-Cache Latent Space Communication between Heterogeneous Language Models


30. Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills


31. FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth


32. Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation


33. Consilience: Conformally Calibrated Communication Control for Hidden-Profile Multi-Agent Reasoning


34. Volumetric Radiology AI in the Era of Multimodal Large Language Models


35. FL-MAESTRO: Multi-Agent LLM Orchestration for Resource-Constrained Federated Learning


36. Terminal Agents: A Survey of AI Agents in Command-Line Environments


37. StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models


38. Nexus: Depth-Adaptive KV-Cache Splicing and Retrieval-Decoupled Tool Routing for Agentic LLMs on Unified Memory


39. Representation Affects Retrieval: A Case Study of Skill Discovery and Routing in a Multimodal Agent Harness


40. A Survey on Foundations and Frontiers of Multimodal Agentic Frameworks: Techniques and Applications


41. Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification


42. PrimeAgentOrchestrator: Memory-Primed Agent Spawning for Personal AI Infrastructure


43. SDAD: Spec-Driven Agentic Development for the AI-Native SDLC


44. Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning


45. EnSI-RAG: Entity-Structure-Indexed Retrieval-Augmented Generation for Long-Document Question Answering


46. Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration


47. No PUN Intended: Plausible Unknown Names for Person-Centred LLM Evaluation


48. Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds


49. HIERA: Workload-Aware Planning Across Implementation Spaces for GPU Kernel Optimization


50. Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System Intelligence


51. A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans


52. Atom Learning Model (ALM): how a real classroom got tokenised


53. ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents


54. Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems


55. PromptResponse: Optimizing Prompts for LLM Coding Tasks


56. $Z^2$-ACT: End-to-End Verifiable Agentic Intent Control for Open 6G RAN


57. Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge


58. Target-Aware Calibration Data Selection for Preserving Uncertainty in Quantized Language Models


59. Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models


60. Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making


61. Vibe Coding and Web Application Security: A Twin-Prompt Study


62. Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs


63. KREL: Automatic Medical Coding via Knowledge-Guided Reasoning over Clinical Evidence with LLMs


64. Profiling What Matters: Context-Aware Item Profiles from Large-Scale Metadata for LLM Recommenders


65. CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models


66. Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation


67. Temporal Validity on Real Software Histories: Eliminating Stale-Fact Errors in Code-Assistant Memory over GitHub Fixes


68. ARQ: Agentic CodeQL Query Refinement for C/C++ Vulnerability Detection


69. JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification


70. Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents


71. An integrated diffusion-weighted imaging processing and interpretation platform for MR-guided radiotherapy


72. Towards Traffic Modelling of Multi-Agent Systems: The Role of Coordination Topology


73. AEGIS: Preventing Cross-Domain Resource Abuse in MCP


74. Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources


75. An LLM agent for end-to-end computational materials discovery


76. ProofJudge: Tool-Grounded LLM Evaluation of Formal Proof Quality in Mathlib


77. Six misconceptions about large language models: A minimal model and diagnostic taxonomy


78. Rigorous Evaluation of Large Language Models for Malaria Drug Discovery: Trade-offs in Performance, Scale, and Resource Utility


79. Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI


80. Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants


81. Ansari: A Retrieval-Grounded Islamic AI Assistant – Architecture, Deployment, and Lessons from 140,000 Conversations


82. EditPPT: Faithful Long-Deck Slide Editing via Structured Tool-Using Multi-Agent with Dual-Modal Validators


83. VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models


84. When Do LLMs Replace Fine-Tuned NLU? A Decision Framework for Intent Detection in Production Conversational Systems


85. ASTAR: Automated induction of STAndardized radiology Reporting templates from large-scale clinical free-text corpora


86. Trilingual Topic Modeling of Sri Lankan Parliamentary Debates


87. Hadith computational science in the age of large language models: a critical narrative review


88. Toward Auto-Research: Mining Falsifiable Research Ideas from Paper Knowledge Graphs with Categorical Structure


89. Clarify-Then-Search: A Clarification Benchmark for Deep Search with End-to-End Nugget Restoration


90. ExpertIVS: Sociological Expert Driven Individual Value Simulation in Large Language Models


91. Beyond Prompt Engineering: A Systematic Analysis of Prompt Lexical Sensitivity and Its Impacts on Quality


92. Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing


93. Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias


94. When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots’ Safety Risks for Generation Alpha