LLM 관련 주요 논문 - 2026-06-26

1. Language-Based Digital Twins for Elderly Cognitive Assistance


2. When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models


3. Prompt Injection in Automated Résumé Screening with Large Language Models: Single and Multi-Injection Settings


4. Ask, Don’t Judge: Binary Questions for Interpretable LLM Evaluation and Self-Improvement


5. Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text


6. A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO


7. TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference


8. OpenRCA 2.0: From Outcome Labels to Causal Process Supervision


9. Joint Learning of Experiential Rules and Policies for Large Language Model Agents


10. Semantic Early-Stopping for Iterative LLM Agent Loops


11. Einstein World Models


12. Where Do CoT Training Gains Land in LLM based Agents?


13. Diagnosing Task Insensitivity in Language Agents


14. A Pipeline for Generating Longitudinal Synthetic Clinical Notes Using Large Language Models


15. TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation


16. LCAi: Life Cycle Assessment with big data fusion and retrieval-augmented generation-assisted interpretation


17. The Capability Frontier: Benchmarks Miss 82% of Model Performance


18. KARLA: Knowledge-base Augmented Retrieval for Language Models


19. EGG: An Expert-Guided Agent Framework for Kernel Generation


20. Scientific discovery as meta-optimization: a combinatorial optimization case study


21. NebulaExp-8B: An Empirical Post-Training Pipeline via Full-Scale Ablation Research


22. Autoformalization of Agent Instructions into Policy-as-Code


23. LLM-based Models for Detecting Emerging Topics in Service Feedback


24. Content-Based Smart E-Mail Dispatcher Using Large Language Models


25. EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling


26. Boundary-Aware Context Grounding for A Low-Channel EEG Agent


27. NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications


28. MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation


29. Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data


30. Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models


31. OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents


32. What We are Missing in Multimodal LLM Evaluation?


33. How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?


34. Agentic Analysis for Agentic Infrastructure: An LLM-Powered Pipeline for Comparative Governance of DAO and Corporate AI Protocols


35. AlgoEvolve: LLM-driven Meta-evolution of Algorithmic Trading Programs


36. Detecting and Controlling Sycophancy with Cascading Linear Features


37. Autoregressive Boltzmann Generators


38. Automating Potential-based Reward Shaping with Vision Language Model Guidance


39. Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions


40. NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models


41. ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP


42. Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs


43. ReaORE: Reasoning-Guided Progressive Open Relation Extraction Empowered by Large Reasoning Models


44. Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions


45. In-Context Model Predictive Generation: Open-Vocabulary Motion Synthesis from Language Models to Physics


46. A Deterministic Control Plane for LLM Coding Agents


47. Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling


48. GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning


49. Confidence-Aware Tool Orchestration for Robust Video Understanding


50. Information-Aware KV Cache Compression for Long Reasoning


51. ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP


52. AIGP: An LLM-Based Framework for Long-Term Value Alignment in E-Commerce Pricing


53. Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification


54. Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents


55. Discovering Millions of Interpretable Features with Sparse Autoencoders


56. HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization


57. SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference


58. Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection


59. \textsc{DiARC}: Distinguishing Positive and Negative Samples Helps Improving ARC-like Reasoning Ability of Large Language Models


60. Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge


61. An Empirical Study of LLM-Generated Specifications for VeriFast


62. Speaking Numbers to LLMs: Multi-Wavelet Number Embeddings for Time Series Forecasting


63. Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents


64. Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks


65. Localizing RL-Induced Tool Use to a Single Crosscoder Feature


66. Closing the Loop to Discover Psychological Theories with an Automated Cognitive Scientist


67. WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation


68. ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence


69. SOLAR: AI-Powered Speed-of-Light Performance Analysis


70. Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models


71. EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning


72. From Clicks to Intent: Cross-Platform Session Embeddings with LLM-Distilled Taxonomy for Financial Services Recommendations


73. CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?


74. From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models


75. Thinking Like a Scientist? A Structural Study of LLM-Generated Research Methods


76. The Open Source Economic Index of AI Adoption and Capability


77. From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages


78. Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints


79. Context Recycling for Long-Horizon LLM Inference


80. Assert, don’t describe: Linguistic features that shift LLM reasoning about animal welfare


81. Investigating LLM’s Problem Solving Capability – a Study on Statics Questions


82. Helpfulness Hurts: Domain-Dependent Degradation of Mid-Trained Compassion Values Under Post-Training


83. Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models


84. Benchmarking Open-Weight Foundation Models for Global AI Technical Governance