전체 AI 논문 - 2026-08-07

1. Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering


2. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping


3. Challenges in Evaluating Explanation Methods for Static and Evolving Data


4. TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories


5. Beyond Top-K: Replacing Black-Box Retrieval with Interpretable Agentic Operations


6. HarnessOpt-Bench: Evaluating LLMs at Harness Optimization


7. Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors


8. QuanTiMedAI: Quantum-Enhanced Time-Series Model guided by Agentic AI for Cardiac Arrest Mortality Prediction


9. The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images


10. Improving the Realism of Synthetic Clinical Benchmarks Under Utility Constraints


11. DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models


12. TS-RAG: Retrieval Augmented Generation for Time Series Forecasting


13. EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning


14. Comparative Approaches to Agent Retrieval over Large Skill Libraries


15. MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration


16. Schema-Guided Hierarchical Information Extraction and Semantic Evaluation Using Generative AI


17. iARCS: Iterative Agentic RL for Controllable 3D Scene Generation


18. CogVis: Must Open-Vocabulary Change Detection Perceive the Scene Anew for Every Query?


19. PaDoc: Layout-Grounded Parallel Decoding for Document Parsing


20. FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows


21. Contextual Information Policy Optimization for Search Agents


22. Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts


23. Mind the Gaps: Mixture-of-Minds for Human Simulation


24. From Siloed Algorithms to Compliance-First Agentic Platforms: A Multi-Layered Architecture for Hospital AI Systems


25. ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment


26. Evaluating Investment Logic in Large Language Models: A Real-World Benchmark Towards Personalzied Financial Agents


27. Signal or Spurious Cue? A Randomized Audit of Survey-Country Metadata in LLM Social Inference


28. When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories


29. Integrating Implicit and Explicit Relational Biases through Graph-Based Multiple Instance Learning: A Case Study in Skin Lesion Diagnosis


30. From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models


31. HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards


32. Hybrid Machine Learning Framework for Herd-Level Cattle Growth Pattern and Weight Gain Forecasting in Grazing-Based Production Systems


33. OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents


34. AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning


35. Temporal Bridges for Spatial Resolution: Enhancing Climate Data Super-Resolution with Bidirectional Alignment


36. Stability of Ranking-dependent Pair-wise Comparison Patterns in the Analytic Hierarchy Process


37. Training a Conditioned Video Game Agent on a VLM Annotated Dataset


38. VLMs for Videogame Data Annotation


39. GAUGE: A Measurement-Grounded Benchmark for Physical Fidelity in Simulation Engines and Video World Models


40. CourseGraph: Finding overlaps and differences in Computer Science courses across universities


41. GSBF: Gaussian Splatting for Environment-Aware Beamforming


42. ECG-LENS: Lead-Aware Clinical Context Enriched ECG Report Generation and Evaluation


43. AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents


44. Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding


45. Improving Interoperability among Defence and National Security Ontologies: Analysis and Evaluation Tasks


46. Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?


47. Runtime Observability for Heterogeneous Attention Memory


48. ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion


49. Cautious Context Steering for Language Model Personalization


50. When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents


51. When Agentic AI Meets Integrated Sensing and Communication


52. ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution


53. Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replay


54. When Do Prompt-Side Agent Playbooks Transfer? Accuracy, Cost, and Runtime Shift in Agent Deployment


55. Subliminal Learning is Non-Semantic Distillation


56. Unified Agent: Managing Interactions across Devices


57. BlockPython: A Process-Aware Agent-Supported Platform for the Transition from Block-Based to Python Programming


58. RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation


59. Shaping Human-AI Interactions to Provide Improvement Pathways and Balance Competing Objectives


60. DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model


61. Grounded Well-Condition Anomaly Detection on the Volve Field: Constructed Labels, a Baseline, and a Dual-Head Model


62. A Unified Framework for Trajectory Prediction with Explicit Planning and Reaction Decomposition


63. Refining Over Resampling: Test-Time Self-Correction for LLM Reasoning


64. Bayesian Expected Uncertainty Reduction (B-EUR) Model: A Computational Account of What Makes Design Options Worth Trying


65. SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation


66. Measuring and Detecting Harmful AI Sycophancy


67. Epistemic Trustworthiness in Generative AI: A Normative Framework for Warranted Reliance in High-Stakes Workflows


68. StepReflect: Structured UI Transition Reflection for Mobile GUI Agents


69. SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution


70. Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging


71. EcoAgent-Bench: Evaluating Economic Decision-Making in Budget-Constrained LLM Agents


72. Innovation-Residual Auditing of Autonomous Analysis Agents: Localization, Detection Limits, Error Control, and Identifiability


73. Recursive Synthesis for Long-Horizon Terminal Tasks


74. Stochasticity Is Not the Hard Part: Reduction and Complexity in Instructional Sequencing over Prerequisite DAGs


75. SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications


76. Negotiating Risk Boundaries in AI for Policing Through Mixed-Stakeholder Deliberation


77. Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index


78. Adaptive Arena-based Contestable Argumentative Network-of-Experts for Open-Ended Care Plan Coordination


79. C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models


80. DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data


81. Counterfactual Analysis via Large Language Models


82. CASCADE: An Agentic Regulatory Network Framework for Patient-Data-Validated Downstream Perturbation Prediction


83. Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks


84. OrchestraBench: Evaluating Multi-Agent Orchestration Failure Modes, Recovery, and Decomposition Quality


85. Posture and Sustainment Optimization Under Adversarial Uncertainty


86. WorldClaw: Agentic 3D Open-World Generation at Scale


87. LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs


88. Search2Skill: Skill Distillation Beyond Knowledge Boundaries Via Rubric-Based Reinforcement Learning


89. Coherence-Oriented Dream Scene Visualisation


90. TriQua: Reconciling Granularity and Context in Factuality Evaluation


91. Project2Task: Graph-Guided Project-Level Planning for Autonomous Research


92. Small Foundation Models of Human Cognition and Behaviour


93. When Privileged Guidance Misaligns: State-Matched Routing and Contextualized Self-Distillation for Multi-Turn Agents


94. PD-GS: Phoneme-Driven 3DGS for Audio-Driven Talking Heads


95. SearchAuditor: Auditing and Attributing Failures in Long-Horizon Search Agents


96. Otter: A Time-Aware, History-Conditioned Human Chess AI


97. Abstract Event Causal Rules: Induction and Application


98. SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse


99. From Continuous Predictors to Clinical Thresholds: Early Evidence on Performance Trade-offs of Guideline-Based Categorisation for Ischaemic Stroke Outcome Prediction


100. Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models


101. The Ignition Index: Measuring Global Workspace Dynamics in Language Models


102. Agentic Nesting: A New Methodology for Existing Enterprise Application Integration and Services


103. Learning When to Trust via Selective Context Preference Optimization


104. Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria


105. An Optimal Agnostic PAC Algorithm


106. AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games


107. Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents


108. Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data


109. Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents


110. Does FLAIR super-resolution erase or hallucinate small white-matter lesions?


111. BaKron: Efficient Quantization with Kronecker-Factored Hessians


112. Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model


113. PRISM: Distribution-Gated Flow Matching for Controllable Unpaired Image Translation


114. Depth-Guided Video Object Counting in Crowded Scenes


115. From Passive Mirrors to Active Agents: Holonic Digital Twins for Physical AI over Networks


116. Continual Learning in Transition


117. What Current AI Benchmarks Leave Unmeasured: Modality, Search, Citations, and Implications (for Safety Evaluations)


118. Audio-to-Score Transcription using Pre-trained Features, Data Augmentation, and the New SheetSage-A2S Dataset


119. Visual Grounding in Zero-Shot Vision-Language Control


120. Learning Globally Reusable Skills for Coding Agents


121. Reducing belief in conspiracy theories as they unfold using large language models


122. Hardware Keystores for AI Agent Signing Workflows: A Zero-Trust MCP Enforcement Architecture


123. Is Self-Pretraining really useful to improve diagnosis in medical Time Series?


124. Beyond Sequence Order: Syntax-Informed Positional Embeddings for Transformers


125. Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping


126. Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case


127. FormBharo: Designing and Evaluating a Voice Agent for Conversational Form Filling in Rural India


128. ProDVI: Programmatic Dynamics Priors for Value Network Initialization


129. TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions


130. SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation


131. Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models


132. BALANCE: Hybrid Autoregressive-Speculative LLM Inference in Wireless Edge Networks


133. The em-dash em-beds in Congress: A population-level rise in em-dash frequency in U.S. congressional press releases at the dawn of the large-language-model era, 2021-2025


134. CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents


135. Beyond Feature Importance: A Comparative Analysis of Pattern Detection Methods in Cluster Interpretation


136. D-CLOT: Double Closed Loop Optimal Transport for Unsupervised Action Segmentation


137. MACRO: Markov Chain Routing of Transformer Layers


138. Evidential Rule Learning for Interpretable Classification with Abstention


139. MameLoshnLM: Yiddish Language Model and Evaluation Benchmark


140. Hierarchical Latent Prediction for Language Models


141. A Two-Tier Perspective on Inference-Time Parallelism in Multi-Agent LLM Systems


142. Task-Conditional Flow Matching for Balanced Multilingual Text Embedding Adaptation


143. GROM: Gradient-Free Rapid One-Shot Machine Unlearning


144. HyTBE: Hyperbolic Target-Background Expert Model for Cross-Domain Infrared Small Target Detection


145. UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on


146. Multivariate Time Series Forecasting needs Cross Variable Loss


147. Once a Response, Always a Response: Detecting LLM-generated Text via Latent Prompt Restoration


148. ABC: Numerical Data Collection under Local Differential Privacy without Prior Knowledge


149. Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots


150. Spectral Aliasing Pretext: A novel task for Self-Supervised fault diagnosis in rotating machinery


151. Answer First, Reason Later: Commitment Order in Diffusion LLMs


152. Nonvisual Classification of Ground-Condition by Artificial Proprioception in an Amoeba-Inspired Autonomous Walking Robot


153. DistMedVL: Distributional Vision-Language Alignment for Uncertainty-Aware Medical Image Segmentation


154. SafeDivertor: Faithful Divertor Heat Flux Reconstruction from Macroscopic Plasma State Signals via Time-Frequency Prior Exploitation


155. F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading


156. Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics


157. Relay, Don’t Route: Adaptive Population Handoff for Cost-Efficient LLM-Driven Evolution


158. GAUGE: Granularity-Adaptive Counterfactual Gating of Evidence for Incomplete Multimodal Classification


159. SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Libraries


160. LC-GRPO: Bridging Train-Inference Gap for Flow-Based GRPO with Langevin Correction


161. Search-Aided Joint Agent-Environment Reinforcement Learning for Robust Lifelong Multi-Agent Path Finding with Rotations


162. The Judgment-Consequence Gap: LLM Moral Reasoning in Healthcare Decisions


163. When Experience Becomes Instruction: Trajectory Poisoning in Self-Evolving Agent Skill Systems


164. Turing’s Frist Imitation Game: Design Concepts and a Human-Approximates-Machine Reading


165. Vibe Compiler: A Research-Logic Synthesis Tool That Runs without Prompt Engineering -Toward Enhancing Metacognition for Sustaining Agency in the Age of Generative AI-


166. APQF: Agentic Profiling-Guided Structured Pruning and Mixed-Precision Quantization with Adaptive Fine-Tuning


167. Learning Context-Free Grammars for Grammar-Constrained Decoding via Declarative Agentic Programming with Guarantees


168. Matrix Zonotopic Attention: A Context-Adaptive Value Projection for Set Transformers


169. The ethics of artificial intelligence in the life sciences: Universality, cultural diversity and an architecture of care


170. Why the Third Axis Is Freedom


171. Perturbation Sensitivity at Convergence: A Simple Signal for Identifying Spuriously Correlated Samples


172. Multi-Agent Reinforcement Learning for Online Traffic Scheduling in Time-Sensitive Application


173. Multi-Agent Transformer for Queue-Level XR Traffic Scheduling in TSN Networks


174. Hierarchical Server Architecture for Agentic Science


175. Failing Gracefully: Mitigating Impact of Inevitable Robot Failures


176. IMMENSE: Inductive Multi-perspective User Classification in Social Networks


177. An Emerging Retail Portfolio Management Application: Personalized, Tax-Aware Reinforcement Learning with Natural Language Goals


178. PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis


179. Marginal Matching Does Not License Factorized Sampling: Auditing Conditional Style Leakage in Factorized Generative Models


180. One Qubit Can Beat One Bit: Quantum Advantage for Post-Training Quantization


181. In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion


182. Quality Diversity for Reliable Data Driven Time-Use Optimization


183. Innocent Panels, Hateful Stories: Evaluating and Detecting Hateful Intent in Multi-Turn Visual Story Generation


184. ASTELD: A Six-Axis Classification Framework for Autonomous AI Agents - Design, Evaluation, and an OpenClaw Case Study


185. Post-Hoc Trajectory-Risk Certification for Modular LLM-Based Security Agents


186. Position: It’s Time to Optimize LLMs for Self-Consistency


187. Automatic Detection of Deaths from Social Networking Sites


188. Autonomous Research Agents: A Survey of AI Scientists and the Verification Gap


189. Who Gets Access? Global Region and Academic Status Bias in AI-Generated Academic Gatekeeping Scenarios


190. Challenges for Musical Education in the Age of AI and Digital Transformation


191. The Closing Window: How Governments Could Lose Their Ability to Restrain Advanced AI


192. Estimating time spent on work tasks


193. Beyond Information Retrieval: Generative AI as an Epistemic Arbiter to Enhance Collaborative Problem-Solving


194. DREAM: LLM-based Dynamic Role-playing via Event-Aware Memory Graph


195. A Study of ASR Adaptation and Representation Dimensionality Reduction in Persian Speech Emotion Recognition Using Whisper


196. Large Language Models Threaten Double-blind Review


197. Beyond Sentiment: Comparing Traditional NLP and LLM-Based Multi-Dimensional Analysis for Political News Evaluation


198. Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability


199. Mean-Field Dynamics of Chain-of-Thought Reasoning in Large Language Models


200. Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support


201. HoloCount: A Holistic Visual Counting Benchmark for MLLMs