전체 AI 논문 - 2026-06-25

1. The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems


2. Autodata: An agentic data scientist to create high quality synthetic data


3. InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy


4. WinDOM: Self-Family Distillation for Small-Model GUI Grounding


5. Agentic System as Compressor: Quantifying System Intelligence in Bits


6. AI Snitches Get Glitches: Towards Evading Agentic Surveillance


7. Confidence Sequences for Online Statistical Model Checking of Markov Decision Processes


8. Fuzzy Quantification over OWL Ontologies and Knowledge Graphs


9. Position Spaces and Graphs


10. GUI agent: Guided Exploration of User-Sensitive Screens


11. Reasonable Motion: A General ASP Foundation for Environment Constrained Movement Trajectory Computation


12. Agentic evolution of physically constrained foundation models


13. Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning


14. Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models


15. BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding


16. Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions


17. Offline Multi-agent Continual Cooperation via Skill Partition and Reuse


18. What Actually Works for Spacecraft Fault-Tolerant Control: An Honest Settled-Gate Benchmark of Learned and Classical Methods


19. Agentic Knowledge Tracing: A Multi-Agent LLM Architecture for Stealth Assessment of Financial Literacy in Serious Games


20. Omni-Perception Policy Optimization for Multimodal Emotion Reasoning


21. Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty


22. To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG


23. Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR


24. Elo-Disentangled Player-Style Embeddings for Human Chess via Rating-Conditioned Residual Move Model


25. TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory


26. The Clinician’s Veto: Navigating Trust, Liability, and Uncertainty in Autonomous AI Prescribing


27. Beyond Shapley: Efficient Computation of Asymmetric Shapley Values


28. Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms


29. Diagnosing and Mitigating Compounding Failures in Agentic Persuasion via Taxonomic Strategy Retrieval


30. Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners


31. The Hitchhiker’s Guide to Agentic AI: From Foundations to Systems


32. Learning Action Priors for Cross-embodiment Robot Manipulation


33. On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity


34. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents


35. A cross-process welding penetration status prediction algorithm based on unsupervised domain adaptation in laser and TIG welding


36. Model Forensics: Investigating Whether Concerning Behavior Reflects Misalignment


37. A welding penetration prediction model for laser welding process based on self-supervised learning using physics-informed neural networks


38. Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining


39. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs


40. Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem


41. Privacy Vulnerabilities of Attention Layers in Tabular Foundation Models and Protection of High-Risk Queries


42. FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation


43. Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization


44. Variable Bound Tightening for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games


45. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models


46. Weave of Formal Thought


47. Multi-Agent Goal Recognition with Team- and Goal-Conditioned Reinforcement Learning and Factorized Branch-and-Bound


48. Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study


49. SE-AGCNet: An End-to-End Framework for Joint Speech Enhancement and Loudness Control in Meeting Scenarios


50. Pulmonary Embolism Risk Stratification from CTPA and Medical Records: Vascular Graphs Are Not All You Need


51. Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift


52. Silent Failures in Physics-Informed Neural Networks: Parameter Poisoning and the Limits of Loss-Based Validation


53. Proactive Systems in HCI and AI: Concepts, Challenges, and Opportunities


54. TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems


55. Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation


56. Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See


57. AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture


58. BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions


59. Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute


60. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models


61. GCT-MARL: Graph-Based Contrastive Transfer for Sample-Efficient Cooperative Multi-Agent Reinforcement Learning


62. Adapt Only When It Pays: Budgeted Decision-Loss Priority for Delayed Online Time-Series Adaptation


63. What Does It Mean to Break a Distillation Defense?


64. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models



66. Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety


67. Do Thinking Tokens Help with Safety?


68. Noise-Aware Boundary-Enhanced Generative Learning for Ultrasound Speckle Reduction


69. Erased, but Not Gone: Output Forgetting Is Not True Forgetting


70. Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks


71. Internal Data Repetition Destroys Language Models


72. Are Tabular Foundation Models Robust to Realistic Query Distribution Shifts in Microbiome Data?


73. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning


74. Uncertainty-aware reinforcement learning for chemical language models


75. When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift


76. Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection


77. Why Do Accumulated Transformations Extrapolate?


78. Quantifying Explainable AI-introduced signal noise on ECG data with Spectral Entropy


79. LLM Performance on a Real, Double-Marked GCSE Benchmark


80. What Do Language Priors Contribute to Darcy-Flow Inversion? A Mechanistic Audit


81. Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation


82. Reliable Conformal Prediction for Ordinal Classification Using the Ranked Probability Score


83. Convex–Concave Quadratic Spectral Filtering for Graph Neural Networks


84. Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models


85. MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios


86. What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients


87. Holographic Memory for Zero-Shot Compositional Reasoning in Knowledge Graphs: A Mechanistic Study of Where and Why It Fails


88. EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis


89. Stable-Shift: Biologically Structured Prediction of Transcriptional Responses to Unseen Gene Perturbations


90. Privacy-preserving federated tensor decomposition of single-cell immune data: recovering multicellular programs across institutions


91. Self-Modulating Quantum Fast-Weight Programmers for Efficient Adaptive Sequential Learning


92. Recursive QLSTM with Dynamic Variational Quantum Circuit Adaptation


93. Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction


94. Velocity Prediction in Automatic Guitar Transcription


95. Attractive and Repulsive Pattern Control in Sequence Generation


96. End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users


97. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation


98. LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning



100. From Meta Idea to Advanced Mathematical Discovery – Human-AI Co-Discovery of Sign-Embedding Quantum Algorithms


101. Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection


102. Conformal Recovery-Deadline Certificates for Runtime Assurance of Adapting Controllers


103. Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis


104. Reliability-Asymmetric Spacecraft Autonomy: Co-Designing a Capable Learned GNC Stack with a Verified, Adaptation-Aware Runtime Shield


105. Neural Machine Translation for Low-Resource Tangkhul–English


106. TheoremGraph: Bridging Formal and Informal Mathematics


107. Memory Makes the Difference: Evaluating How Different Memory Roles Shape Conversational Agents


108. Compositional Behavioral Semantics for State Abstraction in Reinforcement Learning


109. AI Coaching for Accelerating Human Skill Development with Reinforcement Learning


110. Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing


111. Improved Large Language Diffusion Models


112. Supervised Post-training of Speech Foundation Models for Robust Adaptation in Speech Deepfake Detection


113. ESTANet: Efficient Online Error Detection in Procedural Videos via Prediction Inconsistency


114. Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation


115. Communicability-Inspired Positional Encoding (CIPE)


116. EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression


117. Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation


118. UC-Search: Risk-Aware Test-Time Search for Delayed Constrained Time-Series Control


119. Stabilizing black-box algorithms through task-oriented randomization


120. ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments


121. RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory


122. FDN: Interpretable Spatiotemporal Forecasting with Future Decomposition Networks


123. A Hybrid CNN-LSTM Intrusion Detection Framework for Cybersecurity in Smart Renewable Energy Grids


124. SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward


125. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics


126. Phoneme-Level Mispronunciation Screening in Polish-Speaking Children with an Explainable Assistant


127. ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory


128. Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift


129. Silent Failures in Physics-Informed Neural Networks: Parameter Poisoning and the Limits of Loss-Based Validation


130. Proactive Systems in HCI and AI: Concepts, Challenges, and Opportunities


131. TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems


132. Benchmarking the Alignment of Data-Quality Metrics, Human Judgment and Land-Cover Segmentation Performance for Earth Observation


133. Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See


134. AeroCast: Probabilistic 3D Trajectory Prediction for Non-Cooperative Aerial Obstacles via Transformer-MDN Architecture


135. BCoughBench: Benchmarking Respiratory Acoustic Foundation Models Under Body-Coupled Wearable Sensor Conditions


136. Power-Flexible AI Data Centers: A New Paradigm for Grid-Responsive Compute


137. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models


138. GCT-MARL: Graph-Based Contrastive Transfer for Sample-Efficient Cooperative Multi-Agent Reinforcement Learning


139. Adapt Only When It Pays: Budgeted Decision-Loss Priority for Delayed Online Time-Series Adaptation


140. What Does It Mean to Break a Distillation Defense?


141. Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models



143. Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety


144. Do Thinking Tokens Help with Safety?


145. Noise-Aware Boundary-Enhanced Generative Learning for Ultrasound Speckle Reduction


146. Erased, but Not Gone: Output Forgetting Is Not True Forgetting


147. Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks


148. Internal Data Repetition Destroys Language Models


149. Are Tabular Foundation Models Robust to Realistic Query Distribution Shifts in Microbiome Data?


150. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning


151. Uncertainty-aware reinforcement learning for chemical language models


152. When Multi-Sensor Fusion Fails to Generalize: Cattle Posture Classification Under Animal-Level and Temporal Distribution Shift


153. Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection


154. Why Do Accumulated Transformations Extrapolate?


155. Quantifying Explainable AI-introduced signal noise on ECG data with Spectral Entropy


156. LLM Performance on a Real, Double-Marked GCSE Benchmark


157. What Do Language Priors Contribute to Darcy-Flow Inversion? A Mechanistic Audit


158. Enhancing Clinician Decision-Making via Uncertainty-Aware Multi-Expert Fusion for Stroke Rehabilitation


159. Reliable Conformal Prediction for Ordinal Classification Using the Ranked Probability Score


160. Convex–Concave Quadratic Spectral Filtering for Graph Neural Networks


161. Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models


162. MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios


163. What Does a Pathological Speech Assessment Model Know about Acoustic Features? A Case Study on Oral and Oropharyngeal Cancer Patients


164. Holographic Memory for Zero-Shot Compositional Reasoning in Knowledge Graphs: A Mechanistic Study of Where and Why It Fails


165. EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis


166. Stable-Shift: Biologically Structured Prediction of Transcriptional Responses to Unseen Gene Perturbations


167. Privacy-preserving federated tensor decomposition of single-cell immune data: recovering multicellular programs across institutions


168. Self-Modulating Quantum Fast-Weight Programmers for Efficient Adaptive Sequential Learning


169. Recursive QLSTM with Dynamic Variational Quantum Circuit Adaptation


170. Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction


171. Velocity Prediction in Automatic Guitar Transcription


172. Attractive and Repulsive Pattern Control in Sequence Generation


173. End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users


174. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation


175. LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning



177. From Meta Idea to Advanced Mathematical Discovery – Human-AI Co-Discovery of Sign-Embedding Quantum Algorithms


178. Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models



180. ReviewGuard: Aligning LLM-Assisted Peer Review with Long-Term Scientific Impact


181. Type Checking Project Haystack Grids using JSON Schema and Pydantic


182. Small edits, large models: How Wikipedia advocacy shapes LLM values