전체 AI 논문 - 2026-06-04

1. Knowledge Index of Noah’s Ark


2. AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks?


3. Strabo: Declarative Specification and Implementation of Agentic Interaction Protocols


4. What Type of Inference is Active Inference?


5. AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety



7. Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems


8. BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization


9. AIP: A Graph Representation for Learning and Governing Agent Skills


10. Tree-Based Formalization of Multi-Agent Complementarity in Human-AI Interactions


11. Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories


12. FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games


13. Fog of Love: Engineering Virtuous Agent Behavior with Affinity-based Reinforcement Learning in a Game Environment


14. BiNSGPS: Geometry Problem Solving via Bidirectional Neuro-Symbolic Interaction


15. MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models


16. A Normative Intermediate Representation for ASP-Based Compliance Reasoning



18. Plan First, Judge Later, Run Better: A DMAIC-Inspired Agentic System for Industrial Anomaly Detection


19. Learning Admissible Heuristics via Cost Partitioning


20. SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification


21. Neetyabhas: A Framework for Uncertainty-Aware Public Policy Optimization in Rational Agent-Based Models


22. Scaling Self-Evolving Agents via Parametric Memory


23. MapAgent: An Industrial-Grade Agentic Framework for City-scale Lane-level Map Generation


24. Simulate, Reason, Decide: Scientific Reasoning with LLMs for Simulation-Driven Decision Making


25. Beyond Prompt-Based Planning: MCP-Native Graph Planning-based Biomedical Agent System


26. AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning


27. The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?


28. Cascading Hallucination in Agentic RAG: The CHARM Framework for Detection and Mitigation


29. Trivium: Temporal Regret as a First-Class Objective for Causal-Memory Controllers


30. Not All Errors Are Equal: Consequence-Aware Reasoning Compute Allocation


31. Online Skill Learning for Web Agents via State-Grounded Dynamic Retrieval


32. The Digital Apprentice: A Framework for Human-Directed Agentic AI Development


33. Exploring Cross-Scenario Generality of Agentic Memory Systems: Diagnostics and a Strong Baseline


34. The Saturation Trap and the Subjectivity of Intervention Timing: Why Affect-Based Triggers and LLM Judges Fail to Time Interventions on Autonomous Agents


35. Characterizing initial human-AI proof formalization workflows


36. Can Generalist Agents Automate Data Curation?


37. StepPRM-RTL: Stepwise Process-Reward Guided LLM Fine-Tuning for Enhanced RTL Synthesis


38. VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark


39. Consensus is Strategically Insufficient: Reasoning-Trace Disagreement as a Knowledge-Representation Signal


40. SMAC-Talk: A Natural Language Extension of the StarCraft Multi-Agent Challenge for Large Language Models


41. Thinking Through Signs: PEEL as a Semiotic Scaffolding for Epistemically Accountable AI-Enabled Research


42. Stumbling Into AI Emotional Dependence: How Routine AI Interactions Reshape Human Connection


43. Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification


44. Streaming Communication in Multi-Agent Reasoning


45. Reinforcement Learning from Rich Feedback with Distributional DAgger


46. Multi-Column RBF Neural Network Using Adaptive and Non-Adaptive Particle Swarm Optimization


47. Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)


48. GeM-NR: Geometry-Aware Multi-View Editing for Nonrigid Scene Changes


49. Towards Efficient and Evidence-grounded Mobility Prediction with LLM-Driven Agent


50. Audio Interaction Model


51. Continual Visual and Verbal Learning Through a Child’s Egocentric Input


52. Who Needs Labels? Adapting Vision Foundation Models With the Metadata You Already Have


53. Arithmetic Pedagogy for Language Models


54. Automatic Generation of Titles for Research Papers Using Language Models


55. UniCAD: A Unified Benchmark and Universal Model for Multi-Modal Multi-Task CAD


56. Self-Reflective APIs: Structure Beats Verbosity for AI Agent Recovery


57. Invariant Gradient Alignment for Robust Reasoning Distillation


58. DAR: Deontic Reasoning with Agentic Harnesses


59. M$^3$Eval: Multi-Modal Memory Evaluation through Cognitively-Grounded Video Tasks


60. SharedRequest: Privacy-Preserving Model-Agnostic Inference for Large Language Models


61. From Agent Traces to Trust: Evidence Tracing and Execution Provenance in LLM Agents


62. DeliChess: A Multi-party Dialogue Dataset for Deliberation in Chess Puzzle Solving


63. Plan, Watch, Recover: A Benchmark and Architectures for Proactive Procedural Assistance


64. From Prompt to Process: a Process Taxonomy and Comparative Assessment of Frameworks Supporting AI Software Development Agents


65. AdaKoop: Efficient Modeling of Nonlinear Dynamics from Nonstationary Data Streams with Koopman Operator Regression


66. Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning


67. Geometry-Aware Distillation for Prompt Tuning Biomedical Vision-Language Models


68. ‘Your AI Text is not Mine’: Redefining and Evaluating AI-generated Text Detection under Realistic Assumptions


69. Provably Auditable and Safe LLM Agents from Human-Authored Ontologies


70. DiverAge: Reliable Pluralistic Face Aging with Cross-Age Identity Relation Guidance


71. Abduction Prover in Isabelle/HOL



73. Uncertainty-Aware End-to-End Co-Design of Neural Network Processors: From Training and Mapping to Fabrication


74. Signed Dual Attention: Capturing Signed Dependencies in Time Series Forecasting


75. OA-CutMix: Correcting the Label Bias of CutMix


76. Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents


77. Scenario Generation for Risk-Aware Reinforcement Learning with Probably Approximately Safe Guarantees


78. NoRA: Evaluating Grounded Reasonableness in Visual First-person Normative Action Reasoning


79. Activation Steering of Video Generation Models via Reduced-Order Linear Optimal Control


80. Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction


81. Description-Code Inconsistency in Real-world MCP Servers: Measurement, Detection, and Security Implications


82. Archi: Agentic Operations at the CMS Experiment


83. An Empirical Audit of Input Encoders for Multi-Channel Signal Transformers


84. TIDE: Proactive Multi-Problem Discovery via Template-Guided Iteration


85. Revisiting Vul-RAG: Reproducibility and Replicability of RAG-based Vulnerability Detection with Open-Weight Models


86. Curvature-aware dynamic precision approach for physics-informed neural networks


87. Trace-Mediated Peak Bias: Bridging Temporal Credit Assignment and Cognitive Heuristics in Deep Reinforcement Learning


88. CoRe-MoE: Contrastive Reweighted Mixture of Experts for Multi-Terrain Humanoid Locomotion with Gait Adaptation


89. VISTA: Vision-Grounded and Physics-Validated Adaptation of UMI data for VLA Training


90. Enhancing MedSAM with a Lightweight Box Predictor for Medical Image Segmentation


91. Graph-Guided Universum Learning in Generalized Eigenvalue Proximal SVMs for Alzheimer’s Disease Classification


92. Real-Time Automatic License Plate Recognition Using YOLOv8, SORT Tracking, and Temporal Data Interpolation


93. Learning Long Range Spatio-Temporal Representations over Continuous Time Dynamic Graphs with State Space Models


94. Why Muon Outperforms Adam: A Curvature Perspective


95. Instance-Level Post Hoc Uncertainty Quantification in Object Detection


96. QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples


97. QuBLAST: A Framework for Quantizing Large Language Models with Block-Level Compression Approach and Activation Scaling Strategy


98. Ekka: Automated Diagnosis of Silent Errors in LLM Inference


99. Synthetic Personalities: How Well Can LLMs Mimic Individual Respondents Using Socio-Economic Microdata?


100. Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge


101. Rollout-Level Advantage-Prioritized Experience Replay for GRPO


102. Temporal Order Matters for Agentic Memory: Segment Trees for Long-Horizon Agents


103. Dynamic Infilling Anchors for Format-Constrained Generation in Diffusion Large Language Models


104. Optical-Guided Neural Collapse for SAR Few-Shot Class Incremental Learning


105. ANN Search: Recall What Matters


106. Treat Traffic Like Trees: A Semantic-Preserving Hierarchical Graph-Based Expert Framework for Encrypted Traffic Analysis


107. GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling


108. Self-Evolving Deep Research via Joint Generation and Evaluation


109. Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots


110. SFMambaNet: Spectral-Frequency Enhanced Selective State Space Model for Correspondence Pruning


111. Evaluating Reasoning Fidelity in Visual Text Generation


112. ChessMimic: Per-Rating Transformer Models for Human Move, Clock, and Outcome Prediction in Online Blitz Chess


113. Adaptive Calibration for Fair and Performant Facial Recognition


114. ParetoPilot: Zero-Surrogate Offline Multi-Objective Optimization via Infer-Perturb-Guide Diffusion


115. SePO: Self-Evolving Prompt Agent for System Prompt Optimization


116. CyberGym-E2E: Scalable Real-World Benchmark for AI Agents’ End-to-End Cybersecurity Capabilities


117. Token Rankings are Unforgeable Language Model Signatures


118. RowNet: A Memory Transformer for Tabular Regression


119. MemoryDocDataSet: A Benchmark for Joint Conversational Memory and Long Document Reasoning


120. LoopMoE: Unifying Iterative Computation with Mixture-of-Experts for Language Modeling


121. What If Prompt Injection Never Left? Exploring Cross-Session Stored Prompt Injection in Agentic Systems


122. L-TGVN: Leveraging Longitudinal Priors for Personalized Rapid MRI


123. An Empirical Study of Data Scale, Model Complexity, and Input Modalities in Visual Generalization


124. An Ensembled Latent Factor Model via Differential Evolution and Gradient Descent Optimization


125. Low-Rank Decay for Grokking in Scale-Invariant Transformers: A Spectral-Geometric View


126. TITAN-FedAnil+: Trust-Based Adaptive Blockchain Federated Learning for Resource-Constrained Intelligent Enterprises


127. Rethinking Sales Lead Scoring with LLM-based Hierarchical Preference Ranking


128. LCSHBench: A Multilingual, Consensus-Grounded Benchmark for Library of Congress Subject Heading Assignment


129. From Symbolic to Geometric: Enabling Spatial Reasoning in Large Language Models


130. DSIRM: Learning Query-Bridged Discrete Semantic Identifiers for E-commerce Relevance Modeling


131. Selective Coupling of Decoupled Informative Regions: Masked Attention Alignment for Data-Free Quantization of Vision Transformers


132. Multi-Granularity 3D Kidney Lesion Characterization from CT Volumes


133. MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models


134. HYolo: An Intelligent IoT-Based Object Detection System Using Hypergraph Learning


135. Expectations vs. Realities: The Cost of MSE-Optimal Forecasting Under Conditional Uncertainty


136. From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents


137. Generalizable Multi-Task Learning for Wireless Networks Using Prompt Decision Transformers


138. A Geometric Characterization of the Stationary Plateau for Two-Layer Neural Networks


139. Measuring What Matters: Synthetic Benchmarks for Concept Bottleneck Models


140. OpenRFM: Dissecting Relational In-Context Learning


141. Anycast Performance in Context


142. Scaling Novel Graph Generation via Lightweight Structure-Guided Autoregressive Models


143. Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling


144. The Loss Is Not Enough: Sampling Conditions and Inductive Bias in Contrastive Representation Learning


145. From Ticks to Flows: Dynamics of Neural Reinforcement Learning in Continuous Environments


146. StandardE2E: A Unified Framework for End-to-End Autonomous Driving Datasets


147. Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation


148. Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA


149. Overview of the EReL@MIR 2025 Multimodal Document Retrieval Challenge (Track 1)


150. Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data


151. Supportive Token Revealing for Fast Diffusion Language Model Decoding


152. MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A


153. Incremental Sheaf Cohomology on Cellular Complexes: O(1)-in-n Lazy Edit Processing under Bounded Local Geometry


154. PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification


155. DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities


156. Notarized Agents: Receiver-Attested Confidential Receipts for AI Agent Actions


157. Metric-Aware Hybrid Forecasting for the CTF4Science Lorenz Challenge


158. Dual Advantage Fields


159. Exact Unlearning in Reinforcement Learning


160. A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models


161. MimeLens: Position-Agnostic Content-Type Detection for Binary Fragments


162. Smart Transportation Without Neurons – Fair Metro Network Expansion with Tabular Reinforcement Learning


163. ADAPTOOD: Uncertainty-Aware Fine-Tuning for Out-of-Distribution ECG Time Series Models


164. EvalStop: Using World Feedback to Detect and Correct Reward Overoptimization in Multi-Tenant RLHF Platforms


165. Physics-Informed Machine Learning for Short-Term Flood Prediction


166. Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents


167. HighTide: An Agent-Curated Open-Source VLSI Benchmark Suite


168. Semantic Constraint Synthesis for Adaptive Trajectory Optimization via Large Language Models


169. SaliMory: Orchestrating Cognitive Memory for Conversational Agents


170. dMX: Differentiable Mixed-Precision Assignment for Low-Precision Floating-Point Formats


171. AgenticDiffusion: Agentic Diffusion-based Path Planning for Vision-Based UAV Navigation


172. SymTRELLIS: Symmetry-Enforced Voxel Latents for 3D Generation


173. Building The Ph(ysical)AI Layer Of Machine Intelligence


174. Proof-Carrying Agent Actions: Model-Agnostic Runtime Governance for Heterogeneous Agent Systems


175. The Differentiable Auditory Loop (DAL): An ML Framework for Hyper-Personalized Hearing Aids


176. POLARIS: Guiding Small Models to Write Long Stories


177. Large Language Models Hack Rewards, and Society


178. Adaptive Patching Is Harder Than It Looks For Time-Series Forecasting


179. TPA-AD: A Two-Stage Pseudo Anomaly-Guided Method for Bearing Time-Series Anomaly Detection


180. Need to Know: Contextual-Integrity-Grounded Query Rewriting for Privacy-Conscious LLM Delegation


181. LLM Compression with Jointly Optimizing Architectural and Quantization choices


182. Spectral Scaling Laws of Muon


183. The Invisible Lottery: How Subtle Cues Steer Algorithm Choice in LLM Code Generation


184. A Goal-Set Characterization of Task Composition in the Boolean Task Algebra


185. RUBAS: Rubric-Based Reinforcement Learning for Agent Safety


186. LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection


187. Unlocking Feature Learning in Gated Delta Networks at Scale


188. Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation


189. Bayes-Sufficient Representations in Supervised Learning


190. Channel-Oriented Design for EEG-to-Music Reconstruction


191. Beyond Static Priors: Dynamic Neural Guidance for Large-Scale Ant Colony Optimization


192. Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs


193. Do Transformers Need Three Projections? Systematic Study of QKV Variants


194. Position: Deployed Reinforcement Learning should be Continual


195. MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models


196. The Biomimetic Architecture of Software 4.0


197. CodegenBench: Can LLMs Write Efficient Code Across Architectures?


198. Gravity-Aware Hierarchical Routing for Lightweight SensorLLM on Human Activity Recognition


199. The Variance Brain Foundation Models Forgot: Third-Order Statistics Predict Cognition Where Billion-Parameter Models Fail


200. Counterfactual Explanations for Deep Two-Sample Testing


201. Neural Radiated-Noise Fields for Unmanned Underwater Vehicle Noise Spectrum Prediction in Three-Dimensional Scenes


202. Early Detection of Alzheimer’s Disease Using Explainable Machine Learning on Clinical Biomarkers: A Multi-Class Classification Study Using the Alzheimer’s Disease Neuroimaging Initiative (ADNI) Dataset


203. Constraint-Enhanced Physical Search through Correlation Matching


204. SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification


205. DiffAero: A GPU-Accelerated Differentiable Simulation Framework for Efficient Quadrotor Policy Learning


206. How do machines learn? Evaluating the AIcon2abs method


207. AI from concrete to abstract: demystifying artificial intelligence to the general public