전체 AI 논문 - 2026-06-01

1. Choosing the Lens: Strategic Perspective Activation in Context-Dependent Argumentation


2. LinTree: Improving LLM Reasoning with Explicitly Structured Search Histories


3. AutoSci: A Memory-Centric Agentic System for the Full Scientific Research Lifecycle


4. Answer-Set-Programming-based Abstractions for Reinforcement Learning


5. FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning


6. HypoAgent: An Agentic Framework for Interactive Abductive Hypothesis Generation over Knowledge Graphs


7. Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration


8. Diagnosing Failure Modes of Shared-State Collaboration in Resource-Constrained Visual Agents


9. TraceGraph: Shared Decision Landscapes for Diagnosing and Improving Agent Trajectories


10. Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation


11. COLLEAGUE.SKILL: Automated AI Skill Generation via Expert Knowledge Distillation


12. Formalizing and falsifying causal pathways of rare events


13. LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability


14. Vector Linking via Cross-Model Local Isometric Consistency


15. GraphARC: A Comprehensive Benchmark for Graph-Based Abstract Reasoning


16. HADT: A Heterogeneous Multi-Agent Differential Transformer for Autonomous Earth Observation Satellite Cluster


17. A Persona-Based Evaluation Framework for Pluralistic Alignment in Generative AI


18. BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs


19. UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling


20. Distilling LLM Feedback for Lean Theorem Proving


21. COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents


22. SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning


23. Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward


24. PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges


25. Learning Agent-Compatible Context Management for Long-Horizon Tasks


26. Generating Graph-like Rules for Knowledge Graph Reasoning via Diffusion Models


27. MAVEN: Improving Generalization in Agentic Tool Calling


28. Healthcare Mechanisms from Policy-as-Code Search under Strategic Provider Response



30. EHRBench: An Automated and Reliable EHR-based Benchmark for Clinical Decision Making with LLMs


31. Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents


32. Uncertainty-Aware and Temporally Regulated Expert Advice in Reinforcement Learning for Autonomous Driving


33. Procedural Generation of First Person Shooter Maps using Map-Elites


34. Transforming and Encoding FTS for SAT Solving: What Helps, What Hurts (Extended Version)


35. Physically Viable World Models: A Case for Query-Conditioned Embodied AI


36. PhyDrawGen: Physically Grounded Diagram Generation from Natural Language


37. Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models


38. Stateful Online Monitoring Catches Distributed Agent Attacks


39. TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation


40. Language Models Learn Constructional Semantics, Not To Mention Syntax: Investigating LM Understanding of Paired-Focus Constructions


41. LongTraceRL: Learning Long-Context Reasoning from Search Agent Trajectories with Rubric Rewards


42. SPECTRA: Synthetic IR Test Collections with Relevance Oracles and Controlled Distractor Diagnostics


43. What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text Generation


44. Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization


45. Vision-Language Models Suppress Female Representations Under Ambiguous Input


46. RayDer: Scalable Self-Supervised Novel View Synthesis from Real-World Video


47. Feature-Optimized Vision for Adaptive 3D Scene Reconstruction


48. Separating Secrets from Placeholders: A Hybrid CNN-CodeBERT Framework for Three-Class Credential Leakage Detection


49. If LLMs Have Human-Like Attributes, Then So Does Age of Empires II


50. Skill Reuse as Compression in Agentic RL


51. On Efficient Scaling of GNNs via IO-Aware Layers Implementations


52. Scaling Conversational Hungarian ASR: The BEA-Dialogue+ Corpus


53. GPU Forecasters: Language Models as Selective Surrogates for Kernel Runtime Optimization


54. PithTrain: A Compact and Agent-Native MoE Training System


55. Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction


56. Used Car Salesbots? Honesty and Credulity of LLMs as Bargaining Agents under Partial Information


57. DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs


58. Neuro-symbolic Syntactic Parsing: Shaping a Neural Network with the CYK Algorithm


59. Skill Availability and Presentation Granularity in Large-Language-Model Agents: A Controlled SkillsBench Study


60. The Sword, Shield, and Achilles’ Heel: Characterizing the Linguistic Inductive Bias of Large Language Models for Spatial Reasoning in Navigation Planning


61. Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models


62. DynaTree: Dynamic Agentic Retrieval Tree for Time-Sensitive News Retrieval


63. Scaling Higher-Order Graph Learning with Maximal Clique Complexes


64. Dreaming Of Others: Latent Teammate Modeling In World Models For Multi-Agent Reinforcement Learning


65. dashi: A Python library for Dataset Shift Characterization to Support Trustworthy AI Development and Deployment


66. FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection


67. Appropriateness of Empathy in AI: A Signal-Cost Perspective


68. Social welfare optimisation under institutional reward and punishment


69. Inconsistency-Aware Minimization: Improving Generalization with Unlabeled Data


70. Latent Space Disentanglement via Activation Steering for Interpretable Attribute Control in Symbolic Music Generation


71. The Terminal Representation in Reinforcement Learning


72. Neither Replacement nor Panacea: Comparing LLM-Based Conversational and Graphical Decision Support in Industrial Tasks


73. DeMaVLA: A Vision-Language-Action Foundation Model for Generalizable Deformable Manipulation


74. SAM for Robust Mitochondria Instance Segmentation in Fluorescence Microscopy


75. Practical Cross-Band Channel Prediction for AI-RAN via Physics-Guided Deep Unfolding


76. Personalized to Persuade: The Effects of Contextualization and Warmth on Trust and Reliance in Conversational AI


77. Envisioning Beyond the Few: Disentangled Semantics and Primitives for Few-Shot Atypical Layout-to-Image Generation


78. Why Linear Recurrent Memory Works in Partially Observable Reinforcement Learning


79. ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models


80. Entropic Projection Alignment: Estimating, Explaining, and Improving Model Performance Under Distribution Shift


81. Learning Cardiac Latent Representations in Vectorcardiogram Space


82. Correcting Split Selection in Online Decision Trees via Anytime-Valid Inference


83. Beyond Classification: Dynamic Adapter Routing for Continual Multimodal Retrieval


84. EchoRL: Reinforcement Learning via Rollout Echoing


85. What changes after deployment? A survey on On-device Learning in TinyML


86. Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study


87. Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models


88. Benchmarking and Enhancing Text-to-Image Models for Generating Visual Representations in Early Arithmetic Education


89. Simulation of collision avoidance behavior in crowd movement by data-driven approach


90. MAECO-Lite: Modular Ontology for Dynamic Malware Analysis


91. Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration


92. Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines


93. MindVoice: Reconstructing Intelligible Speech from Non-invasive Neural Signals with Pretrained Priors


94. MIMO: Multilingual Information Retrieval via Monolingual Objectives


95. Emergent Languages in Populations of Language Model Agents: From Token Efficiency to Oversight Evasion


96. D$^3$: Dynamic Directional Graph-Constrained Data Scheduling for LLM Training


97. Trust-Region Behavior Blending for On-Policy Distillation


98. Developing a UXR Point of View for Cognitive Accessibility in Mobile Learning with Generative AI


99. SpatialAct: Probing Spatial Reasoning-to-Action Capabilities of VLM Agents in 3D Scenes


100. Developing a Culturally Grounded, AI-Augmented UX Research Point of View (POV): An Exemplar Case Study from Telemedicine Dementia Care


101. From Evidence to Design: Developing an AI-Augmented UX Research Point of View for Digital Wellbeing in Emergency and Public Safety Contexts


102. FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization


103. Extending the UXR Point of View Pyramid: A Generative AI-Augmented Methodology for Human-Centred AI Systems


104. On the Robustness of Multilingual Text Embedding Rankings Across Learning Tasks, Languages, and Benchmark Datasets


105. Developing an AI-Powered UX Research Point of View for Digital Health in A Regulatory Context: An Exemplar Case from MSM and Transgender HIV Care in Nigeria


106. UXR PoV for Neuroinclusive Emotion Regulation


107. Not All Synthetic Data Is Yours to Learn From


108. TARIC: Memory-Augmented Traversability-Aware Outdoor VLN under Interrupted Semantic Cues


109. SWIM: Single-Instance Whole-Body Imitation for swiMming


110. KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning


111. SpecDB: LLM-Generated Customized Databases via Feature-Oriented Decomposition


112. Redefining Instance Matching: A Unified Framework for Part-Aware Matching in Panoptic Segmentation Evaluation


113. On Revisiting Entropy for Identifying Mislabeled Images


114. A Pilot Study on Curator-Guided Multilingual Art Description for Blind and Low-Vision Audiences with Small Vision-Language Models


115. DRIFT: Joint Channel Estimation and Prediction Towards Pilotless 6G Non-Terrestrial Networks


116. Fighting Numerical Hallucinations via Data-centric Compilation for Online Financial QA


117. STEP: Learning STructured Embeddings for Progressive Time Series


118. AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing


119. Linear Ordering Problem: Time for a Change


120. Learning to Solve and Optimize by Evolving Code


121. Routing on the Stiefel Manifold: When Does Adaptive Subspace Selection Help for Cross-Domain EEG Decoding?


122. From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors


123. Does Visual Information Play a Decisive Role in Vision-Language-Action Model Driving Behavior?


124. Annealed Softmax Greedy in Many-Armed Bayesian Bandits


125. DEM: A Distilled Explanation Model for Interpretable Anomaly Detection in Physiological Sensor Networks


126. Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation


127. Variational Adapter for Cross-modal Similarity Representation


128. Reading Between the Citations: A Typed Claim Network for Scientific Literature


129. ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment


130. AMix-2: Establishing Protein as a Native Modality in Large Language Models


131. Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity


132. TUX: Measuring Human–AI Tacit Understanding


133. De-attribute to Forget for LLM Unlearning


134. Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits


135. What Makes LVLMs Hallucinate Less? Unveiling the Architectural Factors Behind Hallucination Robustness


136. BlueFin: Benchmarking LLM Agents on Financial Spreadsheets


137. Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach


138. A Unified and Reproducible Experimentation Framework for Speech Understanding


139. PatchWorld: Gradient-Free Optimization of Executable World Models


140. Federated Variational Preference Alignment with Gumbel-Softmax Prior for Personalized User Preferences


141. Sophrosyne: Agentic Exploration of Relational Data Systems Needs Moderation


142. DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning


143. Safe Equilibrium Policy Optimization for Strategic Agent Policies


144. Fine-Tuning Improves Information Conveyance in Language Models


145. Hide-and-Seek in Trajectories: Discovering Failure Signals for VLA Runtime Monitoring


146. Your Teacher Can’t Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation


147. Beyond Agreement: Scoring Panel-Surfaced Biomedical Entity Candidates for Curator Triage


148. Unlearning in Diffusion Models: A Unified Framework with KL Divergence and Likelihood Constraints


149. GaMi: Geometry-Agnostic Material Identification via Cross-Modal Subtractive Disentanglement


150. Differentially Private Preference Data Synthesis for Large Language Model Alignment


151. Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution


152. MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding


153. OpenSTBench: Beyond Semantic Evaluation for Speech Translation


154. On the impact of retrieved content representations in RAG Pipelines


155. Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO


156. XLGoBench: Detecting cross-lingual skill gaps with algorithmic tasks


157. Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS


158. GSAM: A Generalizable and Safe Robotic Framework for Articulated Object Manipulation


159. OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning


160. Kalimati Vegetable Price Index Forecasting with a Momentum Corrected Online Stacking Ensemble


161. When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?


162. Simple Token-Efficient Vision-Language Model for Case-level Pathology Synoptic Report Generation


163. SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs


164. Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence


165. ConTrans: Learning Text-enhanced Local-global Temporal Representations for Zero-shot Temporal Action Localization


166. Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity


167. How Early Adopters Used Generative AI Worldwide: Variation by Country Income and Language


168. Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents


169. Human-Alignment, Calibration, and Activation Patterns in Large Language Model Uncertainty


170. CobSeg: Coherence Boundary Modeling for Dialogue Topic Segmentation


171. Automatically Attacking Software Reverse Engineering AI Agents


172. EUDAIMONIA: Evaluating Undesirable Dynamics in AI


173. LARK: Learnability-Grounded Trajectory Selection for Efficient Reasoning Distillation


174. Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs


175. COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models


176. PInVerify: An Offline Embodied Benchmark for Active Instance Verification


177. Score Broadcast and Decorrelation: A General Framework for Broadcast-Based Credit Assignment


178. Rationalize: Shared Semantic Reasoning for Human-AI Alignment


179. Controllable Lung Nodule Synthesis via Histogram-Regularized Latent Diffusion Models


180. The Architecture of Errors: From Universal Impossibility to Patch-Local LLM Reliability


181. Active Timepoint Selection for Learning Measure-Valued Trajectories


182. Reward Learning from Best-of-$N$ Preference Data: Targets, Tradeoffs, and Design Principles


183. Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs


184. An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations


185. Scientific Machine Learning for Engine Health Management and Remaining Useful Life Prediction


186. Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents


187. ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law


188. Benchmarking Machine Learning Uncertainty Quantification Methodologies for Predicting Turbine Gas Temperature Degradation


189. Prior Availability in Industrial Visual Sim-to-Real: A Review of CAD-Guided and CAD-Unavailable Regimes


190. Memory-Bound but Not Bandwidth-Limited: The Physical AI Inference Gap in Batch-1 LLM Decode


191. VLM3: Vision Language Models Are Native 3D Learners


192. Seeing Isn’t Knowing: Do VLMs Know When Not to Answer Spatial Questions (and Why)?


193. Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages


194. Revisiting Padded Transformer Expressivity: Which Architectural Choices Matter and Which Don’t


195. A Novel Global Context-aware Deep Neural Network for Enhanced Brain Tumor Segmentation using Magnetic Resonance Images


196. Improved Distribution Estimation in $\ell_\infty$


197. Graph-Conditioned Mixture of Graph Neural Network Experts for Traffic Forecasting


198. idSCD: Identifying Training Datasets through Semantic Correlation Descriptors


199. Scalable Constrained Multi-Agent Reinforcement Learning via State Augmentation and Consensus for Separable Dynamics


200. The Surface You Test Is Not the Surface That Breaks


201. A Unified Framework for Gradient Aggregation in Multi-Objective Optimization


202. Calibrated Preference Learning: The Case of Label Ranking


203. LongDS-Bench: On the Failure of Long-Horizon Agentic Data Analysis


204. Domain Adaptation and Reasoning Frameworks in Language Models: A Controlled Experiment with Historical Cosmology


205. SANA-Streaming: Real-time Streaming Video Editing with Hybrid Diffusion Transformer


206. Exploring Autonomous Agentic Data Engineering for Model Specialization


207. AI Loss of Control Incident Management: Response & Resilience


208. CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models


209. NumLeak: Public Numeric Benchmarks as Latent Labels in Foundation Models


210. Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate


211. Functional MRI Time Series Generation via Wavelet-Based Image Transform and Spectral Flow Matching for Brain Disorder Identification


212. LLMs Without Deep Neural Networks: New Architecture, Benefits and Case Study


213. Structured interactions improve distributed coordination beyond model scaling in a real-world multi-robot system


214. When LLMs Learn to Be Consistently Wrong: A Multi-Model Study of Linear Representations of Synthetic Deception


215. Unicorn: Scaling High-Dimensional Time Series Forecasting via Universal Correlation Modeling


216. Full-field prediction for engineering-scale three-dimensional aircraft with multigrid-hierarchical learning


217. Evolutionary Algorithm for Reservoir Learning and Yielding


218. Updating the standard neuron model in artificial neural networks


219. Reinterpreting Safety Thresholds as Neuron Spiking Thresholds


220. Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation


221. Hamiltonian-Inspired Attention Mechanism for Scalable RF Transmitter Fingerprinting


222. Enhancing Regime Shift Detection Using Unstructured Data: A Study on the Treasury Market


223. XOResNet: Exclusive-OR Meta-Residuals Facilitate Deep Spiking Neural Networks Learning


224. Gradient-Free Training of Spiking Neural Networks via Low-Rank Evolution Strategies


225. When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL


226. TRINE: A Token-Aware, Runtime-Adaptive FPGA Inference Engine for Multimodal AI