전체 AI 논문 - 2026-05-27

1. MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation


2. Natural Language Query to Configuration for Retrieval Agents


3. Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases


4. 2-ASP(Q) programs with weak constraints: Complexity and efficient implementation



6. Modeling Agentic Technical Debt and Stochastic Tax: A Standalone Framework for Measurement, Simulation, and Dashboarding


7. SIA: Self Improving AI with Harness & Weight Updates


8. Gumbel Machine: Counterfactual Student Writing Generation via Gumbel Noise Steering


9. Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments


10. The Compressive Knowledge Graph Hypothesis: Which Graph Facts Matter for Scientific Hypothesis Generation?


11. Query Symbolically or Retrieve Semantically? A Dataset and Method for Semi-Structured Question Answering


12. Detecting Is Not Resolving: The Monitoring Control Gap in Retrieval Augmented LLMs


13. VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions


14. StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning


15. ICCU: In-Context Continual Unlearning via Pattern-Induced Refusal Rules


16. Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation


17. Position: AI Safety Requires Effective Controllability


18. Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation


19. Can Broad Biomedical Knowledge be Contextualized into Scenario-Grounded Propositions?


20. Traceable Knowledge Graph Reasoning Enables LLM-Assisted Decision Support for Industrial VOCs in the Steel Industry


21. BatteryMFormer: Multi-level Learning for Battery Degradation Trajectory Forecasting


22. Boosting Knowledge Graph Foundation Models via Enhanced Negative Sampling


23. ORCA: An End-to-End Interactive Copilot for Optimized Root Cause Analysis


24. Generating Robust Portfolios of Optimization Models using Large Language Models


25. LELA: An End-to-end LLM-based Entity Linking Framework with Zero-shot Domain Adaptation


26. Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)


27. Developing a Totally Unimodular Linear Program for Optimal Conformance Checking: When and Why It Complements A*



29. TADDLE: A Tool-Augmented Agent for Detecting Deficient LLM-Generated Peer Reviews


30. On the Detection of Commutative Factors in Factor Graphs: Necessary and Sufficient Conditions


31. Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation


32. Helicase: Uncertainty-Guided Supply Chain Knowledge Graph Construction with Autonomous Multi-Agent LLMs


33. What Makes Chain-of-Thought Work at Probe Time? Local Co-occurrence Rather Than Global Derivation


34. Composition Collapse: Stable Factual Knowledge Does Not Imply Compositional Reasoning


35. LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?


36. The Attribution Blind Spot: Detecting When Language Models Rely on Memory Rather Than Retrieved Context


37. Beyond a Single Direction: Chain-of-Thought Disrupts Simple Steering of Refusal


38. A Dataset of Robot-Patient and Doctor-Patient Medical Dialogues for Spoken Language Processing Tasks


39. It’s Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers


40. Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation


41. Mind the Tool Failures: Achieving Synergistic Tool Gains for Medical Agents


42. MemFail: Stress-Testing Failure Modes of LLM Memory Systems


43. Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems


44. UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems


45. Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2


46. FAST-GOAL: Fast and Efficient Global-local Object Alignment Learning


47. AGORA: Adapter-Grounded Observation-Action Retention for Inference-Free Prompt Compression in LLM Agents


48. MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning


49. MobileExplorer: Accelerating On-Device Inference for Mobile GUI Agents via Online Exploration


50. PolyFusionAgent: A Multimodal Foundation Model and Autonomous AI Assistant for Polymer Property Prediction and Inverse Design



52. The MiniMax-M2 Series: Mini Activations Unleashing Max Real-World Intelligence


53. Reasoning, Code, or Both? How Large Language Models Handle Variations in Math Questions


54. From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator


55. Advancing Creative Physical Intelligence in Large Multimodal Models


56. Exploiting Local Dynamics Regularity for Reusable Skills in Offline Hierarchical RL


57. Automatic Layer Selection for Hallucination Detection


58. ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence


59. Managing Uncertainty in LLM-Generated Procedural Knowledge for Virtual Laboratory Planning


60. JobBench: Aligning Agent Work With Human Will


61. OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling


62. Anchor: Mitigating Artifact Drift in Agent Benchmark Generation


63. Experiments in Agentic AI for Science


64. Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems


65. Constraint acquisition needs better benchmarks


66. Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions


67. Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory


68. Can LLMs Introspect? A Reality Check


69. BrickAnything: Geometry-Conditioned Buildable Brick Generation with Structure-Aware Tokenization


70. Algorithmic Monocultures in Hiring


71. LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding


72. GENESIS: Harnessing AI Agents for Autonomous 6G RAN Synthesis, Research, and Testing


73. MobileMoE: Scaling On-Device Mixture of Experts


74. Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders


75. When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection


76. EdgeFlow: Edge-Map Augmented VLM-Based Flowchart Processing for Industrial Requirements Engineering


77. Governed Evolution of Agent Runtimes through Executable Operational Cognition


78. Risk Averse Alert Prioritization for IDS Using Subnormal Gaussian Fuzzy Models


79. It’s Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty


80. Falcon-X: A Time Series Foundation Model for Heterogeneous Multivariate Modeling


81. FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies


82. Lost in Sampling: Assessing Lexical Reachability in LLMs via the Word Coverage Score (WCS)


83. PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis


84. Pair-In, Pair-Out: Latent Multi-Token Prediction for Efficient LLMs


85. LUCoS: Latent Unsupervised Context Selection for Tabular Foundation Models


86. Many Logics, One Methodology: A Plea for Logical Pluralism in Formalised Reasoning (preprint)


87. Qiskit QuantumKatas: Adapting Microsoft’s Quantum Computing exercises for LLM evaluation


88. TWIST: Closed-Loop token Synchronization for Application-Aware Wireless Digital Twins


89. Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis


90. Learning When to Think While Listening in Large Audio-Language Models


91. FoundObj: Self-supervised Foundation Models as Rewards for Label-free 3D Object Segmentation


92. An investigation of AI integration in sound designer workflows and experiences


93. Grounding Text Embeddings in Stakeholder Associations


94. LitSeg: Narrative-Aware Document Segmentation for Literary RAG


95. Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection


96. Deep-layer limit and stability analysis of the basic forward-backward-splitting induced network (II): learning problems


97. Beyond the Data Mesh Illusion: Designing Modern AI-augmented Lakehouses to Bridge the Gap Between Theory and Practice



99. High-Quality Synthetic Financial Time-Series using a GAN-Diffusion Framework


100. MiRD: Reliable Set-Valued Prediction for Open-Ended Question Answering via Miscoverage Risk Decomposition


101. ReMoE: Boosting Expert Reuse through Router Fine-Tuning in Memory-Constrained MoE LLM Inference


102. Trust Region Q Adjoint Matching


103. Two Speeds of Learning: A Representation-Readout Decomposition of Grokking and Double Descent


104. E3: Issue-Level Backtesting for Automated Research Critique


105. QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents


106. ConVer: Using Contracts and Loop Invariant Synthesis for Scalable Formal Software Verification


107. Lessons from Penetration Tests on Large-Scale Agent Systems


108. Tracing Computation Density in LLMs


109. Less is More: Early Stopping Rollout for On-Policy Distillation


110. Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models


111. Evaluating the Relevance of Uncertainty Estimators for LLM Hallucination


112. ReasonOps: A Unified Operational Paradigm for Trustworthy Verified LLM Reasoning


113. Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V


114. Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning


115. Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling


116. Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation


117. JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors


118. Beyond Questions: Evaluating What Large Language Models (Actually) Know


119. Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks


120. EEG-FM-Audit: A Systematic Evaluation and Analysis Pipeline for EEG Foundation Models


121. Practical Anonymous Two-Party Gradient Boosting Decision Tree


122. ICICLE: Expanding Retrieval with In-Context Documents


123. Strategies for Guiding LLMs to Use Software Design Patterns: A Case of Singleton


124. Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models


125. GeoFaith: A Spatio-Temporal Dual View of Faithful Chain-of-Thought


126. Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations


127. The Strongest Teacher Is Not Always the Best Teacher: Student-Centric Answer Selection


128. Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study


129. The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology


130. Periodic Topological Deep Learning for Polymer Design and Discovery


131. The Kalman Evolve: Closing the Gap in Kalman Filtering via Interpretable Algorithm Discovery


132. ContextGuard: Structured Self-Auditing for Context Learning in Language Models


133. RAGEAR: Retrieval-Augmented Graph-Enhanced Academic Recommender


134. Innovation: An Almost Characterization of Hallucination


135. HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML


136. SeDT: Sentence-Transformer Decision-Transformer Conditioning for Multi-Turn Conversation Reliability


137. Implementation of Big Data Analytics for Diabetes Management: Needs Assessment in the Rwanda Healthcare System


138. EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation


139. Ratio-Variance Regularized Policy Optimization


140. Towards Generalization-Oriented Models for Vehicle Routing Problems with Mixture-of-Experts


141. Generative artificial intelligence and the marginalization of minoritized knowledges in higher education: the case of disability


142. Adversarial Training for Robust Coverage Network under Worst-case Facility Losses


143. Cordon-MAS: Defending RAG against Knowledge Poisoning via Information-Flow Control


144. MatFormBench: A Benchmarking Evaluation Framework for Target-Driven Materials Formulation


145. Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models


146. Measuring Prediction Uncertainty in Neural Cellular Automata


147. L2Rec: Towards Dual-View Understanding of LLMs for Personalized Recommendation


148. SL-BiLEM: Structured Learnable Behavior-in-the-Loop Epidemic Modeling for Forecasting and Policy Evaluation


149. Rotation-Invariant Spherical Watermarking via Third-Order SO(3) Representation Coupling


150. Model Merging on Loss Landscape: A Geometry Perspective


151. Self-Improvement Imitation with Biologically Guided Search for Protein Design Under Oracle Budgets


152. Beyond Trajectory-Level Attribution: Graph-Based Credit Assignment for Agentic Reinforcement Learning


153. An In-Vitro Study on Cross-Lingual Generalization in Language Models


154. DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding


155. Certified Causal Attribution for Real-Time Attack Forensics in 6G Network Slicing


156. The Labyrinth and the Thread: Rethinking Regularizations in Sequential Knowledge Editing for Large Language Models


157. AI evaluation may bias perceptions: The importance of context in interpreting academic writing


158. Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models


159. Bilevel Optimization over Saddle Points of Zero-Sum Markov Games


160. More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations


161. JetViT: Efficient High-Resolution Vision Transformer with Post-Training Attention Search


162. MedVol-R1: Reward-Driven Evidence Grounding for Volumetric Reasoning Segmentation


163. Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training


164. Geometry-Aware Contrastive Learning for Few-Shot Automatic Modulation Recognition


165. Cordyceps: Covert Control Attacks on LLMs via Data Poisoning


166. Examining the Challenges of Intellectual Property in AI-Generated Productions


167. Few-shot Cross-country Generalization of Tabular Machine Learning and Foundation Models for Childhood Anemia Prediction under Distribution Shift


168. On the Error-Correcting Effects of Stochasticity in Discrete Diffusion


169. Bridging Control with Neural Network Verifier alpha-beta-CROWN: A Tutorial


170. Reliable Extraction of Clinical Follow-Up Instructions: A Hybrid Neural-Symbolic Pipeline


171. Auditing and Fixing Economic Validity in Tabular Foundation Models for Discrete Choice


172. Linear and Neural Dueling Bandits with Delayed Feedback


173. Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference


174. ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation


175. DGLD: Domain-Gated Latent Diffusion for the Discovery of Novel Energetic Materials


176. Recursive Flow Matching


177. A Hybrid Vision-Language Architecture for Automated Defect Reasoning and Report Generation in Industrial Inspection


178. ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation


179. CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence


180. StreamSplit: Continuous Audio Representation Learning via Uncertainty-Guided Adaptive Splitting


181. InterSketch: An Interleaved Reasoning Model with Self-correcting Visual Sketch and Stepwise Reward


182. CSV-ViT: A Vision Transformer with the Variable-sized Cortical Supervertices for Detection of Alzheimer’s Disease Pathologies


183. Foundations of a Time-Consistent Counterfactual Actuarial Runtime for Autonomous AI Agents


184. Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization


185. Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling


186. Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories


187. Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient


188. Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes


189. Diffuse to Detect: Generative Diffusion Models for Unsupervised IC Anomaly Detection


190. Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records


191. AnchorDiff: Training-Free Concept Grounding for MM-DiTs via Anchor-Based Graph Propagation


192. Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization


193. Cross-scale Aligned Supervision for Training GANs


194. DDGAD: Trajectory Dynamics for Diffusion-Based Graph Anomaly Detection


195. Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines


196. Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective


197. LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness


198. Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models


199. Aperiodic and Low-Frequency Spectral Bias in Reconstruction based EEG Foundation Models


200. Structure-Adaptive Conformal Inference for Large-Scale Out-of-Distribution Testing


201. Uniboost: Global Coordination with Value Alignment for Fair and Efficient Traffic Allocation


202. When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control


203. The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP


204. Confounder Detection via Treatment Intent: A New Observational Study Design


205. Jailbreak susceptibility prediction and mitigation via the behavioral geometry of models


206. Plans for Evaluating Structured Generative Search Summaries


207. Annotator Positionality as Signal: Psychometric Weighting for Anti-Autistic Ableism Detection


208. Credit-assigned Policy Gradient for Early Stage Retrieval in Two-stage Ranking


209. VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes


210. BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma


211. Unified Panoramic Geometry Estimation via Multi-View Foundation Models


212. Why LLMs Hallucinate on Structured Knowledge: A Mechanistic Analysis of Reasoning over Linearized Representations


213. Personalized Generative Models for Contextual Debiasing


214. When Correct Demonstrations Hurt: Rethinking the Role of Exemplars in In-Context Learning


215. Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models


216. Semigroup Consistency as a Diagnostic for Learned Physics Simulators


217. E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control


218. Curriculum Learning for Safety Alignment


219. Intelligent Detection and Mitigation of Carpet-Bombing DDoS Attacks in SDN Using Retrieval-Augmented Generation and Large Language Models


220. CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations


221. Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering


222. VesselSim: learning 3D blood vessel segmentation without expert annotations


223. Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion


224. Prospective evaluation of multimodal respiratory failure prediction: Do chest X-rays improve performance beyond EHR signals?


225. Unified Neural Scaling Laws


226. AgentSociety: Incentivizing Agentic Social Intelligence


227. Workflow Closure Is Not Scientific Closure in Auto-Research Systems


228. CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly


229. Bridging Classification and Reconstruction: Cooperative Time Series Anomaly Detection


230. Co-folding model guided by structural proteomics


231. Modeling Dynamic Mixtures of Time-Delay Systems from Streaming Time Series


232. HRVConformer: Neonatal Hypoxic-Ischemic Encephalopathy Classification from the Heart Rate signals


233. Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training


234. SetupX: Can LLM Agents Learn from Past Failures in Functionality-Correct Code Repository Setup?


235. GAC: Noise-Aware Adaptive Mixing for Hybrid SFT-RL Post-Training


236. AutoDFT: A Closed-Loop Multi-Agent Framework for Autonomous DFT Calculations


237. RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations


238. PitchBench: Measuring Pitch Hearing in Audio-Language Models


239. InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization


240. A Universal Cliff and a Design Fingerprint: Cross-Section Defect Detection Under LLM Orchestration


241. Planning Neural Dynamics with Lie Group Embedding through Supervised Projective Manifold Learning


242. Enhancing Autonomous Online Intrusion Detection for IoT with Balanced Learning, Reliable Pseudo-Labels, and Lightweight Architectures


243. Tool-Schema Compression Enables Agentic RAG Under Constrained Context Budgets


244. On the Push-Based Asynchronous Federated Learning: A Bias-Correction Aggregation Approach


245. TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models


246. Furina: Fragmented Uncertainty-Driven Refusal Instability Attack


247. Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges


248. When Does Adaptive Guidance Help? Belief-Aware Privileged Distillation for Autonomous Driving Under Partial Observability


249. MemMorph: Tool Hijacking in LLM Agents via Memory Poisoning


250. Augment Engineering: A Methodology for Multi-Tool AI Orchestration Across Professional Domains


251. VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents


252. AssetGen: Deployable 3D Asset Generation at Interactive Speed


253. Eroding Trust in Real Speech: A Large-Scale Study of Human Audio Deepfake Perception


254. Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications


255. GEM: Geometric Entropy Mixing for Optimal LLM Data Curation


256. Edge AI Deployment Beyond Models: A BSP-Aware Systems Framework for Industrial Embedded Platforms


257. Xe-Forge: Multi-Stage LLM-Powered Kernel Optimization for Intel GPU