전체 AI 논문 - 2026-09-25

1. AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control


2. A Living Benchmark for Information Retrieval from Electronic Health Records


3. ExplorationBench: Measuring AI Systems’ Exploration in Verifiable Alien Worlds


4. SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance


5. Jev-Mobile: Jev as an Executor for Mobile GUI Agents



7. GRASP: Generating, Revising, and Assessing for Strategic Planning with Agentic AI


8. EnigmaForge: The Question Is Hidden in the Story


9. Screen Before You Serve: Simulation for Production Customer Experience AI Agents at 140M Scale


10. HEXIS: Compiling Skills into Extended Finite State Machines


11. PrivDrift: Auditing User-Secret Leakage Under Topic Drift in Active LLM Conversations


12. Self-Play Pretraining with Zero Data


13. SciWalker: Synthesizing Scientific Coding Problems with Operator Graphs and Execution Feedback


14. NNV3: Expanding Neural Network Verification to New Architectures and Domains


15. Style, Not Self: Surface Cues Explain Zero-Shot Code Attribution by Large Language Models


16. How does Adversarial Influence Scale in Multi-Agent Systems?


17. Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark


18. Advancing Model Research in AgentX: Long-Horizon Autonomy for Industrial Recommender Systems


19. Augur: A Synthetic Decision Lab for Rehearsing Reactions to Product and Policy Changes


20. ENDOPROMPT: Victim-Side Pseudo-References for Utility Degradation


21. Neuro-symbolic AI for Industrial Configuration


22. Who Holds the Pen? Let Specifications, Not Agents, Sign Off


23. Qwen-Planner-Agent: A Closed-Loop AI-for-AI Framework for Real-World Mobile Planner Agents


24. Ontology-Mediated Neurosymbolic Constraint Acquisition from Multiple Stakeholders


25. When Can Agents Forget Their Reasoning? ICLR for Long-Horizon Agent Context Compression


26. A Risk-Adaptive and Evidence-Constrained Framework for Generative AI Feedback in Programming Education


27. PUBG Ally: A Conversational Embodied Agent as an AI Teammate


28. Decoding Imagined Speech: A Strictly Subject-Independent Approach Using EEG


29. Learning to Ideate for Scientific Impact


30. Hallucination Neurons and Where to Find Them: An Investigation into the existence of Hallucination Neurons


31. Breaking the Environment Wall: Evolving LLM Agent Environments for Recursive Self-Improvement


32. AI-based detection of worsening heart failure from low-resolution telemonitoring data


33. C3M: Cross-Session Multimodal Memory Maintenance for Long-Horizon Tasks


34. The Gold in Bias: Maturing the AI Design Process through Verification


35. A General Framework for Budgeted Threshold Incentives on Request


36. Fair Like Us? Auditing LLM Alignment in Resource Allocation


37. To Think or Not to Think: Allocating Reasoning Where It Helps


38. Ingest-Time Fact Compilation for Cost-Efficient and Reliable Question Answering over Revised Corpora


39. iCoder-27B: Recursive AI-Led Development of Frontier Industrial Coding Model


40. PEEL: Physics-Enabled Evidential Learning for Identifiable Uncertainty in CT Imaging


41. Sequential knowledge editing breaks a model’s ability to tell good evidence from bad, without costing it accuracy


42. PartHackBench: Certified Equal-Progress Stress Tests for Partial-Credit Tool-Agent Evaluation


43. Is Reasoning Always Useful? Rethinking Reasoning Utility in Universal Multimodal Embeddings


44. Cross-Modal Emotion Understanding: A Transformer-GAT Approach for Dialogue Emotion Recognition


45. HiPACE: Hierarchical Phase-Boundary Analysis and Controlled Evaluation of Feature Absorption in Sparse Autoencoders


46. ERRAND: Budgeted Maintenance of Agent Memory


47. Safe Skill Retirement for Physical Agents


48. Clinical Knowledge Graphs for Chest X-Ray Device Reasoning


49. Stale Does Not Mean Unsafe: Guard Precision for Tool-Using LLM Agents under Infrastructure State Races


50. BiGraph-Diffuse: A Bidirectional Diffusion Language Model with Graph-Structured Retrieval For Mental Health Counseling


51. Delay-of-Gratification as a Multi-Agent Survival Micro-benchmark for Long-Horizon LLMs: Social Exposure, Personas, and Tool Use Budgets


52. Evaluation of Multi-Turn Consistency in LLM Agents: Survival Analysis and Failure-Rationale Taxonomy


53. SWE-Prometheus: Measuring Engineering Governance Improvements in Real-World Repositories


54. Just Ask Jev: Reinforcement Learning for Calibrated Decisions as a Zero-Shot Detector of AI Alignment Failures


55. RD-JEPA: Predictive latent pretraining for few-trajectory transfer across reaction–diffusion equations


56. Wearable ECG Quality Assessment: A Deep Learning and Ambulatory Context-Awareness Approach


57. An auditable conditional-strategy framework for open-ended decision-making in complex lung cancer


58. Epistemic-Probabilistic Model for Guarded Multi-Agent LLM Coordination


59. Beyond Simple Input-Output Assessment Tasks: Leveraging Automated Programming Assessment for Non-Trivial Courses


60. The Last Human Gate: Forward Deployed Engineering for Governance Automation


61. SkinAgent AI: A Safety-Grounded Multimodal Agentic Framework for Non-Diagnostic Skincare Support


62. When No One Owns the Judgment: Accountability Under Contribution Dissolution in Human-AI Collaboration


63. From Text Decisions to Pixels: An Study of Jev-Style Visual Choice Model


64. ALOE: Semantically Addressed Low-Rank Operators for Knowledge Editing


65. Baszta: Data-Centric Fine-Tuning of a Polish Multi-Label Safety Classifier


66. Policy as Code: A Coroutine-Bridge Harness for Fast-Reasoning Reliability on CAR-bench


67. Towards An LLM-Driven Unified Conversion Framework for BT and FSM in Autonomous Intelligent Systems


68. ASIRF: An Agentic Framework for Context-Dependent Sensitive Information Redaction


69. When Honesty is Not Enough in AI Debate


70. The Entropy Triangle Method (ETM): A novel framework for the prevention of cardiac arrhythmia with a review of more than 10,000 patients


71. Right Choice of Classification Algorithms Based on Reinforcement Learning for Prediction of Non-Alcoholic Fatty Liver


72. IndicBankBench: Evaluating Safety and Reliability of Language Model Assistants in Indian Retail Banking


73. A Wrong Turn Does Not Ruin the Journey: Deviation-Guided Skill Self-Evolution for LLM Agents



75. Scope Before You Persist: Preventing Cross-Family Interference in Agent Memory


76. Sharp Limits for Honest Uncertainty in Hard-Budget Repeated Evaluation


77. CounterRoute: Self-Routed Reasoning via Hierarchical Counterfactual Credit Assignment


78. Functional Architecture of European Electricity Trading Markets: Requirements for AI Supported Trading Systems under Regulatory Constraints


79. A Rapid Pipeline for Training and Deploying ML Models on WeBe Band


80. CRISS: A Retrieval-Augmented AI Chatbot for Assisting Cancer Registrars


81. From Self-Distillation to Self-Practice: Privileged Information for Multi-Turn Agents


82. SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL


83. MeshHeal: Two-Timescale Self-Healing for Gray Failures in Decentralized LLM Agent Networks


84. AlphaDiverse: Post-Training Local Quantitative Research Agents for Diverse Exploration in Alpha Factor Mining


85. When Does Action Credit Need Updating?


86. Back to the Definition: Estimating Step-Level Advantages via Trajectory Graphs for Agentic Reinforcement Learning


87. From Static Personal Values to Contextualized Personalization: Bayesian Personalized Value Alignment for LLMs


88. PFArena: Benchmarking Language Models for Protein Modification


89. Control the Harness, Control the Cost: Routing and Governing AI Coding Agents in the Enterprise


90. Forecast-Dojo: Replayable Environments for Benchmarking and Training LLM Forecasting Agents


91. Human-AI-Powered Hypothesis Testing: Cost-Aware Selective AI Scoring and Sequential Human Escalation


92. RECLAIM: Can Agents Reproduce the Claims of Machine Learning Papers?


93. Learned Cross-Task Relationships in Multi-Task Models


94. Agent Memory with Episodic Retrieval for Financial Decision-Making


95. Reinforcement Learning with Verifiable Rewards for Small Search Agents


96. Progressive Skill Discovery as Access Control for Tool-Using LLM Agents: Structural Governance through Role-Scoped Capability Delivery


97. Driving Epidemic Models with AI Agents: the Epydemix Agent Framework


98. Beyond Surface Style: Aligning Multi-Turn User Simulators with Behavioral Consistency


99. Training Object Permanence in World Models


100. Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents


101. TWIST: A Proposed Benchmark for Intervention Quality in Conversational Memory, with a Human-Validated Draft-Alignment


102. DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs


103. BaseCamp — An Agentic AI Framework for Automating DNA Sequencing Data Pipelines


104. Pistis Technical Report


105. PAWS: Policy-driven Agentic World Simulation


106. TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split


107. When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing


108. LLM Agents Can Easily Tamper With Their Own Traces


109. RAPID: Robot Agentic Programming from Demonstrations


110. Rolling-WAM: World Action Models with Rolling Imagination


111. Coding Agents for Generalized Task and Motion Planning Problems


112. To Trust or Not to Trust: Retrieval-Augmented Fact Checking in Speech


113. PoEM: Predicting RL Outcomes from Existing Policies


114. TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations


115. Requirement-Bound Verified Commissioning: A Frozen Four-Billion-Parameter Local Model as a Candidate Generator under an External Acceptance Layer with Verification and Release Authority


116. Minimally Invasive Steering of Language Models


117. Instrumental Monitor Evasion Emerges Under Ordinary Task Pressure


118. Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage


119. Does a model’s stated reason for rejecting a candidate do any work?


120. R-DEIM Net: An Efficient Rationale-Augmented Dual-Expert Interaction Model for Paraphrase Detection


121. Accelerating Video Diffusion via Training-Free Trajectory Routing


122. AT-SKM-Net: An Accelerated Trainable Sampling Kaczmarz-Motzkin Framework for Linear Hard-Constraint Feasibility on Dynamic Graphs


123. Reachability-Based Formal Verification of Graph Neural Networks with Node and Edge Features


124. How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt Structure


125. KernelOPT: Dispatch-Aware Agentic Search for GPU Kernel Optimization


126. Can Labor Markets Function in the Age of AI? The Evaluation Bottleneck in Hiring


127. Era by Eon: Benchmarking Enterprise Agents on Hidden Knowledge


128. Canopy: Exploiting Piecewise Smooth Tree Priors for Multi-Fidelity Bandits


129. Low-Cost Assays for Measuring Model Behavior Across Vendors and Releases


130. Automated Regulatory Compliance Question Answering in Financial Services with Domain-Adapted Retrieval-Augmented Generation


131. GHOST-Q: Towards Studying Grounding Hallucinations Overlooked Under Same-score TradeOffs in Quantized VLMS


132. Guardrails or Roadblocks? Effects of Pedagogical Style and Context Awareness in AI Teaching Assistants for Programming


133. From Interests to Semantic IDs: Retrieval-Grounded Credit Assignment for Generative Recommendation


134. Learning Better Reasoning for Generative Recommendation with Semantic IDs


135. World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal


136. ADATEX4D: adaptive texture capacity allocation for 4D gaussian splatting


137. Beyond Average Safety: Chance-Constrained LLM Fine-tuning


138. Tracking States or Tracking Cosets? An Algebraic Account of Learned State Tracking


139. Mind What Matters for Reasoning: Aligning Cross-Modal Attention via Selective Probability Mass Concentration


140. When Temporal Perturbations Act Like Sensor Biases: Label-Free Auditing of Wearable Activity Recognizers


141. An Empirical Study of VLM Pipelines for Long-Document QA


142. Cultural Divergence Preservation: Diagnosing Flattening and Caricature in LLM-Simulated Survey Populations


143. Structured Pose-Conditioned Flow Matching for Generative 5G CSI Augmentation


144. MorphIK: Morphology-Conditioned Neural Inverse Kinematics for Unknown Robots


145. Working with Agentic `Teammates’: When a New Organizational Actor Collides with the Human Ecosystem of Work


146. Multi-Task Learning by using Contextualized Word Representations for Syntactic Parsing of a Morphologically Rich Language


147. Template Ageing and Longitudinal Verification in Fixed-Text Keystroke Dynamics: A Subject-Disjoint Study Across Eight Weeks


148. Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs


149. S2Planner: Multi-Scale Semantic Planner for End-to-End Autonomous Driving


150. Hard Stop: Kernel-Level Preemption and Containment for Rogue Agentic Execution



152. Benchmarking and Domain Adaptation of Automatic Speech Recognition (ASR) for Adolescent Health Communication in Ghanaian Languages


153. TimeBraid: Unifying Time Series and Language for Understanding and Forecasting


154. Prefilling the Reasoning Channel: Output-Prefix Attacks on Reasoning LLMs


155. Anatomy-aware cross-speaker adaptation of complete vocal-tract acoustic-to-articulatory inversion


156. Between the Commits: Process, Error, and Claim Reliability in a Wholly AI-Authored Codebase


157. TopU-LBVS: A Realistic Multi Target Benchmark for Ligand Based Virtual Screening


158. PPTBench: Can Coding Agents Reconstruct the Visual World through Structured, Editable Slides


159. Revalidation Beats Stateful Routing for Scientific Surrogates Under Distribution Shift


160. Decoupling Knowledge and Privacy: Post-Task Self-Distillation Replay for LLM Continual Learning


161. Understanding and Exploiting Initialization Anchoring Weakness in Feedback-Based Agent Planning


162. ReCalMatch:Reliability-Calibrated Semantic Guidance for Semi-Supervised Fine-Grained Recognition


163. The Sequential Price of Continual Learning


164. Do World Models Make Better Robots? A Survey of Evaluation Benchmarks for Predictive Embodied Intelligence


165. Graph, Loop, and Harness Engineering for Zero-Trust Agentic Data Engineering and Analytical Processing


166. Investigating White Blood Cells as a Source of False-Positive Malaria Parasite Detection in African Blood-Smear Images


167. AgentKernel: The Trust-Native Agentic Operating System



169. TTLab at AlexandriaX-2026: A Fine-Tuned Surface Tagger for Arabic Machine-Translation Error-Span Detection and Classification


170. A Manifold-Aware Topic Modeling Approach via Rank-Based Prototypes


171. An Exploratory Ablation of a Small MLA–SSM Hybrid Language Model


172. Evidence-Driven Differential Diagnosis of Malignant Melanoma


173. QINA: Quantum-Inspired Nonlinear Adapters for Pretrained Vision Models


174. CATCH: Counterfactual Anatomical Tissue Inpainting with Conditional Haar Diffusion


175. UNWIND: Any-Length Facial Video for Stress Detection without Temporal Windowing


176. When Agents Act Unwatched: The Reduced-Supervision Paradox in Agentic AI


177. Generalized Graph Variational Autoencoders: Bounded Divergences Control Posterior Collapse


178. GeoRefer-Bench: A Benchmark from Referring Pixels to Verifiable Geospatial Reasoning


179. CoSWA-YOLOv12: Scale-Invariant Tiny Object Detection and Segmentation of Malaria Parasites


180. PROOF: Profiling Reliability of Object-Level Facts in Large Language Models


181. Who Put the I in AI? Provenance and the Admissibility of Machine Self-Report


182. Generative Evolutionary Design of Voxel-Based Soft Robots with Provable Optimality


183. RoboLDA: A Probabilistic Generative Model for Uncovering Embodied Hierarchical Structures in Voxel-based Soft Robots


184. Direct Message Approximation (DMA): A Consistency-Based Framework for Tractable Approximate Inference on Factor Graphs


185. AgriCountDINO: Parameter-Efficient Exemplar-Guided Counting and Localization in Agriculture


186. Frame-to-Panorama Localization and Context-Aware Sampling for Scene-Specific Ship Detection in a Smart Marina Testbed


187. IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis


188. Detecting Glaucoma Across Multi-ethnic Myopic and Non-Myopic Populations Using an Uncertainty-Aware Vision Transformer: A Multicentre Model Development and Validation Study


189. agentic-ger: terminology recovery in long-form speech using global context


190. Rufus-Air: An Open LLM Post-Training Recipe


191. Segment-Level Risk Discovery in Online Handwriting for Alzheimer’s Disease Detection


192. WST-Graph: Topology-Preserving Wavelet Scattering Front-End for Speech Deepfake Detection


193. From Policy Documents to Structured Survey Responses: Evaluating Large Language Models for Policy Monitoring


194. Domain Recentering and Confidence-Weighted Prior Calibration for Vision-Language Models


195. ArGuard Shared Task: Harmful Content Detection in Arabic Memes and LLM Prompts


196. Where LLM Graders Succeed and Break: Evidence from Two Computer-Science Exams


197. Hyperbolic Multimodal Continual Learning: A Closest-Admissible Solution


198. Neuralized Multi-Wavelet Decomposition for Time Series Classification and Forecasting


199. DocuTeam: Mixed-Initiative Multi-Agent Discussions around Evolving Documents


200. Reasoning Instructions Can Break Answer Decoding in Vision–Language Models


201. TP-CRIV: A Framework for Third-Party Challenge-Response Identity Verification of AI Models


202. Deep learning of longitudinal visual fields predicts glaucoma progression rate and identifies fast progressors


203. No More Free Lunch: Corpus Task Complexity Matters as Corpora Grow


204. TOLA: Text-aware One-Step Latent Adaptation for Diffusion-based Text Image Super-Resolution


205. SARFusion: Scene-Aware Routing Fusion for Robust Camera-LiDAR 3D Object Detection


206. Post-Training Leaves Behavioral Shadows on Unrelated Decisions


207. FB-GDM: Fully-Bayesian Guided Diffusion Models for High-Dimensional Linear Inverse Problems via Unsupervised Variational Inference


208. Spot, Separate, and Enhance: Fully Generative Approach for Audio Mixing


209. HarnessPAI: An Evolving Harness for Physical AI


210. Med-AR: Autoregressive Vision-Language Pretraining for Long-Tailed Chest X-Ray Classification and Uncertainty-Aware Evaluation


211. AI-Moderated Interviews for Market Research and Digital Twins Calibration


212. Not Every Token Is Worth Distilling: Selective Supervision for Direct-OPD


213. Tag-Aware Structured Text Translation: Towards a Systematic Understanding


214. Less is More: Encoder-only Audio-Visual Segmentation


215. WildHSR: Metric Feed-Forward 4D People-Scene Reconstruction from a 3D Foundation Model


216. Where Does Exactly-Once Live? Model, Harness, and Tool-Contract Effects on Duplicate Side Effects in LLM Agents


217. DAWN: Noise-Robust Quadruped Parkour via Depth-Denoising World Models


218. Can Classical Semantic-Extractive Summarization Be Evaluated in Hindi? A Replication Study


219. EIB-Net: Entropy-Guided Information Bottleneck for Generalizable AI-Generated Image Detection


220. Empath: Tracing Multi-Level Emotion Dynamics in Crisis Counseling Dialogues


221. The Tokens Remember: When Tokenization Bypasses Knowledge Editing and Unlearning


222. Multi-Agent Orchestration of 3GPP Channel Estimators


223. Design and Evaluation of LLM Chaining-Based Task Planning for General Purpose Service Robots


224. Beneath the Scores: Rethinking Hallucination Evaluation for Video Understanding Models


225. CrossSafe: Towards Cross-Embodiment Latent Safety Filters


226. Cross-Country Code-Mixing for Generative Recommendation


227. Calibrated Decision Models for Autonomous Penetration-Testing Harnesses: JEV and Laya as System One Decision Layers for LLM-Driven Pentest Agents


228. On the Effectiveness of Kernel-Level Evidence for Agent Security


229. Robots That Take Initiative: A Framework for Building and Evaluating Proactive Robots


230. Broadening Uncertainty Estimation for Audio Question Answering Across Methods, Formats, and Inputs


231. Persuaded, Not Informed: Incentive-Misaligned Witnesses Defeat In-Context Grounding


232. Blockchain-Enabled Artificial Intelligence and AI Agents for Secure Data Sharing and Cybersecurity Applications


233. M$^2$PFN: End-to-End Disentangled Alignment for Generalizable Multimodal In-Context Learning in Alzheimer’s Disease


234. KeyGen: Unsupervised Keypoint based Object-Centric Representations for Category-Level Policy Generalization


235. A Harness for Synthesizing Diverse Naturalistic Full-Duplex Conversations


236. DrGait: Biomechanically Grounded Visual Reasoning for Interpretable Clinical Gait Analysis


237. KathDB-FAO: Synthesized Query Plans in a Multimodal DBMS


238. Technical Manual for Toolkit for Confidence-Corpus Consistency via Fine-Tuning on a Fabricated Corpus


239. Policy Complexity, Reaction Time, and Bounded Rationality in Reinforcement Learning


240. Temporal Learning for End-Effector Position Estimation under Aerodynamic Disturbances in Aerial Continuum Manipulation


241. An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection


242. Beyond Static Graph World Models: Learning Stochastic Latent Dynamics over Evolving Topologies


243. The Fellowship of the Query: Learning Retrieval Actions


244. Decision Hijacking: Prompt Injection Attacks on Jev’s Typed Probabilistic Decisions


245. UO-FIE: Combining Exact-Label Supervision with Graded Utility for Factivity Inference


246. Learning to Discover Interesting Mathematics


247. NumericJev: Jev-like LLM Numerical Decoding with Multiway Decision Trees


248. Persistent Billable State: Denial-of-Wallet Attacks and Defenses in Tool-Calling LLM Agents


249. SGA: Uncertainty Quantification for Multi-Step Forecasting in Time Series Foundation Models


250. Auditability Is Not One Property: Rule Overlap, Behavioural Agreement, and Composition in Reinforcement Learning


251. Where Cyber Agents Struggle: Bottleneck Analysis of Multi-Stage LLM Agents


252. When Explanations Cannot Be Read: Measuring and Correcting SHAP and LIME Rendering for Right-to-Left Languages


253. Speculative Evaluation of Stochastic LLMs


254. Who Is Behind the Harness? Fingerprinting LLMs through Agentic Behavior


255. SMILESGNN: Interpretable Clinical Toxicity Prediction via SMILES-Graph Cross-Attention Fusion


256. CrossScale-GLIO: Topology-Preserving Vision-Language Alignment of MRI and Whole-Slide Histopathology for Diffuse Glioma


257. Certified Task-Conditioned Active Observability


258. AI in Science: Early Insights


259. Hybrid Variational Quantum-Classical Framework with Adaptive Weighting and Efficiency Assessment


260. CaliPPer: quantifying, predicting and improving AI model performance for binding prediction