전체 AI 논문 - 2026-09-29

1. FinAutoRubric: Expert-Guided Automatic Rubric Generation for Evaluating Financial Research Agents


2. Shockingly Simple Self-retrospection Improves Agentic Models Without RL


3. Failure-Transparent Agents: Benchmarking Post-Failure Reporting in Tool-Using Language Models


4. Reinforcing Agentic Creativity in Scientific Ideation with Night Science


5. Reasoning with Continuous Latent Diffusion


6. Report: Progressive Disclosure of Agent Skills


7. Verifier Errors in RLVR: Reward Hacking, Limits of Feedback, and Selective Control


8. PhoneCLI: From App Interfaces to Callable Commands for Mobile Agents


9. Not All Thinking is Created Equal: Latent Reasoning Discovers a Recurrent Search Algorithm for Depth Generalization


10. Verifiable Visual Rewards Transfer from Synthetic Scenes to Natural Prompts


11. RIDE: Reference-Anchored Inference-Time Diffusion Editing for Scaffold Hopping


12. From cacophony to hierarchy: a principled framework for assessing AI consciousness


13. TCSAlgBench: Benchmarking Automated Proving for Research-Level Theoretical Computer Science


14. Signatures of semantic search in the activations of large language models


15. Source-preserving alignment for robust evidence localization in scientific PDFS


16. IMC-CLINIC: Coupled Loss-Informed Newton Iterations for Clipping in Analog In-Memory Computing


17. Share-Borne AI Virus: Memory-Hopping Attacks Across LLM Agents


18. Representation Alignment as a Bottleneck in LLM-Based Retrosynthesis Planning


19. RSI-Master: Structuring Experiments to Guide Autonomous Model Improvement


20. From Search to Research: Exploring Search Scaling in Autonomous Quantitative Factor Mining


21. BaRe-Mem: Bayesian Reliability Memory for Robust and Adaptive Agent Consultation


22. RareDx: Controlled Knowledge Integration and Graph-Grounded Policy Optimization for Rare-Disease Diagnosis


23. Continuous Context Management


24. ARISE: Adapting to Evolving Capability Gaps in Agentic Reinforcement Learning


25. MechBench: Can AI Scientific Agents Discover Mechanisms Beyond Phenomenal Laws?


26. SRHarness: A Harness for Agentic Symbolic Regression


27. Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning


28. A.D.A.M.O. (Agent for language-Driven Actions with Multimodal Observations): A Visual-Symbolic Framework for Virtual Humans


29. AutoBCI: Forecast-Guided Agentic Neural Architecture Discovery for EEG-Based Brain–Computer Interfaces


30. Just Initialize: A Training-Free Initialization Component for Large-Scale Routing Optimization


31. Building Transformation Layers for Riemannian Neural Networks


32. Self-Adapting Group of Experts for Multi-Agent Reasoning


33. Structural Alignment for Reliable Industrial AI: Bridging Physical Reality, Data, Models, and Human Intent


34. A decision-support system applied to Law: Reasoning and explainability of the decision


35. Don’t Inoculate Everything: Stratified Inoculation Prompting Narrows Backdoor Triggers and Preserves Desired Traits


36. Jailbreaks for Black-Box Uncertainty Quantification in Large Reasoning Models


37. Jev thinks “I don’t know’’, but doesn’t say it: Introducing Sys1Cal-v1 Dataset for Probability Calibration


38. TMCS: Tool-Grounded Multi-Agent Reasoning for Compositional Chemical Problem Solving


39. Hyper Algorithm Design Agent: Evolving Learnable Optimizer from Zero


40. Reliability Engineering for AI Systems: Challenges, Methods, and Directions


41. Narrowing the Horizon: Quantifying Topic Saliency Shifts in Generative Monoculture


42. Training-Free Clinical Reasoning through Medical Ontologies and Cognitive Mapping: A Symbolic-Probabilistic Knowledge Graph Framework


43. AbGaze: Attentive Geometric Representation Learning for End-to-End Antibody Design


44. EvoIn: Bridging Evolution and Internalization for Agent Fine-Tuning


45. The Argument and the Letterhead: Source-Position Coherence in AI Evaluation


46. Textual User Taste: Natural-Language User Context for Foundation-Model Recommender System at Scale


47. Imprint Reader: From Weight-Update Readout to Behavioral Intervention


48. Towards Reliable AI Data Scientists: Data Agents with Workflow Harnesses


49. EP-Mem: Elastic Privacy Memory for Social Relationship-Aware LLM Agents


50. ASCT: Attentive Search over Counterfactual Trees for Credit Assignment in Agentic Reinforcement Learning


51. Beneath the Tokens: A Performance Engineering Study of Multi-Token Prediction in GPU-Accelerated LLM Inference


52. 5W1H+Which: Context-Valid Semantic Indexing with Progressive Ontology Binding


53. FONDANT: Strong and Best-Effort Planning via Antichains


54. PEARL: Adaptive Prefill-Decode Execution with Elasticity for Agentic Reinforcement Learning


55. From Migration to Calibration: Preserving Agent Capabilities across Models, Jurisdictions, and Scale


56. Tool Mediation Alters Refusal Mechanisms in Large Language Models


57. DuplexCadence: Exact State and Execution from a Speech Model’s Declared Timelines


58. Sol-H3: Recursive Self-Improvement for MiniMax-H3 Inference Acceleration on Sol-Engine across Cloud and Edge


59. Using Context Is Not Enough: Test-Time Training for Personalized Reward Modeling


60. DoAtlas-2: A Foundation for Self-Evolving Causal Biomedical Discovery


61. Can Generative AI Automate Data Extraction for Meta-Analysis? A Case Study on Intercropping Research


62. When Valid Tool Calls Change Meaning: Formation-Consistent Dispatch for LLM Agents


63. What Drives Citations in Production Large Language Models? An Observational Multi-Method Study of Two Million AI Citations Across Ten Thousand Web Pages


64. Persona Following Is Not Selective Control: The Neutrality Gap in LLM User Simulation


65. JRDB-AVR: An Active Visual Reasoning Benchmark for Embodied Agents in Real-World Environments


66. WebPageBench: Event-Level Verification and Controlled UI-Variant Generation for Web Agents


67. AutoDataBench: Can Agents Write the Data That Feeds the Self-Improvement Loop?


68. Environmental requirements for the use of social information by artificial life agents using evolved plastic artificial neural networks


69. TermJudge: A Document-Level Metric Judging, Not Counting, Terminology in Machine Translation Evaluation


70. Automated feature engineering, AutoML, and decision-focused learning for improved energy consumption forecasting


71. From One-Shot Generation to Incremental Music Composition: Adapting a General-Purpose Instruction LLM for Persistent Symbolic Editing


72. Before Acting, Change the State: Prospective State Intervention for Web Agents under Deceptive Interfaces


73. APEX-Voice: Can Voice Agents Complete Professional Workflows Through Full-Duplex Interaction


74. Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias


75. Safe Greenhouse Climate Control Using Lagrangian-Constrained PPO with Kolmogorov-Arnold Networks


76. ProofLoom: Proof-Obligation-Driven Theory Construction for Autoformalizing Research-Level Stochastic Optimization


77. AX is the New AEO


78. VD-DeepStack: Bridging Visual Comparison and Language Reasoning for Few-Shot Anomaly Detection


79. Proactive Dialogue Policy Optimization via Cognitive-State Transition


80. PDEU-Bench: Benchmarking the Personalized Planning Lifecycle of Tool-Calling LLM Agents


81. RISE: Red-teaming via Iterative Strategy Evolution for Modern Text-to-Image Models


82. DGF-Bench: A Benchmark for Simulating and Auditing Deception Against Multi-Agent Governance Boards


83. Dual-Stream Simultaneous Translation via 2D Grid Attention


84. DeShortcut-Align: Decoupling Spurious Shortcuts for Robust Safety Alignment in Large Reasoning Models


85. Fewer Assumptions by Design: A Reusable Skill for LLM-Assisted Verus Verification


86. One Readout, Many Repairs: Diffusion-Guided Hierarchical Search for Tool-Agent Repair


87. On the Limits of Metacognitive Monitoring in LLMs


88. AUV-Bench: Aesthetic Understanding and Generation Evaluation for User Interfaces


89. From Soft Targets to Reward Signals: How Assignment and Reward Objectives Interact


90. Can We Trust the Teacher? Decoupled Credit Direction-Magnitude for Self-Distillation


91. Nociception as a Control Primitive: Afferent Channels and Nociceptive Memory for Agents Deployed in One Body


92. BV Loss: Block Verification-Aware Loss for Block Diffusion Speculative Decoding


93. Simulating Respondents, Not Single Questions: Coherent Survey Generation with Large Language Models


94. UniOPSD: Unifying Outcome and Hindsight Feedback for Agentic Reinforcement Learning


95. SIPO: Selective-Inference Policy Optimization for Tree-Structured Agentic RL


96. STRIDE: Automated Evaluation of Text-to-Trajectory Alignment across Diverse Contexts


97. BEHAVE: Functional Behavior Modeling Enables Self-Improving Agents for Hardware Design and Verification



99. Page-Aware Retrieval-Augmented Generation for EvalLLM 2026: A Five-Variant Study on French PDFs


100. Before the Token Commits: Trajectory-Level Benchmarking of Visual Hallucinations in Diffusion VLMs


101. When Do Model Internals Help? Exploring the Role of Representation Engineering in LLM Safety


102. Privacy-Preserving Full-Body Meshing from mmWave Radar via Mesh Foundation Model Supervision


103. SeLMRoute: Probabilistic Semantic Evidence for Large Language Model Routing


104. From Human Narrative to Harmonic Structure: A Human-Centered Investigation of Algorithmic Music Generation through the Chord Wheel Diagram


105. PDE-JEPA: Predictive Representation Learning of Latent Dynamics Modeling for Parametric PDEs


106. RSI-Router: Evolving Subtask-Level LLM Routing and Skills for Cost-Efficient Agents


107. FromPitch2Board: Benchmarking LLM Agents in Long-Horizon Football Management


108. ResonAct: Streaming Metrics for Runtime Diagnosis and Self-Healing in Multi-Agent Systems


109. VCN-Bench: A Video-Contextualized Navigation Benchmark for Spatial Reasoning over Prior Visual Experience


110. Jailbreak Context Lingers: Divergent Safety Routing and Its Cross-Task Predictability in Tool Agents


111. A General Harness for Protein Foundation Model Fitness Prediction


112. OmniTide: Co-Designing Algorithms and Systems for Efficient On-Device Omni-LLM Streaming


113. Beyond Skill Evolution: Self-Evolving Context Management Policies for Long-Horizon Agent Harnesses


114. MechReasoner: A Simulator and Benchmark for Mechanistic Reasoning in Qualitative Physics


115. A Persistent State for Auditable Mixture-of-Experts Routing


116. LLMs for Executable Multi-Agent System Specification Generation



118. TULIP: Targeted LLM Unlearning at Layers Identified Per-Input


119. SpeechCritic: Learning a Diagnostic Speech Judge from Limited Human Preferences


120. Calibrated Uncertainty for Informative Path Planning in Aquatic Environmental Monitoring


121. Diffusion Subgoal Planning for Long-Horizon Offline Goal-Conditioned Reinforcement Learning


122. Nudgeability: Reasoning Models Follow Confidence Signals Without Tracking Their Own Competence


123. PersonaManifold: Revealing and Exploiting Curved Geometry in LLM Persona Representations


124. FlowState: Execution State as Memory for Long-Horizon LLM Agents


125. SkillRubric: Co-Evolving Actor Guidance and Evaluator Rubrics for Multimodal Agents


126. SGG-ReflAct: Sub-Goal Guided ReflAct with Structured Planning for Reliable Long-Horizon Reasoning


127. Remember Before You’re Asked: MemDream for Self-Probing Memory Evolution


128. APOLO: Automatic Prompt Optimization for Ontology Learning


129. The Marathon of Scientific Reasoning: Robustness of Scientific Agents to Perturbations in Multi-Turn Interactions


130. PairPref: When Should Memory Guide the Answer? A Benchmark for Contextual Preference Use


131. EOPSA: Efficient On-Policy Self-Distilled Safety Alignment


132. Can AI Make Money in Crypto? Measuring the Gap from Backtests to Real Markets


133. Does Model Uncertainty Track Human Ambiguity? Evidence from Multi-Annotator Vision Benchmarks


134. PowerBench: A Benchmark for Agentic Retrieval and Reasoning in Power Systems


135. When Does Structured Knowledge Help Neural Theorem Proving?


136. Escaping Local Views: Discovering Latent Concepts for Interpretable Multi-Agent Reinforcement Learning


137. CORTEX: Learning to Share and Specialize in Dense Language Models


138. Social Circuits behind Multi-agent Echo Chambers


139. Beyond End-to-End Black Box Mapping: An Intentional Agent Framework for Cognitive-driven Facial Reaction Generation


140. OSPD: On-Policy Self-Distillation for Persona-Consistent Dialogue


141. Mathematics for and by human cognition: A resource-rational search for bottlenecks in problem-solving


142. SkillFocus: Evolving Agent Skills via Capability Decomposition


143. Org-Agent: Beyond Personal Assistants Towards Organizational Agents


144. PersMem: Internalizing Personality into Dual-Pathway Memory for LLM Agents


145. CoeF-SFL: Preserving Collaborative Server-Client Learning with Enhanced Communication Efficiency


146. Improving Large Language Models for Code through Runtime Program-State Reasoning


147. SemRD-V2X: Closure-Guided Communication with Bounded Inference for Cooperative Perception


148. Fuzzy Distribution Modeling for Synthetic Tabular Data Generation with Causality Preservation


149. SAGE: Structured Strategic Reasoning for Efficient LLM Game Playing


150. Knowing When Thinking Is Not Enough: Teaching Small Reasoning Models to Reason Beyond Their Parametric Knowledge


151. Test-Time Scaling via Budgeted Multi-Attribute Verification


152. Dynamical Parameters: An Interpretability Framework for Time-Series Foundation Models


153. ControlScope: Workflow Revision and Reliability in LLM Agents


154. MoSPR: Histology-to-Gene Expression Prediction with Morpho-Spatial Macrostates and Low-Rank Molecular Programs


155. BIABench: Evaluating AI agents on real-world bioimage analysis tasks


156. Query Expansion and Key Specialization in Transformer Attention Geometry


157. Maintaining Benchmarks Against Increasingly Capable Agents: Detection and Remediation of Unearned Passes


158. QuantaSpike: Short-Window Spike-Driven Quantization for Large Language Models


159. Evolving Support Priorities in Empathetic Reinforcement Learning


160. Stashbird: Efficient Speaker-Indexed Memory for Conversational Agents


161. AdaGuard: An Adaptive Guard Model with User-defined Policies


162. When Does Selection Replace Extraction? A Pre-Registered Test of Agent Memory with a Typed Decision Model


163. Same Winners, Different Success Rates: Evaluating How LLM Agents Recover from Failures


164. GlyphBench: A Playground for Language-Model Reinforcement Learning


165. Behavior-Grounded Semantic Enrichment for Financial Fraud Modeling and Reasoning


166. PainterBench: A Figural Divergent-Thinking Benchmark for Tool-Using Language Models


167. CASS: Contribution-Aware Structured Sparsity for Model Merging


168. Efficient Reasoning via Constrained Optimization in Latent Space


169. Decision Readouts for Text-Mediated Video Anomaly Detection: An Exploratory Evaluation of Jev and Qwen


170. RAGWarrant: Evidence-Preserving Governance for RAG Policy Promotion Under Quality, Cost, Latency, and Risk Constraints


171. ReplayLens: Auditing Agents’ Use of Outcomes


172. RoutePrism: Tracing Construction Order Effects in Agent Memory


173. TableSeek: Structure-Preserving Agentic Evidence Seeking over Heterogeneous Table Corpora


174. Self-Evolving Agents via Likelihood-Guided Tool-Space Optimization


175. Same Tasks, Different Apps: Why Mobile GUI Agents Fail to Generalize?


176. You Can’t Have It Both Ways: Concept Entanglement Limits Diffusion Model Unlearning


177. Waggle: Learning One Anonymous Local Law for Self-Organizing LLM Swarms


178. Evo2Team: When Do Evolved Skills Transfer? From Selection to Deployment


179. StateGuard: Analytical-State Management with Validity-Aware Intervention for Long-Horizon Data Agents


180. From Attack Success to Attack Severity: Counterfactual Memory Attacks on LLM Agents


181. GUITAR: Structured Failure Diagnosis of GUI Agents via State Transitions


182. SpecRegMatch: Robust Semi-Supervised Regression for Vehicle Interior Noise Prediction


183. A Differentiable Optimization Framework for Registering Sequential Bounding Boxes with Point Cloud Stream


184. K-OPSD: Verifiable On-Policy Self-Distillation for Post-Training Vision-Language Models on AEC Drawings


185. GenoMorph: Pathway-Grounded Genomic Disease Reasoning via Adaptive Latent Computation


186. PhysFieldBench: Can Multimodal Models Understand Physical Fields?


187. Towards Certificate-Driven Software Porting: A Self-Improving Agentic Harness for Scientific Program Optimization


188. Thinking Outside the Box: Retention and Transmission of Information in Sliding-Window KV Inference


189. Large Language Models for Structured Clinical Data Analysis: Dual-Agent Grounding and Validation


190. Jev in Medicine: A Benchmark Evaluation. Preliminary Results


191. A Computer Vision Approach to Visual Fraud Detection in Phishing Websites Using YOLOv8


192. EHRAdapt: Adapting Pretrained Language Models to Electronic Health Records with Semantic Priors for Rare Clinical Events


193. Designing Reliable LLM-as-a-Judge Measurement Systems for Multi-Turn Business Agents


194. HyperMCTS: Hypergraph-Augmented MCTS for Long-Horizon LLM Agents



196. Curating Merchant-Matching Training Data with Two Confidence-Gated Local LLM Judges


197. When Successful Strategies Fail: Adaptation to Environmental Novelty in Terminal Agents


198. R$^2$ Flow: Recursive Self-Improvement via Recursive Skill Evolution


199. How code helps different tasks? A decompositional lens on LLM post-training


200. Laya as a Typed Probabilistic Assessor: An Independent Reproduction and a Preregistered Study of Calibration and Selective Escalation


201. Vestrum: Improving Agent Harnesses by Adapting Their Verification, Structure and Memory


202. Dual-Vocabulary Language Model for Cross-Tokenizer Distillation


203. Is your uncertainty map wrong, or is its target? Exact diagnostics for the Tweedie diagonal, and a gradient-free alternative


204. Evidence-Inference Reconstruction: When The Evidence Is Recalled But The Reasoning Goes Wrong


205. Learning Strategies to Break Judges


206. Skill2Env: Capability-Oriented Environment Synthesis from Skills for General Agents


207. HTN Planning as a Coordination Layer for Multi-Server MCP Tool Orchestration


208. Robust Biomolecular Complex Design Across Protein Conformational Landscapes


209. Self-Designed Evaluators and Warm Memory for Long-Horizon Agents


210. BIRD: Distilling Decision Boundaries into Rationales for MLLM Adaptation


211. Does Adversarial Training Improve Generalization in Multi-View VLAs? Revealing and Mitigating View Collapse


212. SpecRead: A Benchmark for Measuring Whether Language Models Understand Hardware Specifications


213. One Latent, Many Tokens: Jointly Learning Compressed Embeddings for Efficient Language Diffusion


214. TopoMamba: A Load-Support Relation-Guided Multi-Directional State-Space Model for Topology Optimization


215. SWE-Game: Can Coding Agents Build the Games We Want?


216. Auditing Agent Actions through Query-Conditioned Attribution


217. RSD-Poker: Structure-Adaptive and Shift-Robust Risk-Utility Certification for Residual Policies in Imperfect-Information Games


218. CompoWorld: Compositional Environment Scaling for General Agents


219. Audit-First VAPO: Risk-Certified Selective Updates under Imperfect Verification


220. AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents


221. Probe to Act: Elevating Browser-Use Agent via Active Visual Probing


222. Scalable and Data-Driven Decision Support in the Maintenance, Repair, and Overhaul Process


223. Trajectory Unlearning on LLM-based Agents


224. ParaAgent: Reinforcing Parallel Acting in Open-World Tool Environments


225. EAT: Expert Account Tracker for Efficient MoE Inference


226. Supervision Recovery for Time Series Anomaly Detection via Context-Anchored Pairing


227. JustQuant: You Don’t Need Smoothing, SVD, or Rotation for 4-Bit Activation Quantization


228. OpenFC: Learning Verification Policies towards Open-Search Fact Checking


229. Dr. Free: You Don’t Need Difficulty Rewards for Self-Evolving Search Agents


230. OSCC: Certified Observation-Safe Coupling Optimization for Gradient-Noise Control in Imperfect-Information Learning


231. Reasoning on the Simplex: Geometric Fixed-Point Models


232. EverMine: Dissecting the Self-Evolution of Research Capabilities in Long-Horizon Alpha Research


233. PPG-LM: A Photoplethysmography-Language Model with Multi-Level Clinical Alignment


234. What Happens During Autonomous Deep Research After the User Steps Away?


235. When Evidence Changes the Subject: Subject-Typed Claim Licensing for Learned Routing


236. RelaxKV: Recomputation Guided by the Query with Sparse Context Attention for Efficient KV Cache Reuse


237. Federated Multi-Modal Human Activity Recognition using Multi-Agent Reinforcement Learning


238. Just Let Linear States Forget the Distant Past: Prefix Caching via Suffix Replay for Hybrid LLMs


239. LiveOption: Evaluating LLM Agents in Structured Option Trading with Nonlinear Payoffs


240. When Does the Concept of “Dog” Emerge in an Audio LLM?


241. What Shared Prefixes Hide: Trajectory Dropout for On-Policy Distillation


242. MAC-Net: A Multi-Task Deep Learning Framework for Modeling Cognitive Function From Task-Based fMRI


243. Raven: The Harness of Harnesses for Composable Agentic Intelligence


244. APEX: An Extensible Model for Agent-Assisted Production Scheduling


245. Temporal Graph Learning of Wearable Actigraphy and Sleep Traces for Modelling Adolescent Crystallized Intelligence


246. MetaBench-Harness: Unlocking End-to-End Optimization of Benchmark Harnesses


247. COEVO: Co-Evolving Context and Parameters for Recursive Self-Improvement


248. CoViST: Visual Token Compression via Composable States


249. Cross-modal Translation via Conditional Latent Denoising for Video Deepfake Detection


250. DrafTS: Time-Aware Decomposition with Residual Correction for Time Series Modeling


251. DISCERN: Can AI Agents Work Like Scientists and Guide Discovery?


252. Long-Horizon Analog Design Bench: Benchmarking Agents on Hours-Long Analog and Mixed-Signal Circuit Design Tasks


253. Unmask the State: When Does State Adaptation Matter for Masked Diffusion Language Models


254. QuPID: Quantum Parameter-Efficient Input-Dependent Retrieval Adaptation for Medical RAG


255. Naturalness-guided Manifold Flow Matching for Sign Language Production


256. ANTMAN: Adaptive Need Tracking for Multi-Agent Navigation in Large Information Spaces


257. Agentic Multi-Turn Reasoning: A Fairness Approach


258. PhysAlign: A Benchmark for Evidence-Grounded Role Alignment in Multimodal Physics Reasoning


259. The Error You See Is Not the Error You Made: Progression-aware Reasoning Origin for Reasoning Error Localization


260. TraceDance: An Automated System for Building Agent Behavior Benchmarks from Real-World Agent Deployment Traces


261. Learning to Sell: Reinforcement Learning for Strategic Large Language Model Agents in Multi-Product Markets


262. Feedback Makes Perfect: A Closed-Loop Framework for NL-to-STL Translation


263. RINI: Seeing the Prior Is Not Enough


264. Multi-Dimensional Comparative Scale Construction for Efficient Personalized Subjective Judgment in High-Traffic Applications


265. ChronoFlow: Hierarchical Flow Matching for Irregular Time Series Generation


266. Next Thoughts Are Distributions: Generative Autoregressive Reasoning in the Latent Space


267. Structured Sparse Memory for Recurrent Reasoning


268. LSTMem: Hierarchical Long Short-Term Online Memory for Large Language Models


269. CORTEX: A Verified Experience Layer for Generalist Agents


270. ActiveMem: Dynamic Latent Memory Trees for Long-Horizon Agents


271. CodeSkill: Latent Skill Abstraction for Long-Horizon Code Agents


272. WorldAgent: Verification-Guided Agentic Physical World Construction


273. Are Benchmarks Reliable? Toward Structural Diagnosis via Sample-Level Capability Boundaries


274. Unlocking Latent Personalization in LLMs


275. SeOPD: Self-Evolving LLMs via Online Policy Distillation from Self-Generated Chain-of-Thought


276. Not Too Hard, Not Too Easy: Learning from Intermediate States for LLM Structured Reasoning


277. LiteEvo: Automated, Cost-Efficient Harness Evolution for Generalization to Unseen Tasks


278. On Device Agentic Operation Caches – Classifier-Centric NL-to-Action Generation


279. Ceiling of a Task: When Can a Transformer Succeed Without Its Chain of Thought?


280. Compositional Safety Failures in Harness Evolution: Identification and Runtime Monitoring


281. Modular Discovery of General Game-Playing Algorithms with Large Language Models


282. The Model Knows Another Way: Strategy Switching for Effective RLVR Exploration


283. Structure-Mapping-Guided Self-Explanation for Learning Mathematical Procedures


284. QureRadEmbed: Structuring Radiological Similarity through Attribute and Reasoning Supervision


285. LLM sequential decision making under uncertainty in biochemical domains


286. Large Language Models Substantially Compress Well-Being Inequality but Largely Preserve Its Socioeconomic Structure


287. BudgetVerify: Budget-Tiered Verification for Financial QA


288. Agent Safety From Within: Detecting Harmful Trajectories from LLM Internal States


289. SRE-Marathon: A Continuous, Change-Driven Benchmark for Autonomous Site Reliability Agents


290. Trust and Task Completion in the World of Consumer AI Agents


291. The Epistemics of Agent Memory: Measuring, and Governing, the Consolidation Decision in Long-Horizon LLM Agents


292. When Pair Count Is Not the Sample Size: What All-Pairs Agent Comparisons Estimate


293. Model-Aware Data Selection from In-and-Out Information Interplay


294. X-Tree: Tokenizing Reusable Experience for Efficient Agent Generalization


295. Certified Long-Horizon Code Agent Evolution via Validation-Gated Skill Optimization


296. Relic: From Multi-Agent Collaboration to Persistent Organizational Capability


297. The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining


298. Diagnosing Sampled LLM Reasoning in Formal Geometry: Coverage, Realization, and Validity Evidence


299. TRACE: Learning to Self-Calibrate Wireless Digital Twins from ISAC Measurements


300. Precision As You Need: Stochastic Computing Is a Dense Adaptive Quantizer


301. Planner-as-Router: Joint Plan-Time Model Routing for Cost-Efficient Multi-Agent Workflows


302. Logical subspace in LLMs


303. Constraints Are Graphs, Not Chains: Exact Decoding for Diffusion Language Models


304. StraTune: Adaptive Selection of Revision Operators for Self-Evolving LLM Skills


305. Can LLMs Predict the Future? A Brier Score Analysis of Prediction Markets


306. Counterfactual Self-Evolving Agents for Evidence-Grounded Reasoning


307. FinancialAuditBench: Benchmark Construction under Differential Privacy Using Real-World Priors


308. Improving LLM Collaboration via Multi-Agent Preference Learning


309. The Decomposition Tax: LLM Pipelines Lose Up to 40 Accuracy Points at Their Own Interfaces


310. Routing Drift Alone Does Not Diagnose Failure in Merged MoE LLMs


311. Rank Collapse Is Recoverable, Growing $|Q|$ Is Not: Out-of-Sample Early Warning for Value Divergence in High-UTD Soft Actor-Critic


312. When Can First-Order Models of Fine-Tuning Bound Forgetting?


313. Right Answer, Wrong Reason: Accuracy, Consistency, and Consensus Are Misleading Indicators of LLM Faithfulness in Clinical Decision Support


314. Overwhelmed by Choice: Studying LLM Decision Making at Scale


315. Beyond Accuracy: Counterfactual Fragility and Demographic Bias in Clinical Evaluation of LLMs


316. Decision-Sufficient State Representations: Measuring and Reducing Write-Time Regret


317. Nutri-ATLAS: Embodied Agent for Tabulated Lookup and Assistance for Smarter nutrition


318. Re-derivability Decides What a Staged Agent Pipeline Recovers After an Upstream Fault


319. PlanGuard: A Guardrail for Multi-Step Plan Safety in Embodied Agents


320. AgentHabit: Characterizing Distinct Behaviors of Agents on Everyday Tasks


321. $T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training


322. CLAIRE: A Schema-Grounded Hybrid Workflow for Healthcare Administrative Form Completion


323. Learning response-aware patient dynamics for respiratory support


324. Agentic Network Traffic Monitoring


325. Forecasting Intraday USD/CAD Exchange Rate with News-Derived Monetary-Policy Signals


326. Mandela-Bench: Multimodal Models Remember Canonical Images Instead of Seeing Them


327. Readout is not Recovery: Dissociating Coordinate Emission from Visual-Corruption Repair in Vision-Language Models


328. Adaptive Consistency Graph for Long-Horizon Agents


329. Action Shaping: Policies Absorb What They Can Express


330. CUA-Sandbox: Efficient Environments for Computer-Use Agent Reinforcement Learning


331. Retrospective Distillation Attribution via Normalized Response Similarity


332. SkillVine: Agent Skill Evolution via Branching Exploration


333. MassAlloc Attention: Let Attention Allocate Its Own Compute


334. CoWindow Attention: Full Causal Coverage Is a Collective Property


335. Despite Instructions: Frontier Agents Improvise Covert Channels at Test Time


336. CAIRN: Dynamic Fact-Intent DAGs for Multi-Agent Exploration


337. Flat-Consensus Diffusion for Robust Data Reshaping under Noisy Evaluator


338. IGSD: Environment-Verified Hindsight Self-Distillation for Search Agents


339. World Agent: Can Language Models Keep a World Running?


340. Dude, Where’s My State? Execution Information Requirements for Stateful Agents


341. PINNMorph: Evolving Online Adaptation Policies for Physics-Informed Neural Networks


342. When Better Gets Worse: Improvement Fidelity for Self-Improving Agents in Adaptive Worlds


343. Expected Reasoning-Step Return Unifies On-Policy Learning from Rewards and Teachers


344. What Would Falsify It? A Variable Specific Evidence Standard for Mechanistic Claims About Self Explanation


345. Refinement Symmetry in Multimodal Transformers


346. Learning from a Thoughtful Teacher: Adaptive On-Policy Self-Distillation for Mathematical Reasoning


347. Contract Memory Compiler: Resolve, Then Traverse


348. World Models with Predictable Long-Horizon Marginals


349. MixBench-TS: A Multivariate Time Series Forecasting Benchmark Where Channel Mixing Pays Off


350. Prediction Limits and Koopman Closure of Geometry-Induced Soft State Abstractions


351. From Scene Graphs to Answers: Selective Neuro-Symbolic Reasoning for Autonomous Driving


352. Business Compromise Detection with Agentic AI and LLM-driven Knowledge Discovery


353. Can Open-Weight Large Language Models (LLMs) Simulate Human Survey Populations? A Cross-Instrument Calibration Study


354. SWE-MILE: Asynchronous Potential-Induced Milestone Credit Assignment for Long-Horizon Software Engineering Agents


355. “You’re Right, Let Me Fix It”: How LLM Agents Damage Correct Work When Falsely Accused


356. CUA-SWE: When Computer-Use Agents Meet Visual Software Engineering


357. MA-FPPO: Multi-Agent Flow-Pretrained Policy Optimization


358. EMIR$^2$: Evolution-Aware Memory with Intent-Guided Multi-Round Retrieval


359. CUE-Mem: Benchmarking Long-Term User Memory via Implicit Cues in Multimodal Conversations


360. ProTTT: Learning to Learn Semantic User Memory with Test-Time Training


361. Artificial intelligences and human scientists exhibit complementary strengths in theory building


362. Are Vision-Language-Action Models Robust to One-Step Observation Perturbations?


363. Porimon: An LLM-Based Pokémon Battle Agent Enhanced by Long/Short-Term Knowledge Augmented Generation


364. Interpretable Physics Informed WiFi Indoor Localization: Learning an Effective Access Point Geometry and Using It to Prune


365. LLMAdBench: A Human Preference Benchmark for Advertising in LLM Responses


366. Fail Loudly: An Auditable Runtime for Agentic Data Analysis


367. AmbiModBench: Benchmarking Gene Perturbation Prediction Beyond Shared Responses


368. Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations


369. MemAgent: Learning to Manage Heterogeneous Memory Providers for LLM Agents


370. STR: Supervised Transcoder Replacement for Reducing Steering Side Effects


371. LocalProp: Neuro-Localized Memory-Efficient Backpropagation


372. From Anomalies to Failures: Constructing Causal Error Graphs for Agentic Trace Diagnosis


373. Learning from Others, Acting for You: Cross-User Memory Sharing for LLM Agents


374. TreeRef-BFN: Equivariance-Free De Novo Molecule Generation based on 2D Topology and Internal 3D Geometry


375. DAAF: From Failure Localization to Editable System Assets in LLM Agents


376. Beyond Prompt or Skill? Attribution-Guided Optimization of Modular LLM Programs


377. RepoMAS: Solving Progressively Specified Tasks with Issue-Driven Multi-Agent Systems


378. When Helpful Text Hurts: Option-Redirecting Bias in Vision-Language Models


379. Towards Scalable Data Diversification for Language Model Pretraining via Leverage Score Sampling


380. Separating Diagnosis from Disease Representation: Dual-View EEG Learning with Neural-Dynamics-Guided Deformation


381. From Outcomes to Strategies: Learning Strategy Utility for Mathematical Reasoning


382. VPEvolve: A Self-Evolving Virtual Process Engineer for Computational Lithography


383. PULSE: Identifying Demonstration-Utility Features with Sparse Autoencoders


384. ForkLeft: Entropy-First Rollouts for Prefix-Aligned Autoregressive-to-Diffusion Distillation


385. Controllable GNN Explanations via Multi-Metric Preference Selection


386. From Latents to Wires: Surgical Post-Editing on Large Language Models


387. Multi-Agent System Search via Active Substructure-aware Policy Optimization


388. PrismQuant: Optimal Null-Space Rotations for Grouped Quantizers


389. Authorization Closure Graph: Minimal Repair for LLM Agents with Evolving User Instructions


390. PluginRSI: Recursive Improvement of Agent Harnesses with Reusable Plugins


391. MergeHEIR: Mitigating Multimodal Hallucinations as the Tax of Model Merging


392. Carnator: Fast Text-to-Video Generation with Generation-Native Compatibility-Guided Cross-Request Reuse


393. Opening LLM Judges: Recovering Preference Signals Beyond the Final Verdict


394. Function Over Form: Distributional Orthogonalization in Mixture-of-Experts with Replica Expert Mechanism


395. Memory as a cache: Exact context reuse and deletion by construction


396. Beyond Scripted Search: Sample-Efficient Reward Discovery via Agentic Black-box Optimization


397. SCLATE: a Substrate for Continual-Learning Agent Training and Evaluation


398. Reward Hacking and Agent Containment Failure: A Monte Carlo Study Based on the 2026 Hugging Face Incident


399. AuthorityLens: Rethinking LLM-Based Agent Systems Through the Lens of Authority


400. From Trajectories to Grounded Preferences: Process Preference Synthesis via Interaction Element Graphs for Web PRMs


401. ALLOT: Budgeted Hybrid-Memory Routing for Knowledge Updates in LLMs


402. Enabling Timely Guidance before Skill Retrieval: Retaining Helpful Warm Tips in Agent Context


403. HyperReCo: Retrieving and Connecting Evidence with Hypergraph Neural Networks for LLM Multi-hop Reasoning


404. RLHarness: Co-evolving Procedural Skills with Reinforcement Learning for Long-horizon Multimodal Reasoning


405. Delayed Supervision for Test-Time Language Models


406. PhiFold: Towards Dynamic Protein Design with Physics-Structured Covariance Modeling


407. Train4Merge: A Controlled Single-Teacher Study of RL vs. SFT Teachers for OPD-Based Model Merging


408. Agentsensus: Consensus-Compressed Shared Memory for Multi-Agent Story Worlds


409. GLIDE: Generalized Layer-wise Intrinsic Distributional Evaluation for Heterogeneous LLM Agents


410. When Does a Skill Add Value? Task-Conditional Gain Prediction for Selective Skill Use


411. Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs


412. LAM: Efficient Lossy Agent Memory Framework With A Retrieval-Score Error Bound


413. Clarify the User or Verify the World? Uncertainty Routing for Proactive Agents


414. Why Directly Learning Periodic Trajectories Can Fail


415. Certifying Interventional Agreement Among Observationally Equivalent Causal Models


416. RAO-Nav: Probing Omni-Language Models for Zero-shot Semantic Audio-Visual Navigation


417. A bilingual AI audiologist built through rubric-guided playbook induction outperforms human audiologists in a blinded evaluation of simulated cases


418. Fracast-0: Fractal Weight Sharing for a Time Series Foundation Model with Only 85K Parameters


419. Witness: Discovery, Deciphering, and Epiphany in Interactive Puzzle Environments


420. Instruct, Not Answer: Using Instruction Privileges in On-Policy Context Distillation


421. CoMemBench: Benchmarking Collaborative Memory Boundaries across Multi-Agent Workflow Topologies


422. AI Harness: Certification under Proposal-Conditioned Information for Foundation-Model Agents


423. Noisy Test-Time Reinforcement Learning for Code LLMs


424. PastForward: Faster On-Device GUI Agents via Computational Experience Reuse


425. READ-Bench: Benchmarking Historical Instance Retrieval for Time-Series Diagnosis


426. Escaping Alignment: A Physical Trap Model of Best-of-N Jailbreaking


427. Residual Streams Read, Recurrent States Remember: The Global Workspace in Mamba Models


428. GameBoyWorlds: A Testbed for Self-Improvement in Embodied Video Games


429. Memory as Middleware for Self-Improving AI Agents


430. Toward Interactive Understanding of Code APIs


431. Contract monitoring: governing AI via separation of powers


432. EngramRAG: Dynamic Usage-Weighted Topology and Synaptic Consolidation for Multi-Hop Agentic Memory


433. Receiver-Conditioned Latent Communication gives 94% CacheBack


434. Reasoning Concentrates Errors, and Self-Consistency Never Notices


435. A Benchmark for LLM’s Understanding of Middle School and High School Science Topics


436. Decentralized Master-Mind: Joint Action Refinement through Iterative Intent Denoising in Multi-Agent Pathfinding


437. What Does the Rank Buy? A Spectral and Distributional Analysis of Low-Rank Adaptation


438. SenseAgent: An LLM Agent for Adaptive Cross-Domain IMU Sensing


439. CSI-Agent: LLM-Assisted Few-Shot Adaptation for Cross-Domain Wi-Fi CSI Sensing


440. Goal-Persistent Coding Agents as Scientific Performance Engineers: A Fixed-Radius Nearest-Neighbor Case Study


441. Symbolic Guidance for LLM Agents in Distributed Multiagent Coordination


442. BioDyad: Synchronize Biomedical Discovery and Machine Learning Engineering


443. Improving Medical Calculation of LLMs with Embedded Coding


444. EmailBench: A Benchmark for Evaluating LLM Agents on Enterprise Email and Productivity Tasks


445. Choir: An Open Protocol for Distributed Multi-Agent Autoformalization


446. Context-dependent agent evaluation with orthogonal equilibrium learning


447. COUNTERMEM: World-Model Verified Counter-Factual Memory for Language Agents


448. IndustryLLM: Failure-Driven LLM Training for Industrial Procurement


449. Metro-WM: Long-Horizon Latent Planning with Realisable Sub-Goals


450. LLM Judge Validation Under Sparse Overlap: From Inference to Design


451. DriveHierarchy: A Benchmark for Diagnosing VLM Driving Capabilities from Open-Loop Understanding to Closed-Loop Execution


452. Working with AI: A Design Framework for Human-AI Collaboration


453. ConflictVLA-Bench: Benchmarking Behavioral Responses of Vision-Language-Action Models to Premise Conflicts


454. CP-Agent: A Harness-Engineered Agent for Crystal Plasticity Simulation Workflows


455. Witeness Overlap: Directional Provenance Inside Open-Weight Model Families


456. SMARtCARE: Privacy-Preserving Agentic AI Systems for Bounded-Autonomy Clinical Decision Support


457. FurE: Efficient Instance-Specific 3D Fur Reconstruction without Animal-Fur Datasets


458. Telescopic Language Models


459. Learning Native Reflection in Unified Models with Interleaved Reinforcement Learning


460. TokenCast: Forecasting Token Consumption During LLM Agent Execution


461. How to Loop MoE: Flatten the Experts, Untie the Attention


462. KV-streams for Efficient Compaction in Agentic Reinforcement Learning


463. Copy the Same, Distill the Difference: Initializing Linear Vision Transformers


464. X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets


465. A Unified Uncertainty Representation for Graph Neural Networks via Doubly-Spectral Stochastic Expansion


466. Distillation Defenses Easily Break After Reinforcement Learning


467. Rethinking Circuit Evaluation: Do Circuits Explain Model Errors?


468. MS-GLA: Multi-Scale Gated Linear Attention for Addressing Representational Bottlenecks via Multi-Temporal Resolution



470. GPUPhysBench: Benchmarking Coding Agents for Correct and Efficient GPU Physics Simulation


471. DR-net-Mamba: Selective State-Space Modeling for Long-Range ECG Time-Series Denoising


472. Behavioral Foundation Models for Quality Diversity


473. Twist, Don’t Tilt: Trajectory-Exact Constrained Decoding for Masked Diffusion Models


474. SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents


475. QC-Stark: A Multi-Task Benchmark Revealing Capability Dissociations in LLMs Evaluated on Quantum Computing Tasks


476. FactorEngram: Factorized N-gram Memory with Basis-Level Gating for Language Models


477. F4R: Failure-Driven Recognition, Reconstruction, Refinement, and Redeployment for Continual Robot Self-Improvement


478. Almieyar: A Culturally Grounded Benchmark for Multi-Dialect Arabic Speech Recognition


479. The Compiler May Read It, the Agent May Not: Keeping Part of a Research Code Away from a Coding Agent


480. Graph World Models for Constrained Epidemic Policy Planning


481. Less Sycophancy, Stronger Refusal? Lessons for AI Safety from Mechanistic Interpretability


482. AutoRef: Harness Optimization for Agentic Multi-Reference Image Generation


483. Let the Neurons Die: Exploiting ReLU-Induced Model Degradation


484. Beyond Token Scale: Chunk-Level Sparse Autoencoders for Reliable Semantic Feature Discovery


485. Improving Generative Model Self-Training with Geometrically Modified Outputs


486. SolveEdit: Benchmarking Visual Problem Solving in Generative Models


487. From Scores to Samples: Elastic Forcing for Autoregressive Video Generation


488. Analog Computing revisited: A fully analog and minimalistic Damage Detector for Ultrasonic Testing enabling Material-Integrated Structural Health Monitoring


489. Spontaneous Context Restoration: How Language Models Recover from Corrupted Inputs


490. Rethinking Causal Action Tokenization with Conditional Annealing in Flow Matching


491. CLIMB: A Clinical Multimorbidity Benchmark for Diagnosing Co-occurring Conditions through Multiturn Conversations


492. Riccati State Space Models: Non-iterative Parallelization for Nonlinear Sequence Modeling


493. ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning


494. Frontier Learning: Training LLM Reasoners at the Edge of Capability


495. Semantic Prefix Oracles for LLM Decoding: Contracts and Differential Validation


496. GLAD: Global-Local Adaptive Detector for Robust Speech Deepfake Detection


497. Spectral Super-Resolution using Spatial-Spectral Residual Operator Networks


498. AwarenessBench: Assessing Cognitive Capabilities of Language Models


499. “Nothing to See Here’’: Unintended Disclosure through Revision Traces of LLM Deliverables


500. The Hidden Ratio in Adam: Stable Structure, Compression, and Sign Dynamics