전체 AI 논문 - 2026-06-23

1. PsyBridge: A Hybrid Intelligent Framework for Multi-Dimensional Mental Health Assessment and Decision Support


2. Teaching LLMs String Matching, Backtracking, and Error Recovery to Deduce Bases and Truth Tables for the Combinatorially Exploding Bit Manipulation Puzzles


3. TailorMind: Towards Preference-Aligned Multimodal Content Generation


4. AI Exposure Scores: what they measure, what they miss, and what comes next


5. AI-driven Optimisation of Quality of Recovery (QoR) in Remote Patient Monitoring


6. Causal Discovery in the Era of Agents


7. Against Proxy Optimization


8. SPIRAL: Learning to Search and Aggregate


9. The Topology of Ill-Posed Questions: Persistent Homology for Detection and Steering in LLMs


10. VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct


11. POTracker: Optimizing Large Language Models for Standard-Compliant Power Outage Report Generation


12. CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift


13. AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction


14. Cross-Architectural Mixture-of-Experts with Adaptive Soft Routing for Plant Leaf Disease Classification


15. Digital Humanism and Evolutionary Design


16. Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems


17. Abstract representational geometry supports inference in large language models


18. EHR-Complex: Benchmarking Medical Agents for Complex Clinical Reasoning


19. GIF: Locally Sound Geometric Information Flow Control for LLMs


20. HOLMES: Evaluating Higher-Order Logical Reasoning in LLMs


21. SPADE: Structure-Prior Adaptive Decision Estimation


22. Capable but Careless: Do Computer-Use Agents Follow Contextual Integrity?


23. DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models


24. Decomposing Financial Market Dynamics via Mechanism Analysis in an Evolutionary Multi-Agent Simulation


25. Managing Procedural Memory in LLM Agents: Control, Adaptation, and Evaluation


26. A Matter of Time: Towards a General Theory of Agency


27. TTFT-Aware Graph Chain-of-Thought:Distance-Indexed Neural A* for Low-Hallucination Multi-Hop Medical Reasoning


28. Cognitive Digital Twins: Ethical Risks and Governance for AI Systems That Model the Mind


29. Some Results about the Expressivity of Preference-Incomplete Structured Argumentation Frameworks


30. IPO Finance Agent: Evaluation of LLM Financial Analysts beyond Finance Agent v2, with Automated Rubric Generation – the Case of the SpaceX (SPCX) IPO


31. From numerical proportions to analogical proportions between probabilities


32. A Stackelberg Framework for Resource-Aware LLM Agents: Learning, Repair, and Conditional Guarantees


33. Joint Air Traffic Flow and Capacity Management via Answer Set Programming


34. When Preferences Fail to Become Incentives: A Utility-Behavior Gap in Large Language Models


35. The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production


36. Plans Don’t Persist: Why Context Management Is Load Bearing for LLM Agents


37. ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents


38. When Agents Commit Too Soon: Diagnosing Premature Commitment in LLM Agents


39. Intent-Governed Tool Authorization for AI Agents


40. ThermoLLM: Thermodynamics-Aware HVAC Control with Spatial-Semantic Knowledge Graph


41. Agent-as-a-Router: Agentic Model Routing for Coding Tasks


42. CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents


43. AI Scientists as Engines of Discovery: A Case for Development within Reformed Institutions


44. RaMem: Contextual Reinstatement for Long-term Agentic Memory


45. Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation


46. MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration


47. Active Inference as the Test-Time Scaling Law for Physical AI Agents


48. AI-Assisted Help-Seeking Trajectories in Programming Education from an SRL-Informed Perspective


49. Measuring Behavior Portability in Large Language Models


50. A Formula-Driven Survey and Research Agenda for On-Policy Distillation


51. The Origins of Stochasticity: Comprehensive Investigations on Uncertainty Quantification for Large Language Models


52. Learning Filters with Certainty


53. GroundEval: A Deterministic Replacement for LLM-as-Judge in Stateful Agent Evaluation


54. Closed-loop Auto Research for Molecular Property Prediction: Discovering and Certifying Generalizable Improvements


55. Text Dictates, Music Decorates: Energy-based Attention for Editable Dance Motion Generation


56. Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards


57. Safety-Aware Evaluation of LLM-Generated Driver Intervention Messages through Multi-Task Risk Fusion


58. VISTA Architect: A graph database-oriented health AI system demonstrated in multidisciplinary tumor boards


59. Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations


60. AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent


61. Confident but Conflicted: Internal Uncertainty and Cognitive Dissonance Resolution in LLMs


62. SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment


63. PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement


64. Text2DSL: LLM-Based Code Generation for Domain-Specific Languages


65. MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop


66. Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents


67. Imagine to Ensure Safety in Hierarchical Reinforcement Learning


68. Grounded Scaling: Why Agentic AI Needs Deterministic Environments


69. Deep Learning-Based Sign Language Recognition from Videos and Cross-Lingual Translation to Indian Vernaculars


70. SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments


71. VADAOrchestra: Neurosymbolic Orchestration of Adaptive Reasoning Workflows


72. PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs


73. Self-Evolving Cognitive Framework via Causal World Modeling for Embodied Scientific Intelligence


74. A Differentiable Atari VCS:A Complex, Fully Known Ground Truth for Explainable AI


75. Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment


76. SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery


77. Code Isn’t Memory: A Structural Codebase Index Inside a Coding Agent


78. PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems


79. MetaPS: Adaptive Programmatic Strategy Selection for Market Agents


80. ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery


81. Reference-Free Assessment of Physical Consistency in World Model-based Video Generation


82. Hypothesis-Driven Skill Optimization for LLM Agents


83. Geometry-Aware Online Scheduling for LLM Serving: From Theoretical Bound to System Practice


84. Can Reasoning Models Detect Changes to their Chains of Thought?


85. When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR


86. Attractor Domain Theory: A Mathematical Framework for Cardiovascular Attractor Analysis with Wearable Photoplethysmography (PPG) Validation


87. Nous: A Predictive World Model for Long-Term Agent Memory


88. CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents


89. IRumAI: Reinforcement Learning for Indian Rummy


90. Human vs Machine Mathematical Difficulty on Project Euler: An Experimental Analysis


91. REBA: A Revealed Belief Automaton Framework for Online Planning in Continuous POMDPs


92. Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale


93. Learning the ARTS of Search for Automated Discovery


94. AgentRiskBOM: A Risk-Scoping Security Bill of Materials for Agentic AI Systems


95. ForEx: A Formal Verification Framework for Explainable Reasoning in Logical Fallacy Detection and Annotation


96. Measuring What Persists: Conditioning Mechanisms and a Geometric Framework for AI Agent Identity


97. AgentCAT: Simulating Computerized Adaptive Testing via Multi-Agent Large Language Models


98. Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents


99. Entropy Objectives in Markov Decision Processes


100. Hallucination as Context Drift: Synchronization Protocols for Multi-Agent LLM Systems


101. ChainWorld: Composing Long-Horizon Desktop Workloads from Atomic OSWorld Tasks


102. Counsel: A Meta-Evaluation Dataset for Agentic Tasks


103. Composing Verifiable Conceptual Models via Building Blocks: Towards Design-Time Verification of Agentic AI Workflows


104. AI Alignment From Social Choice Perspectives


105. Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training



107. AutoRAS: Learning Robust Agentic Systems with Primitive Representations


108. Don’t Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents


109. Calibration Is Not Control: Why LLM-Agent Oversight Needs Intervention


110. Mind the Noise: Sensitivity of Transformer-based Interaction-Aware Trajectory Prediction Models to Noisy Data


111. Social World Model for Lifelong Social Intelligence


112. Towards Dys-XAI: Influence-Based Explanations for Dysarthria Severity Assessment


113. ARCO: Adaptive Rubric with Co-Evolution for Multi-Step LLM-Based Agents


114. Whistleblowing and the machine – towards a considered position


115. Trip+: Benchmarking Agents in Personalized Interactive Travel Planning


116. Learning Burst-Aware Early Warning Models for Capacity Stress under AI Workload Surges in Hyperscale Data Centers


117. PulseCX: Breaking the Closed-World Assumption in Real-Time CX


118. Answer Engineering: Local Trajectory Editing for Protocol-Constrained Decision Making in Large Language Models


119. Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training


120. Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines


121. Coherence Under Commitment: Probing Generalization and Vacuous Memorization in LLM Logical Reasoning


122. Negative Knowledge as Failure-aware Shared Memory for AutoResearch


123. The AI Evaluability Gap: The Missing Layer for Managing Risk and Sustaining Value


124. Agentic Time Machine as an Infrastructure for Future-Event Forecasting


125. Closure of Self-Determining System Based on Causal and Constitutive Relations


126. Building Agent Harnesses for Scientific Curation from Multimodal Sources


127. BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery


128. How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs


129. AutoACSL: Synthesizing ACSL Specifications by Integrating LLMs with CPG-Based Static Analysis


130. Generative Responsible AI Data Evaluation Schema (GRAIDES) for AI Assurance in Local Government


131. Power Systems Agent Benchmark: Executable Evaluation of AI Agents in Electric Power Engineering


132. Root Cause Analysis with Latent Confounders using Partial Ancestral Graphs


133. Neurosymbolic Clinical Trial Matching via LLM-Driven Abduction and Logical Verification


134. When Do Intrinsic Rewards Work for Code Reasoning? A Comprehensive Study


135. SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models


136. Process-Reward Tactic Evolution for Long-Horizon Bioinformatics Workflows


137. Study on Quantitative Dynamic Epistemic Logic for Belief Revision


138. What Shapes Emergent Misalignment? Insights from Training Dynamics, Model Priors, and Data


139. Fara-1.5: Scalable Learning Environments for Computer Use Agents


140. Repeated Shared Access Enables Grokking, but Edit Propagation Depends on a Fine-Grained Addressable Memory


141. When Web Agents Finish but Still Fail: Reproducible Triggers and Trace Diagnostics for Parallel Web Exploration


142. Escape from Delusional Echo Trap: Symmetry Breaking, Stochastic Dynamics and Mathematical Mitigation Strategies for Algorithmic Sycophancy


143. FairTutor: Equity-Aware Pedagogical LLM Routing for Budget-Constrained AI Tutoring


144. Simulated Customers Never Walk Away: Decision Fidelity of LLM User Simulators Measured Against Real Purchase Outcomes


145. Artificial Intelligence as Monism: Ontological, Organisational, and Methodological Implications


146. From Question Answering to Task Completion: A Survey on Agent System and Harness Design


147. Democratizing and accelerating AI-driven pathology research through agentic intelligence


148. Agent Behavior Mining: Generative AI Agent Governance in Business Processes


149. A Quantum-Assisted Agentic Distributed Artificial Intelligence Framework for Deadline-Bounded Orchestration of Hybrid Renewable Microgrids


150. DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation


151. Confidence Laundering in Agent Systems: Why Uncertainty Needs a Latent Carrier


152. From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents


153. Skill Coverage: A Test Adequacy Metric for Agent Skills


154. Expected Free Energy-based Planning as Variational Inference


155. A-Evolve-Training: Autonomous Post-Training of a 30B Model


156. Learning Splitting Heuristics for Parallel String Solvers



158. SPARC: A Multi-Agent System for Electrical Circuit Question Answering


159. Hypothesis-Disciplined Multi-Agent Automated Formalization of Asymptotic Statistical Theory


160. An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving


161. RIZZ: Routing Interactions to Near Zero-Interference Zones for Continual Adaptation of Black-Box Agents


162. Constituency Optimisation Through Hamiltonian Representation Of Mandates (COTHROM): Algorithmic Redistricting of Irish Election Boundaries


163. SkillHarness: Harnessing Safe Skills for Computer-Use Agents


164. DEMM-Bench: A Cross-Regime Benchmark for Agent-Runtime Governance-Evidence Sufficiency


165. Harnessing Agent Skills: Architectural Patterns and a Reference Architecture for Skill-Mediated LLM Agents


166. Human Decision-Making with AI Assistance under Correlated Features


167. Latent Goal Prediction from Language for Model-Based Planning


168. AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents


169. In LLM Reasoning, there is Irrationality on top of Value Misalignment


170. Path-dependent program induction under resource constraints explains human sequence learning


171. Darwin Mobile Agent: A Roadmap for Self-Evolution


172. PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate


173. Specifying AI-SDLC Processes: A Protocol Language for Human-Agent Boundaries


174. The New Associationism: Lessons from Deep Learning


175. Beyond Fixed Budgets: Characterizing the Inelasticity and Limitations of Tree-of-Thought Reasoning Strategies


176. On the Identifiability of User Adaptation in Co-Adaptive Neural Interfaces


177. CoorDex: Coordinating Body and Hand Priors for Continuous Dexterous Humanoid Loco-Manipulation


178. Semantic Browsing: Controllable Diversity for Image Generation


179. AIR: Adaptive Interleaved Reasoning with Code in MLLMs


180. Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?


181. Tapered Language Models


182. Learning Process Rewards via Success Visitation Matching for Efficient RL


183. DiT-Reward: Generative Representations for Text-to-Image Reward Modeling


184. RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models


185. Data Selection Through Iterative Self-Filtering for Vision-Language Settings


186. Discovering Latent Groups for Robust Classification


187. Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers


188. Polycepta: Object-Centric Appearance Estimation for Multi-Object Tracking


189. A Generative Model for Closed-Loop Microsimulation of Signalized Intersections


190. Decentralized Autonomous Traffic Management through Corridor Networks


191. Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse


192. Solve for the Hyperparameter, Skip the Search: Kolmogorov-Optimal Scaling Laws for Spline Regression


193. Scheduling Thoughts: Learning the Order of Thought in Diffusion Language Models


194. The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model


195. SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration


196. DVL-DeepONet: A Physics-Guided Operator Learning for Resilient Underwater Navigation


197. War in the Abstract: The Rise and Consequences of Militarized Language in Scientific Communication


198. What Does a Chemical Language Model Know About Molecules?


199. Rethinking Object-Centric Representations for Video Dynamics Modeling


200. GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation


201. Detecting Malicious Agent Skills in the Wild using Attention


202. UnBias-Plus: Detect, Explain, and Rewrite Bias


203. HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models


204. ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models


205. Automated Semantic Fault Localization in SysML v2: A Human-in-the-Loop Framework Using Knowledge-Graph Augmented LLMs


206. Distribution-Aware Diffusion-LLM for Robust Ultra-Long-Term Time Series Forecasting


207. Energy-Based Transformers as Predictors of Reading Difficulty


208. Measuring & Mitigating Over-Alignment for LLMs in Multilingual Criminal Law Courts


209. Rethinking Molecular Graph Backdoors under Chemistry-aware Admission


210. Adaptive Hard-Soft Physics-Informed Neural Networks for Robust Boundary-Constrained PDE Solving


211. Field-level weak lensing cosmology with $<100$ simulations using multifidelity simulation-based inference


212. The Watermark Shortcut: How Provenance Marking Sabotages Audio Deepfake Detection


213. VideoAgent: All-in-One Framework for Video Understanding and Editing


214. Towards a Bathroom-Centered Human-Building Digital Twin Framework for Indoor Safety Analysis


215. Exposing the Illusion of Erasure in Knowledge Editing for LLMs


216. Dynamic multi-agent deep reinforcement learning-based pricing and incentivization approach in multimodal transportation networks


217. P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture


218. SteerVTE: Seamless Video Text Editing with Style and Glyph Control


219. RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation


220. MuPPET: A Benchmark for Contextual Privacy of LLM Assistants in Multi-Party Conversations


221. Where Is My Physics Wrong? Localized and Identifiable Discovery of Model Discrepancy


222. The Correct Answer Trap: Pedagogically-Grounded Detection and Feedback for Hidden Misconceptions


223. When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis


224. Memory Contagion: Cross-Temporal Propagation of Evaluator Bias via Agent Memory


225. Interpretable Probabilistic Medical Image Segmentation via Gaussian Process with Explicit Modelling of Annotation Bias and Variability


226. LLM-Aided A* Search in Non-Geometric Network Graphs


227. AI-Empowered UAV-Assisted Backscatter Localization and ISAC for Zero-Energy IoT: A Comprehensive Survey


228. PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation


229. Self-Evolution for Multi-Turn Tool-Calling Agents via Divergence-Point Preference Learning


230. ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation


231. FLFL: Federated Latent Factor Learning for Private Recovery of Spatio-Temporal Signals


232. AdaReP:Adaptive Re-Planning under Model Mismatch for Neural World-Model Predictive Control


233. Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies


234. Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs


235. MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning


236. From Text Metrics to Model Internals: A Study of Whisper ASR Hallucination Detection


237. Physics-governed executable modelling of triboelectric nanogenerators


238. Training Open Models for Agentic Phone Use


239. HALAS: A Human-Annotated Dataset of Hallucinations of Modern ASR Systems


240. Domain Adaptation Under Wireless Network Constraints: When Does It Become Green?


241. Prime Fourier Embeddings: A Principled Basis for Modular Arithmetic


242. The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel


243. EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning


244. Physics-Guided Spatiotemporal State Space Modeling for Lookahead Molten Pool Segmentation in Laser Wire-Feed Welding


245. ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers


246. Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning


247. Neural Architecture Search of Sample Reweighting Networks for Complex Distribution Shift


248. StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs


249. Understanding Parallel Samplers in Masked Diffusion via Random Walks on Graphs


250. Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models


251. Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently


252. BEV-Denoise: Learning Intrinsic Noise for Accurate Bird’s-Eye-View Semantic Segmentation


253. Hierarchical Reinforcement Learning for Sparse-Reward Search in Commutative Algebra


254. Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving


255. Cross-lingual Retrieval-Augmented Classification for Dysarthria Severity Assessment



257. From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases


258. Explainable AI in Speaker Recognition – Attention Map Visualisation and Evaluation


259. Explanation-Guided Medical Named Entity Recognition with Stability and Boundary Awareness for Atopic Dermatitis


260. Priority-Aware Learning-Unlearning Correction for Dynamic Decentralized LoRA Fine-Tuning


261. SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers


262. VideoLatent: Video-Language Learning via Latent Self-Forcing


263. Discovering Crystal Structure Prediction Algorithms with an AI Co-Scientist


264. The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks


265. CLIP-guided Diffusion Model for Backdoor Generation in Sensor-based Human Activity Recognition


266. OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention


267. DBT-Bleed: Dual-Branch Temporal Modeling with Key-Frame Selection for Surgical Bleeding Detection


268. Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis


269. Scaling Audio Models Efficiently: A Joint Study of Compute Constraints and Optimization Behavior


270. Explainable AI for Mental Health Prediction in Drug-Affected Populations with Dragonfly Algorithm and GAN Oversampling


271. GeoRouteNet: Geometry-Enhanced Non-Autoregressive Neural Solver for the Traveling Salesman Problem


272. Noise is Signal: Density-Based Outliers as Leading Indicators of Occupational Emergence in Labor Market Text


273. Evolutionary Optimization Reveals Structural Constraints on Reservoir Architecture for Spatiotemporal Chaos


274. AI Fiction in the Wild


275. When Confidence Takes the Wrong Path: Diagnosing Retrieval-State Lock-In in RAG


276. Interpretable Uncertainty Routing Separating Emotion Ambiguity from Distribution Shift in Facial Expression Recognition


277. Subspace-Constrained Federated Learning with Low-Rank Adaptation


278. Leakage-Aware Benchmarking of LLM Forecasting: Real-Time Nowcasts as the Decision-Time Input for Macro Factor Ranking


279. Beyond Simpson’s Paradox: A Cascade of Confounders in AI Agent Pull-Request Co-Authorship


280. Libretto: Giving LLM Agents a Sense of Musical Structure


281. SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors


282. The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs


283. Only Ask What You Don’t Know: Grounded Delta Planning for Efficient Multi-step RAG


284. RigorBench: Benchmarking Engineering Process Discipline in Autonomous AI Coding Agents


285. Data Evolution by Wittgenstein’s Rule Following


286. Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift


287. Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy


288. Orthogonal Representation Editing: Decoupling Semantic Entanglement in Batch Knowledge Editing of LLMs


289. Federated Learning for Global Carbon Emission Forecasting: A Hybrid Time-Series Approach with Statistical and Neural Models


290. On the Position Bias of On-Policy Distillation


291. From CVE to CWE: Syscall-Based HIDS Generalisation


292. Context-Aware Distillation and Ablation for Text2DSL


293. The Power of Light: Improving Synthetic-to-Real Domain Adaptation through Physically-Based Indirect Illumination


294. Concept-Constrained Prompt Learning for Few-Shot CLIP Adaptation


295. Look Light, Think Heavy: What Multimodal Chain-of-Thought Reasoning Can and Cannot Do


296. Training-Free Semantic Correction for Autoregressive Visual Models


297. Generative Robust Optimisation


298. Fed-CausalDiff: Decoupled Synchronization for Federated Do-Simulation and Policy Evaluation


299. Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing


300. An LLM-Orchestrated Agent for Directional-Coupler Design with Self-Consistent Eigenmode and FDTD Validation


301. Human and AI collaboration for pulmonary nodule segmentation


302. All Green, Still Broken: Real-Flow Verification Lessons from an LLM-Integrated, Multi-Market Web Application


303. Not All Claims Are Equally Risky: FACTOR for Adaptive Verification in Factual Long-Form Generation


304. CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories


305. DreamUV: Unwrap Artist-like UV by End-to-End Flow Matching


306. MMGist: A Comprehensive Multimodal Benchmark for 2027


307. Words as Difference Makers: How Large Language Models Determine Causal Structure in Text


308. Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding


309. Reinforcement learning to improve large language model-based automated code compliance systems


310. Structured Hyperedge Adaptation for Parameter-Efficient Fine-Tuning of Vision Transformers


311. Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset


312. First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers


313. On the Sparsity-Storage-Accuracy Tradeoff in Parsimoniously Activated Dictionary Learning


314. Reliability-Guided Adaptive Ensembling for Robust Test-Time Adaptation


315. Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance


316. Flow Annealing Posterior Sampling for Function-Space Regression and Inverse Problems


317. Benchmarking Robot Memory Under Interference


318. BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories


319. All Routes Lead to Collapse


320. Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model


321. Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution


322. Enhancing Protein Representation Learning via Manifold Restore Mixing


323. Leveraging Large Language Models to Obscure Code Stylometry: A Comparative Study of GPT-3.5 and GPT-4


324. SCENIC: Semantic-Conditioned Edge-Aware Neural Framework for Structured IoT Command Generation


325. Active Sensing and Deferred-Decision Trajectory Optimization for Robust Target Identification


326. From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa


327. MixedPEFT: Combining Multiple PEFT Methods with Mixed Objectives for Unsupervised Domain Adaptation


328. Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability


329. Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases


330. From Handcrafted Features to Functional Edge Learning: Evolution of EEG Seizure Detection Frameworks


331. On the Expressive Power of Weight Quantization in Large Language Models


332. Quantifying Theoretical AI Alignment Guarantees: Receiver-Utility Bounds in Bayesian Persuasion


333. MultiMem: Measuring and Mitigating Memorization in Multi-Modal Contrastive Learninga


334. An Analysis of Untrained Deep Reservoir Networks for Audio Surveillance


335. Delta-Diffusion: Modeling Longitudinal Brain Amyloid-PET Trajectories via Conditional Poisson Diffusion Bridge


336. Sequential Minimal Optimization Algorithm for One-Class Support Vector Machines With Privileged Information


337. Lexical Consensus: Grounded Word Learning and Shared Meaning in Artificial Agents


338. When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies


339. Neural Conjugate Aggregation: Identifiable Unsupervised Multi-Sensor Regression under Heterogeneous Sensor Bias


340. L20-Edu-135M: An Auditable Single-GPU Study of Data-Efficient Small Language Modeling


341. Dual-Stream EEG Decoding for 3D Visual Perception


342. DSSCNet: A Transfer Learning Framework for Cross-Corpus Dysarthric Speech Severity Classification


343. How Well Do Self-Supervised Speech Models Encode Age and Gender in Children’s Speech? A Layer-Wise Analysis Across Multiple Architectures


344. Gated MLPs as Symmetry-Broken Rank-1 Bilinear Attention


345. Rebuttals Move Peer-Review Scores, but Initial-Review Structure Bounds the Movement


346. $π$-RAG: Oblivious Retrieval via Semantic Quantization and Transcendental Addressing for Large Language Models


347. SAGE: An Expert-Annotated South Asian GI Endoscopy Dataset for Multimodal Learning and Hallucination Analysis


348. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language


349. KITE: Decoupling Kinematics and Interaction for Zero-Shot Cross-Embodiment Manipulation


350. TraceView: Interactive Visualization of Agentic Program Repair Trajectories


351. Plurification in/of language technology – The integration of culture in next-generation AI


352. CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation


353. New Smooth Loss functions for Robust Regression that Closely Approximate Absolute Error and Provide Improved Performance on Datasets With Significant Outliers


354. NL2Scratch: An Executable Benchmark and Evaluation for Block-Based Programming


355. Gradient-Descent Steps to Success over Mean Accuracy: A Paradigm Shift for ML


356. A Completion-Aware Framework for Impactful Counterfactual Explainability in Graph Neural Networks


357. RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation


358. Cluster-Specific Localized Drift Detection for Efficient Batch Model Adaptation under Controlled Distribution Shift


359. Channel Location Constrains the Auditability of Subliminal Learning


360. Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare


361. Fine-Tuning Large Language Models for Quantum Reasoning


362. SPOTR: Spatio-temporal Pooling One-Token Reconstruction for Universal Physiological Signal Self-supervised Learning


363. From RAN Control to Agentic Intelligence: Architecture and Vision for Energy Efficient AI-RAN


364. ScalePredictor: Instance-aware Scale Learning for Accurate Quantization of Vision Transformers


365. Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning


366. Latent Confidence Alignment for LLM Self-Assessment


367. Rethinking the Adaptation of Vision Foundation Models for Efficient Cell Segmentation


368. Skills for the future software profession: beyond agentic AI!


369. Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity Recognition


370. Improving Engine Sound Analysis in Hot-Test Environments via a RAB-U-Net (Residual Attention Block U-Net) Noise Removal Method


371. AI-Mediated Negotiation: Design Reflections and Lessons


372. Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts


373. A Verifiable Search Is Not a Learnable Chain-of-Thought


374. Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead


375. Protein contacts are already in the attention: a single-forward-pass alternative to the Categorical Jacobian


376. The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference


377. Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents


378. Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers


379. UniRank: Unified Rank Allocation for Low-Rank LLM Compression


380. AgentDSE: Reasoning-Augmented Architectural Design Space Exploration


381. CNnotator: LLM-Guided Memory Safety Annotation Synthesis


382. Generating Public Health Responses using Survey-Augmented Large Language Models


383. Steer, Don’t Solve: Training Small Critic Models for Large Code Agents


384. Is Agent Code Less Maintainable Than Human Code?


385. THREAD: Trajectory Planning for Hybrid Rigid-Soft Manipulators with Environment-Aware Diffusion


386. CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks


387. Beyond the Next Step: Variable-Length Latent World Models for Long-Horizon Planning


388. Scene-Level Heterogeneous Physics Simulation with 3D Gaussian Splats


389. Cohort Organized Learning: Clustering Through Agreement


390. HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning


391. Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents


392. Denoising Iterative Self-Correction: Structured Verification Loops for Reliable LLM Reasoning


393. PrivacyAlign: Contextual Privacy Alignment for LLM Agents


394. Clinical Term Extraction using Open-Source Small Language Models


395. TACO: Task-Aware Column Description Generation Using LLMs


396. Decodable but Not Faithful: Coupling Natural-Language Rationales to Programmatic Verifiers


397. Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models


398. Improving Text-to-Music Generation with Human Preference Rewards


399. When Is an LLM Worth It for Hyperparameter Optimization? A Budget-Matched Study on Tabular Data Finds the Warm-Start Is a Default Configuration, Not the Model


400. A DVDrive Approach for doScenes Instructed Driving Challenge


401. Cross-Modal Corroboration for Annotation-Free Wildlife Monitoring


402. The Two-Hump Problem: Bridging the Difficulty Gap in Mathematical Reinforcement Learning


403. FAST: A Framework for Aligned Sampling and Training in Parallel Reinforcement Learning for Autonomous Driving


404. The Unreasonable Effectiveness of VLMs for Zero-shot Procedural Mistake Detection


405. Memory Is No Longer a Bottleneck: Memory-Efficient Graph Filtering for Scalable Collaborative Filtering


406. Backpropagating Through Simulation: Analytic Policy Gradients for Sample and Learning Efficient Differentiable Continuous Control


407. Breaking chains with trees: Deep learning with $\mathcal{O}(\log N)$ parallel time complexity


408. Decoupling the Declarative from the Procedural in Vision-Language-Action Models


409. Predicting High-Risk Colorectal Polyps in African Americans Using Pre-Colonoscopy Clinical Features: Machine Learning Model Development and Temporal Validation


410. Evaluation of Small Language Models for Arabic Language Processing


411. CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents


412. Does Mixture-of-Experts Actually Help Inference on Consumer and Edge Hardware? An Empirical Study


413. MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning


414. 2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models


415. SwarmX: Agentic Scheduling for Low-Latency Agentic Systems


416. Evaluating LLMs for Real-World Web Vulnerability Detection


417. Unsupervised Disentanglement Without Compromises : How Functional Orthogonality Enforces Identifiability


418. EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis


419. Graph-of-Differences: Anatomy-Structured Difference Alignment for Medical Image Re-Identification


420. Sexualised synthetic personas encode and amplify gendered power asymmetries through voice


421. LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity


422. SOHET: Sequence Of Heterogeneous Events Transformer with Self-Supervised Pre-Training


423. DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams


424. Ramanujan Graph Rewiring with Non Negative Resistance Curvature


425. Warning labels shift perceptions of sycophantic AI, but not its influence


426. Task-Differentiated Atomic Skill Expansion and Routing for Continual Learning Across Highly Heterogeneous Tasks


427. NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning


428. Topological Neural Dynamics: A Neuron-wise Framework for Sequence Modeling


429. Few-Shot Hyperspectral Aphid Detection via FastGAN Synthetic Data Generation, Transformer-Based Classification and Explainable AI


430. An Empirical Study of OpenPangu Quantization on Ascend NPUs


431. ACE-GS: Acing the Trade-off with Accurate, Compact and Efficient 3D Gaussian Splatting


432. Recency/Frequency Adaptive KV Caching for Large Language Model Serving


433. FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages


434. Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach


435. QBioFusion-QSAR: Morgan-Anchored Quantum Multiple Kernel Learning for Small-Data Ligand Classification


436. When Context Misleads: Surprisal, Energy and Attention Entropy as Metrics of Coherence Illusions in LLMs


437. Communication Heterogeneity and Collective Consensus in Neural Cellular Automata


438. Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders


439. Beyond Hooking Onto the World: Referential Profiles and the Numerical Structure of LLM Grounding


440. MEDLAYXPLAIN: Benchmarking the Expert-Lay Gap in Medical Vision-Language Models


441. TF-SNO: Time-Frequency Gated Spectral Neural Operators for Learning Non-Stationary Partial Differential Equations


442. Anatomically Consistent TMJ Disc Segmentation via Semantic Anchoring and Clinical Priors


443. Inverting the Bellman Equation: From $Q$-Values to World Models


444. An Exploratory Case Study of LLM-Assisted Refactoring and Gameplay Feature Generation in an Endless Runner Game


445. OmniV2X: A Generative Foundation Planner for Efficient End-to-End Cooperative Driving


446. Contrastive and Adaptive Multi-modal Masked Autoencoder for Spatial Transcriptomics


447. Context-Aware Generative AI for Automated Telecom Test Script Generation


448. AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?


449. AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents


450. AgentMeter: Evaluating Model-CLI Matching for CLI-Based Local Task-Solving Agents


451. PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning


452. MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis


453. ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading


454. MS-rPPG: Multi-spectral State Space Model for Remote Photoplethysmography in Driver Monitoring Systems


455. Chem2Gen-Bench: Benchmarking Chemical-to-Genetic Translation in Perturbation Response Space


456. LLM-Based Multi-Reference Evaluation for Efficient and Robust Assessment of Phrase Break Annotations


457. SLeDGe: Semi-Supervised Learning on Data Streams with Graph Structure Learning


458. Sim2O: Efficient Offline-to-Online MARL via Joint Action Composition


459. Scalable Hierarchical Attention Transformers for Multi-Turn Jailbreak Detection in Long Conversations


460. FiLM-Coordinated Dual-Branch Transformer for Global-Local Dependency Modeling in Language Modeling


461. An Efficient and Effective Architecture for Large-Scale Traffic Prediction via Geometry-Adaptive Square Partitioning


462. Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer


463. Imitation Learning for Elder-Facing Speech Synthesis


464. Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning


465. MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts


466. Structure-Aware Graph Multi-Task Learning for Dynamic Sparse OD Demand Prediction


467. CheXpercept: A Benchmark for Evaluating Expert-Level Lesion Perception in Chest X-rays


468. LK Jam: System Architecture and Implementation of a Real-Time Human-AI Interactive Music Generation System using Role-Aware GRU


469. The Metanym Game: A Self-Contained, Self-Consistent LLM Peer-Community Benchmark for Structural Intelligence


470. Text-to-Image Generative AI for Modeling and Simulation: Methods, Opportunities, and Applications


471. Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City


472. Detecting Satellites in Radio-Frequency Data via Semi-Supervised Learning


473. Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs


474. Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning


475. Comparing Transformers and Hybrid Models at the Token Level



477. Short-Term Electricity Demand Forecasting for New England Using a Hybrid Transformer-XGBoost Framework with Weather, Calendar, and COVID-19 Indicators


478. PROTON: Prototype-Based Test-Time Online OOD Detection for Medical VLMs


479. Latent Personal Memory: Represent personal memory as dynamic soft prompts


480. Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents


481. BELDE: Building a Large-scale Earth-observation Land-cover Dataset for Europe


482. MMGNN: Multi-level, multi-color graph neural networks for molecular property prediction


483. Vesta: A Generalist Embodied Reasoning Model


484. The Token Tax of Epistemic Accuracy: Comparing RAG and Long-Context Architectures for Document-Grounded Generative AI Applications


485. PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality


486. Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks


487. The Substrate Collapse: AI Code Generation Invalidates Authorship-Based Knowledge Metrics


488. Artificial collectives of specialists and generalists excel at different tasks


489. Machine Learning Classification of Cryopathy Syndromes: A Comprehensive Comparative Study


490. A3C3: AI Algorithm and Accelerator Co-design, Co-search, and Co-generation


491. Can LLMs Reason About Brand Ownership? An Empirical Study of Domain Attribution Intelligence


492. FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation


493. Translating Inference-Time Control to Radiology Vision-Language Models: Activation Steering for Pneumonia Classification on Chest X-rays


494. B[FM]$^2$: Brain Foundation Model via Flow Matching with SplitUNet


495. GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling


496. Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things


497. TriMotion: Modality-Agnostic Camera Control for Video Generation


498. Beyond ‘One Language, One Script’: Quantifying Orthographic Bias in Multilingual VLMs with PuMVR


499. FirstPass: Grounding AI Scientific Judgment in Multi-Round Editorial Outcomes


500. UniSLAD: A Unified Framework for Structural and Logical Industrial Visual Anomaly Detection