전체 AI 논문 - 2026-06-09

1. Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting


2. SIGA: Self-Evolving Coding-Agent Adapters for Scientific Simulation


3. Collaborative Human-Agent Protocol (CHAP)


4. Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback


5. SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research



7. Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization


8. (Auto)formalization is supposed to be easy: Trellis process semantics for spelling out rigorous proofs


9. Correlation Is Not Enough: Embedding Human Metadata for Individual Causal Discovery


10. SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks


11. Frequency-based Constrained Sampling for Interval Patterns


12. From 0-to-1 to 1-to-N: Reproducible Engineering Evidence for MetaAI Recursive Self-Design


13. Next-Token Prediction Learns Generalisable Representations of Sleep Physiology


14. Optical Reasoning: Rethinking Images as an Expressive Reasoning Medium Beyond Text


15. TABVERSE: Benchmarking Cross-Format Table Understanding in LLMs and VLMs


16. Self-Explainability in Self-Adaptive and Self-Organising Systems: Status and Research Directions


17. PRISM: Recovering Instruction Sets from Language Model Activations


18. AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation


19. From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs


20. Deterministic Integrity Gates for LLM-Assisted Clinical Manuscript Preparation: An Auditable Biomedical Informatics Architecture


21. LLM-Orchestrated Conformance Checking in Stroke Care Without Computer-Interpretable Guidelines


22. Emergent alignment and the projectability of ethical personas


23. TheoremBench: Evaluating LLMs on Theorem Proving in Formal Mathematics


24. AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning


25. SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance


26. Bayesian Selective Latent Inference for Wastewater-First Influenza Monitoring


27. WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces


28. Capacity, Not Format: Rethinking Structured Reasoning Failures


29. Correct Looks Better: Pairwise Comparisons Reveal Accuracy Rankings


30. RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour


31. From Coarse to Fine: Managing Temporal Granularity in Spatio-Temporal Data for Fine-Grained Traffic Prediction


32. Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs


33. Experience Makes Skillful: Enabling Generalizable Medical Agent Reasoning via Self-Evolving Skill Memory


34. Leveraging Structural Constraints for Diffusion-based Neural TSP Solvers


35. TRL-Bench: Standardizing Cross-Paradigm Representation-Level Evaluation of Tabular Encoders


36. Anything2Skill: Compiling External Knowledge into Reusable Skills for Agents


37. FF-JEPA: Long-Horizon Planning in World Models with Latent Planners


38. MASS: Deep Research for Social Sciences with Memory-Augmented Social Simulation


39. IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation


40. Reliable to Expressive: A Curriculum for Rubric-Following Safety Judges


41. Vision Language Model Helps Private Information De-Identification in Vision Data


42. Late-Layer Fusion is Enough: Dual-Path Vision Token Routing for Multimodal Large Language Models under Visual Saturation


43. A Regret Minimization Framework on Preference Learning in Large Language Models


44. ComplexConstraints and Beyond: Expert Rubrics for RLVR


45. Graph2Idea:Retrieval-Augmented Scientific Idea Generation with Graph-Structured Contexts


46. DynaOD: Dynamic Origin-Destination Flow Generation with Discrete-to-Continuous Temporal Semantic Modeling


47. REFLECT: Intervention-Supported Error Attribution for Silent Failures in LLM Agent Traces


48. Agent Economics: An Entropy-Controlled Pluralistic Alignment Framework for Preventing Artificial Hivemind in Autonomous Agents


49. Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs


50. A Multi-Agent System for IPMSM Design Optimization via an FEA-AI Hybrid Approach


51. LATTEArena: An Evaluation Framework for LLM-powered Tabular Feature Engineering (Extended Version)


52. The Token Not Taken: Sampling, State, and the Variability of AI Agent Outputs


53. Baichuan-M4: A Clinical-Grade Medical Agent System for Continuous Care


54. RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models


55. Diverse Thinking Schemata Elicit Better Reasoning in Large Language Models


56. An Effective Router for Vision-Language Model Selection


57. AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models


58. Oversight Has a Capacity: Calibrating Agent Guards to a Subjective, Fatiguing Human


59. Order Matters: Unveiling the Hidden Impact of Macro Placement Sequences via Proxy-Guided LLM Evolution


60. FAME: Forecastability-Aware Mixture of Experts for Heterogeneous Time Series Forecasting


61. Can the Environment Speak for Itself? $T^{2}$-GRPO: A Turn-Trajectory Group Relative Policy Optimization for Caregiver Agents


62. Hybrid E-Assessment in Higher Education: Semi-Automated Grading of Paper-Based Written Examinations


63. A Resilience-as-a-Service assessment framework for coordinated disruption response in interdependent urban transit systems


64. ZIPP:Zero-shot Image Personalization from Personas


65. Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs


66. Instrumental convergence and power-seeking


67. Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models


68. Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization


69. STAR: Rethinking MoE Routing as Structure-Aware Subspace Learning


70. Q-Delta: Beyond Key-Value Associative State Evolution


71. Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution


72. RAILS: Verification-Native Clearing For Agentic Commerce


73. Structure-Conditioned Actor-Critic Branches for Quality-Diversity Reinforcement Learning


74. Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery


75. ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems


76. Extending Ontologies: From Dense Embeddings to Hybrid Quantum-Fuzzy Systems


77. Towards Long-Horizon Vessel Trajectory and Destination Forecasting with Reasoning Large Language Models


78. InA-Probe: Instruction-Aware Active Probing for Time Series Forecasting with LLMs


79. Distilling LLM Reasoning into an Interpretable Policy Tree for Human-AI Collaboration


80. Quantitative Promise Theory: Intentionality and Inference in Autonomous Agents


81. PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR


82. AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions


83. DN-Hypo-Pipeline: An AI-Driven Workflow for Hypothesis Generation via Large Language Models and Scientific Explanations


84. VESTA: A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents


85. Scaffold Effects on GAIA: A Controlled Comparison


86. Standpoint Logics with Defeasible Beliefs


87. Explaining Black-Box Language Models: Learning to Optimize Linguistically-Structured Word Subsets


88. What Makes a Desired Graph for Relational Deep Learning?


89. Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs


90. A Variability-Based Framework for Interpretable Naming in Formal and Relational Concept Analysis


91. GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning


92. Trajectory-Refined Distillation


93. Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control


94. TT-DAC-PS: Twin-Target Deterministic Actor-Critic with Policy Smoothing for Optimal Trade Execution


95. Benchmarking Open-Ended Multi-Agent Coordination in Language Agents


96. Integrating Deep Learning Demand Forecasting with Multi-Objective Optimization for Circular Coffee Supply Chains: A Data-Driven Framework for Cost, Emissions, and Freshness Management


97. Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies


98. Curation of a Cardiology Interface Terminology for Highlighting Electronic Health Records using Machine Learning


99. To Nuke or Not to Nuke: LLMs’ (Missing) Ethical Reasoning and Actions in a High-Stakes Decision-Making Simulation


100. Revisiting the shutdown problem


101. Ablation-Reversible Heads Don’t Transfer: A Stress Test for Mechanistic Role Claims in Transformers


102. Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems


103. From Validator Selection to Portfolio Collection Optimization in Proof-of-Stake Blockchains


104. Traxia: A Framework for Verifiable, Agent-Native Scientific Publishing


105. When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding


106. SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents


107. Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents


108. Decision-Aware Memory Cards: Counterfactual-Inspired Context Selection and Compression for Tool-Using LLM Agents


109. SAGE: An LLM-driven Self Reflective Agentic Framework for Fraud Detection


110. Cross-LLM Consistency in Inference: Evidence from Shared Interactions


111. Think Before You Act: Intention-Guided Reasoning for LLM-Based Location Prediction


112. PACE: Anytime-Valid Acceptance Tests for Self-Evolving Agents


113. When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference


114. A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology


115. How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions


116. SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows


117. OSMGraphCLIP: Learning Global Location Representations from OpenStreetMap Graphs


118. UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL


119. Efficient Skill Grounding via Code Refactoring with Small Language Models


120. VATS: Exploiting Implicit Authority in Error-Path Injection via Systematic Mutation


121. PAFO: Pareto Fairness Optimization for Personalized Reward Modeling


122. Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline


123. Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs


124. Unification of Closed-Open Industrial Detection Scenarios: New Large-Scale Benchmarks,Challenges and Baselines


125. Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy


126. The CIFAR Synthetic Evidence Corpus for Detecting AI-Generated Evidence


127. EditSR: Enhancing Neural Symbolic Regression via Edit-based Rectification


128. MemToolAgent overview with a simple restaurant booking scenario where the agent retrieves similar memories, receives feedback on an invalid time format, and generates a reflection to update its memory


129. Contract2Tool: Learning Preconditions and Effects for Reliable Tool-Augmented LLM Agents


130. The AI Epistemic Deference Index: A Continuous Measure of Sycophancy


131. Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators


132. Overcoming the Regulatory Bottleneck via Agent-to-Agent Protocols: A Nuclear Case Study


133. Joint Structural Pruning and Mixed-Precision Quantization for LLM Compression


134. Scaling Participation in Modular AI Systems


135. Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models


136. Beyond Goodhart’s Law: A Dynamic Benchmark for Evaluating Compliance in Multi-Agent Systems


137. Improving Multimodal Reasoning via Worst Dimension Optimization


138. Reconstructing and forecasting disease trajectories of patients with Alzheimer’s disease using routine data in resource-constrained settings


139. Land cover and flood type govern the detection limits of satellite-based flood mapping across diverse global flood events


140. Some hypotheses on how chatbots work in problem-solving-driven conversations. Large Language Models as confirmation of the Innovation Illusion


141. Automatic Extraction of Structured Information from Brain MRI Reports Using an Open-Weight Large Language Model


142. Why Limit the Residual Stream to Layers and Not Tokens? Persistent Memory for Continuous Latent Reasoning


143. A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline


144. Syll: Open-Source Personal Automation with Cross-Surface Execution


145. OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs


146. PathoSage: Towards Multi-Source Evidence Adjudication in Pathology via Experience-Aware Agentic Workflow


147. OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics


148. An Agency-Transferring Model-Free Policy Enhancement Technique


149. PTL-Diffusion: Manifold-Aware Diffusion with Periodic Terminal Laws


150. AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing


151. Topological Neural Operators


152. Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts


153. FASE: Fast Adaptive Semantic Entropy for Code Quality


154. Who Earns the Safety? Intervention-Aware Quantum Predictive Control with Safety Attribution


155. Data Synthesis and Parameter-Efficient Fine-Tuning for Low-Resource NMT: A Case Study on Q’eqchi’ Mayan


156. Preserving Plasticity in Continual Learning via Dynamical Isometry


157. Difference-Aware Retrieval Policies for Imitation Learning


158. Hybrid Robustness Verification for Spatio-Temporal Neural Networks


159. Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO


160. Observability for Delegated Execution in Agentic AI Systems


161. An 84-Format Numeric Catalog with Bit-Exact Conformance Vectors: A Vendor-Neutral Reference for FP8, BF16, MXFP4, and Microscaling Formats


162. MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation


163. Transition-Based Digital Twin Modelling for Alzheimer’s Disease under Sparse Longitudinal Data


164. Visual Prompting Meets Feature Reconstruction-Based Anomaly Detection with Dual-Teacher Supervision


165. End-to-End Context Compression at Scale


166. Muon Learns More Robust and Transferable Features than Adam


167. ArtiFact: A Large-Scale Multi-Modal Cultural Heritage Dataset


168. Do Video Foundation Models Understand Intuitive Physics? A Layerwise Probing Analysis


169. FMplex: Model Virtualization for Serving Extensible Foundation Models


170. ATN3D: Density-Aware LiDAR-Radar Early 3D Object Detection Under Extreme Sparsity


171. ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies


172. Powering the Future of AI: Navigating the Trade-offs for Europe’s Energy Transition and Net-Zero Goals


173. AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving


174. Shape Formation for the Cooperative Transportation of Arbitrary Objects Using Multi-Agent Reinforcement Learning


175. Closure-Validated Circuit Discovery in Attention Heads: Co-activation Proposes, Ablation Disposes


176. I Was Scrolling and Then I Saw a Pregnant Strawberry


177. Seeing the Hivemind: A Consensus-Aware Interaction Technique for Mitigating AI Homogenization


178. CT-VAM: A Cerebello-Thalamic-Inspired Vision-Action Model for Efficient Visuomotor Control


179. Safe-RULE: Safe Reinforcement UnLEarning


180. FuseFSS: Efficient Secure LLM Inference with Function Secret Sharing


181. SecureClaw: Clawing Back Control of LLM Agents


182. Model Poisoning Against Federated Model Adaptation with Chain of Bit-Flips


183. Emergence of Context Characteristics Sensitivity in Large Language Models


184. Closing the Prior-Posterior Loop: Self-Reflective Molecular Design with Analysis-Driven LLM Iteration


185. Targeting World Models to Compromise Robot Learning Pipelines


186. Memory Beyond Recall: A Dual-Process Cognitive Memory System for Self-Evolving LLM Agents


187. A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales


188. LargeMonitor: Monitoring Online Task-Free Continual Learning via Large Pretrained Models


189. Context-Aware Deep Learning for Defect Classification in Atomic-Resolution STEM


190. Harness Engineering for Physical AI: Robot Middleware Is the Harness Layer


191. AI Assurance in UK Defence: Challenges in Operationalising JSP 936


192. Can Data Work be Reparative?


193. SAILS: Surrogate-based Analysis of Interactions via Local Effect Smooths


194. Real-time body pose non-verbal communication with a consistency-based reliability measure


195. Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short


196. Scaling Neural Network Verification with Tensor Parallelism and Fully Sharded Data Parallelism


197. PhysScene: A Scene Graph Dataset for Scientific Visual Reasoning in Physics Experiments


198. Beyond Humans: Multispecies Animal Face Recognition Using Transfer Learning


199. Conan-embedding-v3: Fusing Modality-Specific Models for Omni-Modal Embedding


200. A Universal Dense Football Event Representation Based on TabTransformer


201. Brain-Prompt Injection: A Route-Safety Audit for BCI-LLM Agents


202. Internalizing Geometric Law: Learning from Solver Residuals for Precision-Critical Generation


203. Physics-Guided Sequence-Based Generative Framework for Acoustic Metamaterial Inverse Design


204. BSTabDiff: Block-Subunit Diffusion Priors for High-Dimensional Tabular Data Generation


205. Proposal Refinement for Few-Shot Object Detection


206. EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video


207. Self-Paced Curriculum Reinforcement Learning for Autonomous Superbike Racing in Simulation


208. End-to-End Training for Discrete Token LLM based TTS System


209. Trustworthy Smart Fabs via Professional Proxies: Scaling Safe and Sustainable by Design (SSbD) through Industrial Data Spaces


210. Resource-aware Computation-Communication Overlap for multi-GPU ML Workloads


211. Pretrained, Frozen, Still Leaking: Auditing Cross-Encoder Attribute Transfer in EEG Foundation Models


212. Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis


213. CANS: Accelerating Multiuser Collaborative Edge Inference via Cooperative Autodidactic NeuroSurgeon


214. Crop Recommendation and Agricultural Query Answering System Using Spatio-Temporal Graph Neural Networks and Hybrid Retrieval Augmentation


215. Unified Energy for Invariant and Independent Decoding in Diffusion Language Models


216. SEF-CLGC at SemEval-2026 Task 11: Logical Notation Impact on Language Model Performance


217. Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models


218. Steganography Without Modification: Hidden Communication via LLM Seeds


219. From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs


220. Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges


221. An Enhanced Geometric-Spectral Feature Learning Framework for Airborne Multispectral Point Cloud Classification


222. Autonomous Incident Resolution at Hyperscale: An Agentic AI Architecture for Network Operations


223. Optimizing Energy-based Neural Network Training with Coherent Ising Machine


224. Hybridizing Equilibrium Propagation with Ising Machines for Efficient Energy-Based Learning


225. Addressing Market Regime Changes and Heavy-Tailed Returns in Portfolio Optimization via Bayesian VAR and Elliptical Black-Litterman


226. Context Rot in AI-Assisted Software Development: Repurposing Documentation Consistency for AI Configuration Artifacts


227. Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps


228. FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention


229. A Unifying Lens on Reward Uncertainty in RLHF


230. OnlyDense: Reduced-Order Modeling for Lagrangian simulation


231. See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding


232. Stage-1 Controls the Entropy Regime, Not the Outcome


233. INFUSER: Influence-Guided Self-Evolution Improves Reasoning


234. BareWave: Waveform-Native Flow-Matching Text-to-Speech


235. TRIAGE: Dialectical Reasoning for Explainable Risk Prediction on Irregularly Sampled Medical Time Series with LLMs


236. ATM: Action-Consistency Transfer Matrix for Diagnosing and Improving Latent World Models


237. SafeRun: Enabling Determinism in LLM Planning for Running


238. TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech


239. Understanding Quantization-Aware Training: Gradients at Quantized Weights Bias to the Low-Loss Basin


240. Sustainability and Artificial Intelligence: Necessary, Challenging, and Promising Intersections


241. SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning


242. CARE: A Conformal Safety Layer for Medical Summarization


243. Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops


244. NutriMLLM: Multimodal Large Language Models for Dietary Micronutrient Analysis


245. PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus


246. Report on CHIIR 2026 Workshop on Generative AI and Academic Search (GAI&AS)


247. PAI: Preserving Amplitude Information in Representation-Based Time-Series Anomaly Detection


248. From Statute to Control Flow: Span-Grounded Deontic Trees for Defeasible Scope Parsing


249. PolyBuild: An End-to-End Method for Polygonal Building Contour Extraction from High-Resolution Remote Sensing Images


250. Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection


251. Few-shot Class-variable Incremental Audio Classification via Prototype Adaptation and Pseudo Class-variable Training


252. A multi-agent system for spine MRI report generation from multi-sequence imaging


253. Cheap Reward Hacking Detection


254. Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis


255. Intelligent Character Recognition of Handwritten Forms with Deep Neural Networks


256. sGPO: Trading Inference FLOPs for Training Efficiency in RLVR


257. Intrinsic Selection and Particle Resampling for Inference-Time Scaling Beyond Domain Verifiability


258. BLM-SGAN: Bidirectional Language Modeling for Semantic-Spatial Text-to-Image Generation


259. Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors


260. Governance Controls for AI-Generated Test Artifacts in Autonomous Software Testing


261. Scaling Decision-Focused Learning to Large Problems with Lagrangian Decomposition


262. AI-Augmented Closed-Loop Quality Engineering: A Reference Architecture for Continuous Software Quality Intelligence


263. Evaluating AI Investment Strategies


264. How Many Counterfactuals Does It Take? Probing VLM Hallucinations Through Circuits and Causal Effects


265. Unifying Object-Centric World Models and Diffusion Policy: A Hierarchical Framework for Multi-Stage Robotic Tasks


266. TeamHerald@CHIPSAL 2026: Hate Speech Detection and Sentiment Analysis of Nepali Memes using Transformer-based Architectures and Ensemble Learning


267. RadOT-Eval: Auditable Structured-Evidence Transport for Radiology Report Evaluation


268. APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing


269. Deep Active Re-Labeling: Toward Noise-Resilient Annotation Efficiency


270. Hybrid Neural Network and Conventional Controller Approach for Robust Control of Highly Unstable Systems: Application to Tilt-Rotor Control


271. SNR-ST-Mix: Sample-specific Neighborhood Regression Mixup for Augmented Spatial Transcriptomics Imputation with Deep Neural Network


272. Structuring agentic AI for HPC code modernization


273. Agentic Search for Counterfactual Recourse under Fixed LLM Budgets


274. Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation


275. Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks


276. BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension


277. Data Agents Under Attack: Vulnerabilities in LLM-Driven Analytical Systems


278. Latent Diffusion Policy: Shaping Latent Spaces for Diffusion-Based Robotic Manipulation


279. FiberTune: Preserving Action-Fiber Visual Residuals in Vision-Language-Action Fine-Tuning


280. Reconstructing Synthetic SDO/AIA 193 A EUV Images from He I 10830 A Observations with Diffusion Model Translator


281. Sample-Efficient LLM-Based Detection of Malicious Web Server Logs with Forensically Explainable Reasoning


282. A retrieval conditioned rebinding circuit for dynamic entity tracking in large language models


283. Tyan-WP: A Wind Power Foundation Model for Ultra-Short-Term Probabilistic Forecasting


284. HARBOR: A Harness Framework for Agentic Robot Reinforcement Learning


285. Reinforcement Learning for Flow-Matching Policies with Density Transport


286. Auditable Graph-Guided Root Cause Analysis for Kubernetes Incidents


287. Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models


288. EinSort: Sorting is All We Need for Tensorizing LLM


289. When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA


290. GEAR-VLA: Learning Geometry-Aware Action Representations for Generalizable Robotic Manipulation


291. ActProbe: Action-Space Probe for Early Failure Detection of Generative Robot Policies


292. Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey


293. Seeing is Believing: Aligning Prompt Rewriting with Visual Anchors for Text-to-Image Generation


294. STELLAR: Spatio-Temporal Environmental Learning with Latent Alignment and Refinement for Long-Tailed Species Distribution Modeling


295. PIPE-Cypher: Automatic Enterprise Benchmark Generation for Text-to-Cypher Systems


296. Adaptive Loss Balancing for Noise-Robust GRPO in Generative Recommendation


297. FlashCP: Load-Balanced Communication-Efficient Context Parallelism for LLM Training


298. More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs


299. The Confidence Trap: Calibration Attacks for Graph Neural Networks


300. Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models


301. Not Just After One: Sleep-Inspired Replay Prevents Catastrophic Forgetting After Sequential Tasks


302. Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models


303. Segment-level Tree Search for Long Meeting Document Summarization


304. AI Code Sandboxes: A Comparative Security Study. Part 1 of 2 – Engine-Level Properties (Attack Surface, Leakage, Stackability, CVE History, Patch Cadence, Fuzzing)


305. Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics


306. CoVEBench: Can Video Editing Models Handle Complex Instructions?


307. PACT: Self-Evolving Physical Safety Alignment for Diffusion Policies in Embodied Manipulation


308. Provably Efficient Personalized Multi-Objective Bandits with Proactive Conversational Queries


309. TimpaTeks: Automatic In-place Text Sequence Modification via Diffusion Language Model Steering


310. Hiding in Plain Floats: Steganographic Carriers for Indirect Prompt and Content Injection


311. SceneConductor: 3D Scene Generation from Single Image with Multi-Agent Orchestration


312. Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses


313. STAR-KV: Low-Rank KV Cache Compression via Soft Thresholding for Adaptive Rank Control


314. Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard


315. RiskNet: A large-scale dataset of AI risk incidents from news with alignment and multi-dimensional annotations


316. An Information-Theoretic Definition for Open-Ended Learning


317. Emergence World: A Platform for Evaluating Long-Horizon Multi-Agent Autonomy


318. Pre-Intervention Prediction of Sparse Autoencoder Steering Side Effects


319. Self-Supervised Vision Transformers for CBCT-Based Detection of Temporomandibular Joint Osteoarthritis


320. Generative Frontier Planning for Adaptive Peer-Referral Recruitment under Covariate-Dependent Arrivals


321. Chiaroscuro Attention: Spending Compute in the Dark


322. Set-Based Transformer for Atmospheric Compensation in Standoff LWIR Hyperspectral Imaging


323. “So There’s a Catch-22 Here”: How Early Adopters Who Build Multi-Agent LLM Systems Conceptualize Transparency


324. Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures


325. AgriGov: A Structured Multilingual Dataset Curation for Indian Government Schemes for Farmers


326. An AI Security Agent for University ACMIS: Multi-Vector Threat Detection and Automated Response


327. Post-AGI Economies: Superposition and the Second Fundamental Theorem of Welfare Economics


328. Contemporary AI lacks the imagination to diverge or negate in science


329. AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals


330. How Deep Are Deep GPs, Really? A Sharp Threshold and a Non-Gaussian Limit for Compositional GPs


331. Beyond Additivity: Causal Discovery in Location-Scale Noise Models with Hidden Variables


332. GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models


333. Frequency-Domain Latent Attention Gating for Cross-Domain Token Aggregation


334. The Governance of Human-LLM Interaction: Safety Gating, Civility Steering, and Affective Default Lock-In


335. CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning


336. Closing the Sim-to-Real Gap: An Evaluation Framework for Autonomous Cyber Defense Configuration of Commercial EDR


337. Explaining Data Mixing Scaling Laws


338. Constrained Paraphrase Consistency for LLM Hallucination Detection


339. RAPID: Layer-Wise Redundancy-Aware Pruning and Importance-Driven Token Merging for Efficient ViT


340. LogNEO: A GPT-Neo Reinforcement Learning Framework for Accurate Real-Time Log Anomaly Detection


341. LCAM: A Framework for Diagnosing Interactional Alignment Failures in Con-versational AI


342. Human-Centered Benchmarking of Driver Monitoring Models


343. Ego-Pi: VLA Fine-Tuning for Ego-Centric Human and Robot Data


344. Continual Quadruped Robots Coordination via Semantic Skill Discovery


345. vla.cpp: A Unified Inference Runtime for Vision-Language-Action Models


346. Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method


347. Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions


348. “I understand your perspective”: LLM Persuasion and Sycophancy through the Lens of Communicative Action Theory


349. Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?


350. EgoAERO: Learning Dexterous Manipulation from a Single Egocentric Video without Object Assets


351. What’s the Point? Spatial Grammar & Index Resolution for Sign Language Processing


352. When Behavioral Safety Evaluation Fails: A Representation-Level Perspective


353. SafeECGMatch: Calibration-Aware Joint Frequency and Time Space Semi-Supervised Learning for Open-Set ECG Classification


354. GIScholarBench: Benchmarking LLM Overconfidence in GIS Research


355. Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems


356. Voting Protocols as Coordination Mechanisms for Role-Constrained Multi-Agent Tutoring Systems


357. CausShield: Sample Reconstruction-Resilient Vertical FL via Causal Representation Learning


358. Semantic Quorum Assurance: Collective Certification for Non-Deterministic AI Infrastructure


359. Repair Before Veto, When Repair Is Hidden: Quantum-Accessible Features for Repair-Augmented Constraint Learning


360. IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment


361. GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence


362. Rewrite to Translate, Translate to Reward: Reinforcement Learning for Source Rewriting in Machine Translation


363. Summarization is Not Dead Yet


364. Enhancing AI Interpretability and Safety through Localised Architectures


365. MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models


366. PRISM: PRior-guided Imagination Sampling in world Models


367. Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks


368. Neutrality Bites: Gender Representation in AI-Generated Animal Stories


369. RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks


370. Minibatch Selection via Partition Matroid Constrained Gradient Matching


371. From May' to Is’: Certainty Distortion in Language Model Rewriting


372. POISE: Position-Aware Undetectable Skill Injection on LLM Agents


373. Illusions of the Gold Standard: A Large-scale Analysis of Human Evaluation Protocols for Long-form Text Generation


374. Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation


375. Larch: Learned Query Optimization for Semantic Predicates


376. 3D Oral Modelling with Improved Vertex Distribution Using Matching-Based Learning


377. Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories


378. The Cross-Architecture Substrate: A Domain-Transcendent, Calibration-Surviving Geometric Invariant of Modern Vision Encoders


379. Instrumented data for causal scientific machine learning


380. The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models


381. Model Multiplicity for Adversarial Detection in Small Language Model Training on Edge Devices


382. Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese


383. Cost-Aware Speculative Execution for LLM-Agent Workflows: An Integrated Five-Dimension Method


384. Does Persona Make LLMs K-pop Fans? A Pilot Study of LLM-Based Online Concert Audience Agents


385. Agentic multi-fidelity learning of quasiparticle and excitonic properties


386. Cherry-pick Override: Unsafe Directional Commitment in LLM Judges under Mixed Evidence


387. Beyond Pass/Fail: Using Process Mining to Understand How LLMs Resist (and Fail) Red Team Attacks


388. Jas: AI-Paired Engineering as a Revival of N-Version Programming


389. The ACUTE Protocol: Operationalizing Language Model Activations for Better Calibration, Utility, and Trust


390. SLMJury: Can Small Language Models Judge as Well as Large Ones?


391. Memetic Capture: A Pluralistic Policy Framework for Governing AI-Driven Cultural Disempowerment


392. Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model


393. Quantum-Enhanced Similarity Measures for Polarimetric Materials Classification


394. Multi-planar 2D-U-Net Segmentation of 3D-CT Abdominal Organs augmented by Spatial Occurrence Maps


395. SHIELD-IDS: Structurally Heterogeneous Ensemble with Integrated Layered Defense for Intrusion Detection Systems


396. Beyond Accuracy: Interpreting Topic Representation in Suicide Ideation Detection Models


397. Attention at the Theoretical Minimum: A Mathematics of Arrays Framework for Memory-Optimal Transformer Kernels


398. MatMind: A Structure-Activity Knowledge-Driven Generative Foundation Model for Materials Science


399. Rosetta Memory: Adaptive Memory for Cross-LLM Agents


400. WhiFlash: Accelerating Speculative Decoding with Token-Level Cross-Paradigm Routing


401. Cross-View Urban Traffic Dataset: Drone-Supervised Ground Truth for Monocular Bird’s-Eye View Localization


402. MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models


403. SAW: Stage-Aware Dynamic Weighting for Multi-Objective Reinforcement Learning in Large Language Models


404. FunctionEvolve: Structure-Guided Symbolic Regression with LLMs


405. How Much Dense Attention is Necessary? Oracle-Guided Sparse Prefill for Full/GQA Layers in Hybrid Long-Context Models


406. EvoCSFL: Surrogate-Assisted Evolutionary Client Selection for Efficient and Robust Federated Learning


407. EssentialGIN: a new approach for gene essentiality prediction based on graph isomorphism neural networks


408. Pharmacogenomic Knowledge Graph Augmentation for Graph Neural Network-Based Drug-Drug Interaction Prediction


409. TianJi-Environ: An Autonomous AI Scientist for Atmospheric Environmental Research


410. Adversarial Robustness of Activation Steering in Large Language Models


411. DSFNet: Learning Dual-Domain Spectral Operators for Multi-Modality Spatio-Temporal Forecasting in Urban Transportation Systems


412. BCG-FM: A Foundation Model for Ambient Cardiac Health Sensing


413. HARP: Efficient Data Selection for Finetuning Large Language Models


414. TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation


415. What Makes Video World Model Latents Action-Relevant: Prediction over Reconstruction


416. Knowledge-Inclusive Adaptive Physics-Informed Neural Network for Microbial Interaction Modelling


417. Test-Time Adaptive Composition for Machine Learning as a Service (MLaaS) in IoT Environments


418. Semantic Cache Distillation: Efficient State Transfer via Reuse and Selective Patching


419. SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?


420. Systematic LLM Translation of Legacy Scientific Code to Differentiable Frameworks: Application to a Land Surface Model


421. DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment


422. Single-Cell Cross-Modal Transfer by Adversarial Fine-Tuning of Foundation Models


423. A Hierarchical Feature Engineering Framework for Automated Classification of Phonotraumatic and Non-Phonotraumatic Vocal Hyperfunction


424. Liquid Neural Networks as a Drop-in Continuous-Time Deformation Field for Dynamic 3D Gaussian Splatting


425. MemoVAD: Resource-Efficient Video Anomaly Detection via Dynamic Semantic Memory in Edge Computing Scenarios


426. AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference


427. Seq103: A Unified Neuroevolution Framework for Compact Sequence Architecture Discovery


428. MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework


429. A Dataset for Dynamic Human Preferences for Vision Language Models


430. ViMax: Agentic Video Generation


431. AQIFormer: A Transformer-Based Multi-View Architecture for Cross-City Air Quality Classification


432. DOME: Learning Transferable Domain Variables from Sparse Supervision for Test-Time Adaptation


433. FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction


434. AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs


435. No Free Lunch for Synthetic Images under Data Scarcity Conditions


436. MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention


437. Anchor-Conditioned Compositional Control for Landscape Image Generation


438. NeuroAlign: Hierarchical Multimodal Fusion of Dynamic and Structural Neuroimaging for MCI Analysis


439. AMN: An Adaptive Multi-Scale Fusion Network with Boundary and Uncertainty Modeling for Nuclei Segmentation


440. Trait-space Monitoring for Emergent Misalignment During Supervised Finetuning


441. Active Learning with Foundation Model Priors: Efficient Learning under Class Imbalance


442. Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences


443. Eyes All Around: Design and Analysis of 360-Degree LiDAR Perception Using Equivariant Feature Learning in Unstructured Traffic


444. HASA: Subnet Allocation for Compute-Constrained Model-Heterogeneous Federated Learning


445. SENTRY: Statistical Reliability Analysis of Vision Transformers Under Soft Errors


446. ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization


447. Query Lens: Interpreting Sparse Key-Value Features with Indirect Effects


448. Item Response Scaling Laws: A Measurement Theory Approach for Efficient and Generalizable Neural Scaling Estimation


449. Structured Neuron Pruning in Deep Neural Networks Using Multi-Armed Bandits



451. Position: Anthropomorphic Misalignment Research Needs Stronger Evidence


452. MIRAGE: Metadata-Integrated Repository Analysis and Guided Enhancement for MSR Datasets


453. LEAF: Growing Trees Without Branching for Speech-Aware Large Language Model Post-Training


454. Subtitle-Aligned Fine-Tuning of Whisper for Swiss German ASR: Benchmark Contamination, Convention Mismatch, and an Honest Baseline at 25.6% WER (13.8% cWER)


455. SRT: Super-Resolution for Time Series via Disentangled Rectified Flow


456. Contribution Weights: A Geometrical Analysis of Self-Attention Transformers


457. MetaEvo: A Meta-Optimization Framework for Experience-Driven Agent Evolution


458. Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning


459. LFNO: Bridging Laplace and Fourier via Transient-Steady Decomposition


460. Reachability and asymptotics of Gaussian Transformer dynamics


461. DiffoR: A Unified Continuous Generative Framework for Universal Ordinal Regression


462. A Topological Characterization of Graph Neural Networks via Stochastic Block Model Embeddings on the n-Sphere


463. Repetition Mismatch: Why Data Mixture Experiments Don’t Scale and How to Fix Them


464. VisualLeakBench: Reproducible Action-Boundary Propagation Failures in Vision-Language Agents


465. A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers


466. ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research


467. SlideCheck: Guiding Self-Supervised Pretraining of Pathology Foundation Models via Dataset Distributions


468. From Human Guidance to Autonomy: Agent Skill System for End-to-End LLM Deployment on Spatial NPUs


469. Multimodal Group Emotion Recognition In-the-Wild Towards a Privacy-Safe Non-Individual Approach


470. Outage Detection in Self-Healing Smart Grids Using Reinforcement Learning with Spectral Graph Neural Networks


471. Customer Churn Prediction on Structured Data Using FT-Transformer and Stacking Ensembles


472. Training-Inference Kernel Contracts: Bounding Divergence in Post-Training and Deployment


473. Accelerating Birkhoff Projection for Manifold-Constrained Hyper-Connections


474. Enabling KV Caching of Shared Prefix for Diffusion Language Models


475. A Systematic Study of Behavioral Cloning for Scientific Data Annotation


476. SurfDesign: Effective Protein Design on Molecular Surfaces


477. Considerations for an Integrated Detector Design at FCC-ee: A Human-AI Exploration


478. Emergence via Phase Transitions: Mechanism Landscapes and Universal Convergence Across Complex Systems


479. The Montparnasse Algorithm for RNA Design


480. Phantom transitions in language model fine-tuning


481. Page image classifier fine-tuned on century-spanning archives of scanned documents for further content-specific processing


482. Selecting New Measurement Locations to Diversify Traffic-Pattern Coverage: A Real-World Evaluation for Total Traffic Volume Estimation


483. MedicalRec: Medical recommender system for image classification without retraining


484. Symbolic Reasoning Frameworks Modulate LLM Risk Aversion in Multi-Agent Strategic Settings


485. Offline Reinforcement Learning for Plasma Control in Nuclear Fusion: Codebase and Benchmark


486. Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA


487. Liberating LLM Capabilities in Full-Duplex Speech Models


488. Beyond Item IDs: Scaling Short-Form-Video Recommendation via Semantic-Native Long Sequence Modeling


489. AI-Integrated Learning Management System for Middle School: A Longitudinal Study of Learning Outcomes Through High School and Beyond


490. Concerns and Strategic Responses of Older Workers Navigating Generative AI in Bridge Employment


491. DIYHealth Suite: Dataset, Model, and Benchmark for Health Management at Home


492. Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation


493. Bidirectional Semantic Complementary Tool Retrieval for Remote Sensing Agents


494. Beware of GeeksBearing Gifts: Building True EU Frontier AI Sovereignty


495. Bridging Traditional Explainability Methods and Multimodal Multilingual Models: An XAI-Based Analysis


496. Principled Agent Debate: Adversarial Arbitration for Sycophancy Reduction in Large Language Models


497. mllm-shap: A Shapley Value Explainability Platform for Text-Audio Multimodal Large Language Models


498. CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models


499. BEACON: Behavioral Entropy Aggregation for Cross-Model Hallucination Detection in Large Language Models


500. Post-training is (Massive) Supervised Learning