전체 AI 논문 - 2026-08-05

1. ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning


2. Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations


3. Interpretable Adaptive Sampling for LLM Test-Time Scaling


4. A game theory for foundation models shows new paths to rational cooperation through similarity inference


5. TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring


6. The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections


7. Implementing Causal Perception: Competing SCMs and Situated Fairness


8. Socially Grounded Agentic AI: Coordinating Plural Perspectives through Social Theory


9. When Efficiency Becomes Fragility: Exploiting Dynamic Routing Vulnerabilities in Adaptive UAV Tracking


10. Intertemporal Preference Steering in Qwen3 via Contrastive Activation Addition


11. ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?


12. ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Industrial LLM Advisories


13. MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents


14. Oilbird: Training-Free Speculative Decoding with Keys the Verifier Already Computes


15. LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards


16. Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation


17. KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation


18. Computing Actual Causes for Neural Network Predictions under Structured Causal Inputs


19. GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks


20. Risky Business: Measuring The Faithfulness-Safety Tension


21. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems


22. MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models


23. AgenticECO: An Agentic Framework for ECO on 3D Integrated Circuits


24. Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement


25. CARE-Bench: Benchmarking Patient-Facing LLM Triage


26. SAT-Edge-Agent: Hardware-in-the-Loop Edge-Agent Orchestration for Onboard Satellite Intelligence


27. When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Coupling Diagnostic for Machine Collectives


28. Less Traffic, Better Outcomes: Competition-Aware Request Dispatch in Real-Time Ad Exchanges


29. TARL: Transaction-Aware Reliable Ledgers for Executable Memory Management in Long-Term Agents


30. LiveEvalBench: Toward Open-World Evaluation for Web Generation


31. PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud


32. Shielding for Higher-Order Safety


33. Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training


34. AutoSND: From Execution Evidence to Structural Policies for Automated Network Dismantling Heuristic Discovery


35. Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details


36. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation


37. Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bound and a Test on a Real Pretrained Model


38. Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection


39. Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations


40. Formal Verification of Agentic Systems over Operational Data


41. Learning Clinical-Trial Strategy: Offline Policy Training for Decision Agents


42. FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation


43. Large language models for partial differential equation workflows


44. FOUND-AF: Benchmarking ECG Foundation Models for Atrial Fibrillation Detection


45. From Social Coding to Agentic Coding: Productivity and Relational Reconfiguration in Open-Source Communities


46. Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Universities and Business Schools


47. Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities


48. Enhancing Tabular Learners with Context-Aware Semantic Embeddings


49. Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve


50. Behaviorally Adaptive Visual Diversion for Inclusive and Resilient Digital Assessment Delivery


51. Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS


52. Reversing Arrows in Large Language Models


53. When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs


54. Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks


55. Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design


56. WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks


57. ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning


58. When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO


59. ChartAnno: Evaluating MLLMs for Chart Annotation Generation


60. LeanMem: Simple and Efficient Long-Term Memory for LLM Agents


61. Solver-Aware Decompositions for Programming-by-Example: When Dividing Requires Knowing how to Conquer


62. LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models


63. DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces


64. State Propagation Also Satisfies: A Complex-Valued State-Space Model for Deterministic State Tracking


65. Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory


66. AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction


67. Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems


68. Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance


69. MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc


70. Traceable Multi-Agent System for Knowledge-Based Forecasting


71. Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving


72. Screenshots or Tools? Eliciting Tool Use and Managing Multimodal Context in Hybrid GUI-MCP Computer-Use Agents


73. SeaSlides: Semantic Abstraction Layer for Agentic Slide Generation


74. Distractor-Aware Truncation: Disentangling Context-Length Effects from Signal Loss in Long-Context LLM Benchmarks


75. DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning


76. AgentPanel: Toward a New Paradigm for Human–AI Collaboration in Exploring Scientific Questions


77. TaskPress: Query-Agnostic KV Cache Compression via Task-Guided Pruning


78. One Knob to Rule Them All: A Unified Optimal Transport View of Cold-Start Active Learning


79. UniNav: A Unified World-Action Diffusion Model for Visual Navigation


80. Reachability Is Not Realization: Tracing the Sources of LLM Benchmark Gains


81. The Agent Operating System (AOS): A Reference Operating Architecture for Distributed Agentic Systems


82. When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models


83. TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology


84. Diversity is Not Ambiguity: Toward Accurate and Efficient Ambiguity Detection for Open-Domain QA


85. Surrogate Substitution Preserves PHI Detectability: A Multi-Detector Equivalence Study


86. Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation


87. Evidence-Grounded Multimodal Knowledge Graph Construction for Multi-Lecture Educational Reasoning


88. UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval


89. Spatial proteomics guided by H&E-based AI reveals recurrence-risk niches in triple-negative breast cancer


90. Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents



92. Don’t Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR


93. AI Agent Economics: Can Autonomous Economic Behavior Emerge among AI Agents under Minimal External Conditions?


94. Getting the Parameters Right: A Difficulty-Graded Benchmark and Probe-Guided Training for LLM Tool Calls


95. TraceCAD: Trace-Guided Repair for Agentic CAD Generation


96. CastFSR: A Fast–Slow–Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting


97. Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning


98. DiffImaginE: Imagine to Verify Entity Types with Diffusio


99. LoCA: Forward-Only LLM Tuning after One-Shot Calibration with Local Credit Assignment


100. UrbanAgent: A Tool-Augmented Agent for Cross-System Urban Tasks


101. ProPRL: Property-Aware Prerequisite Relation Learning in Educational Knowledge Graphs


102. On the missing benchmarks layer and a potential solution


103. Neurosymbolic Reasoning with Incremental Knowledge for Sample Efficient Hierarchical Reinforcement Learning


104. On the missing data layer and a potential solution


105. When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning


106. Hypercubes, Hyperplanes, and Constraint-Induced Complexity Collapse in Atomic Concept Learning


107. Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes


108. VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space


109. BAP-SQL: Budget-Aware Observation Planning for Agentic Text-to-SQL


110. Towards a new paradigm of scientific discovery with socialized artificial intelligence


111. Predictive Set Theory: A Generative Framework for Cognitive Architecture with Operationalized Core Mechanisms


112. Explainable AI for the EU Right to Explanation: A Systematic Review of the Law-XAI Translation Gap


113. HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents


114. PULSE: An Executable Contract Language for Spatiotemporal Knowledge Graph Engineering


115. Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling


116. Self-Organising Digital Circuits


117. ISEE: Interactive Semantic Enrichment for Database Fields


118. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning


119. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility


120. Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss?


121. Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent


122. Separating quantum circuits from classical LLMs


123. Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility


124. PRISM: Powerful Time Series to Image (TS2I) Representations for Multivariate Anomaly Detection


125. Equivariant Music Transformer


126. When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding


127. CARE-X: Towards Clinically Useful Radiology VLMs with Auxiliary Supervision, Reward-Aligned Learning, and Tool-Augmented Measurement


128. MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning


129. Enhancing VLM Reward Models Through Structure-Aware Fine-Tuning


130. GENESIS: Towards Explainable Causal Discovery


131. SciRet: A Compute-Aware Empirical Study of Retrieval and Reranking for Scientific RAG


132. Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking


133. FlowForm: Synergizing Fluid Physics with Topological Consistency for Satellite Flood Synthesis


134. UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space


135. VIBE: A VAD-Informed Benchmark for Entity-Centered Affective Profiling of Large Language Model Outputs


136. Autoreflection: How Agentic Strange Loops Turn Human Culture into AI Infrastructure


137. Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss


138. Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks


139. MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models


140. Can LLMs Test Terminal User Interfaces?


141. AI-Based Sound Effect Generation: A Narrative Review of Generative Models Across Input Modalities


142. GPTKB 2.0: Direct Construction of Disambiguated Knowledge Bases from Large Language Models


143. LiLa-WAM: Lightweight Latent Reasoning World-Action Model for Robotic Manipulation


144. Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation


145. How Closely Do LLM Reviews Align with Human Peer Review?


146. Decoupling Generation and Selection for Budget-Constrained Faithful Summarization


147. MuEvo: LLM-Driven Evolution of Multi-Heuristic Ensemble


148. A Security-Oriented Lifecycle Model for Large Language Model Systems


149. A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Block Theory and Synthetic Validation


150. DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction


151. GenOS: Compositional Certificates for Semantic Robustness in AI Code Generation


152. AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality


153. Pin Once, Swap Light: Subspace-Aligned Centroid-Residual Training for Efficient Ultra-LoRA Serving


154. Training Documents Reranker with Search Rubrics for Deep Research Agent


155. Pivot-Centric Trajectory Prediction: Bridging Long Horizons via Dynamical Guidance


156. AI Forensics Across White-, Grey-, and Black-Box Access: A Process Model and Research Agenda for Post-Incident Investigation of AI Systems


157. How Many Labels Are Enough? ALDA: Active Learning Deployment Advisor for Medical Image Classification


158. ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels


159. Principles of Robot Autonomy


160. Leveraging System-Level Observations to Inform Bayesian Learning of Model Parameters for Quantitative Verification


161. Continue or Replan? Bernoulli-Continuation Policy Learning for Adaptive Horizon Execution


162. Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition


163. Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs


164. Approximate Speculative Decoding


165. A Low-Cost Hybrid Reservoir Computing Model for Isolated Sign Language Video Recognition


166. OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet


167. Multi-Task Multi-Frame Visual Piano Transcription


168. Distilled Roads: Generalisable Road Network Extraction Across Sensors, Resolutions, and Region


169. Shorter Reasoning, Earlier Answers? An Evaluation of Reasoning Interfaces


170. Shaping Wind-Tunnel Airflow for Unmanned Aerial Vehicles using Online Learning


171. FACTWASH: Catching AI Rewrites That Wash Hearsay into Fact


172. The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk


173. When Oracle Conditioning Misleads Deployment: Conditioning-Availability Bias in Echocardiographic Segmentation


174. Route-Align-Verify for Functional Correctness in Code Generation


175. Evaluating LLM Trade-offs for Enterprise Automation: Lessons from Workflow Generation in a Production Enterprise Platform


176. The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics


177. Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates


178. GUI-Lens: Coarse-to-Fine Cropping for GUI Grounding with General-Purpose VLMs


179. Efficient Video Dataset Distillation via Cluster-Guided Prototype Blending


180. The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked ignition, and the interface-constituted commit in a recurrent-depth reasoner


181. FinVerse: Financial Time-Series Benchmark


182. From Wearable Data to Personalized and Actionable Health Insights


183. Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking


184. Agentic Reinforcement Learning with Self-Distilled Reward Shaping


185. Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks


186. Self-Supervised Representation-Guided Generative Dataset Distillation


187. GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model


188. EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners


189. Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach


190. Attribute-based Undetectable Watermarking for Generative AI Models


191. EFX Allocation In (Multi)Hypergraphs


192. Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation


193. Minimax-Optimal Semiparametric Contextual Dynamic Pricing with Multimodal Revenue


194. Internalizing Academic Writing Workflows for Introduction Generation via Struct-Aware Policy Learning


195. Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds


196. DigitCode: Symbolic Tokenization of Hand Motion by Anatomical Units


197. Trajectory-Guided Forget-Recover Network for Continual LLM Unlearning


198. Optimal Liability Design for Medical AI


199. Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models


200. A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces


201. FakeI2V-Bench: Benchmarking the Applicability of Image-level Deepfake Detectors for Deepfake Video Detection


202. SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation


203. SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation


204. CorePath: A Breast-Specialized Pathology Foundation Model for Core Needle Biopsy Diagnosis and Risk-Controlled Report Generation


205. AI Security Leaderboard: Methodology, Results and Minimal Standard


206. CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning


207. Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping


208. PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory


209. Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation


210. PLAN: Parallel Liquid-Inspired Approximation Network for Efficient Representation Learning in Flexible Job Shop Scheduling


211. LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs


212. PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning


213. Standalone DINOv3 for Training-Free Open-Vocabulary Semantic Segmentation in Remote Sensing


214. A Graph Signal Processing Perspective on Numerical Sequence Representations in LLM In-Context Learning


215. V-FIND: Revealing the Intrinsic Forgery Knowledge Encoded in Video Forgery Detectors


216. SparSEEty: Extracting Tokens from Sparsity-Exploiting LLM Serving Systems via Deterministic Side Channels


217. Internalising the Identity Primitive: Cryptographic Individuality for an Autonomous Agent on a Public Blockchain


218. TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation


219. HyperFL: Query-Adaptive Representation Learning for Software Fault Localization


220. Scaling an Autoregressive Transformer for Single-Cell Generation


221. ValueFormer: A Causal Transformer Value Function with Stage-Aware Labels for Semi-Autonomous Vision-Language-Action Policies


222. Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits


223. SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling


224. Rubrics as Privileged Information for Open-Ended Generation


225. When Should Graph Attention Be Sparse? Learning a Per-Edge Tsallis Index


226. Robust Counterfactual Policy Optimisation via Nondeterministic Causal Models


227. BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?


228. MutMem: Cryptographically Authorized Mutation in Persistent Agent Memory


229. CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning


230. In-Context Collapse in Vision-Language Models and How to Mitigate it?


231. Improved Quantum Algorithms for Reinforcement Learning Under a Generative Model


232. Evading Chain-of-Thought Monitoring Through Model Poisoning


233. Learning a Vector-Symbolic Model for Socio-Cultural Tasks


234. A Unified 2D Framework for DeepLesion Detection, Segmentation and Short Report Generation


235. SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology


236. A Hyperfinite Framework for Score-Based Generative Modeling


237. Privacy-Preserving AI Verification via Minimal Information Disclosure


238. Search, Inspect, Fetch: Exploiting Boolean Retrieval for Deep-Research Agents


239. Quo Vadis, World Modeling?


240. Don’t Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators


241. Designing a Good Virtual Node: Addressable and Cardinality-Preserving Global Memory for Message Passing Architectures


242. Can Training Logs Make Model Comparisons More Precise?


243. NANQ: Noise-Floor-Aware Mixed-Precision Non-Uniform Quantization for Analog Compute-in-Memory


244. Steganalysis of Adaptive Covert Collusion in Tool-Using Agent Populations: A Black-Box, Cross-Principal Approach


245. Measuring Explainer Stability via Attribution Separability


246. Output-Aware Rotation for INT2 KV-Cache Quantization


247. Learning Molecular Representations from Cellular Phenotypes with Structure Preservation


248. BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests


249. A Blind Spot in Alignment: Quantifying Biosecurity Risks in Large Language Models


250. $S^3$: Improving Agent Safety through Multi-Stage Defense


251. TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows


252. AI Sandbox: Technical Report


253. DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial


254. When Policies Change Probabilities: Modular Decision-Making for LLM Code Review


255. Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks


256. dots.tts.edit: Precisely Controlled Speech Editing with a Continuous Autoregressive Model


257. Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation


258. Permission Denied: Policy-Graded Evaluation of Coding Agents in Hardened Environments


259. Vulnerabilities, Secrets and Misconfiguration in the Highest-Exposure Docker Hub Images


260. Sphere Retraction Normalizations


261. Single Canonical Prompts Underestimate LLM Safety’s Surface-Form Sensitivity


262. ZK-SR117: A Chunked Zero-Knowledge Attestation Design for Aggregated Fair-Lending Metrics, with a Control Mapping toward Full SR 11-7 Coverage


263. CT-HEG: A Bidirectional, Timestamp-Attributed Event Graph for ICU In-Hospital Mortality Prediction - An Architectural Ablation Study


264. Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers


265. AI Alignment and Fiduciary Obligation


266. Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure


267. Secure AI Watermarking Framework for IP Protection in Multi-Tenant Cloud Platforms


268. Cross-Anesthetic ECoG State Decoding Fails at the Decision Threshold, Not the Representation


269. Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures


270. CUADebug: Diagnosing and Repairing Computer-Use Agent Failures


271. MDArena: Evaluating Coding Agents on Realistic Molecular Dynamics Workflows


272. IR2Solve: Structured Intermediate Representations for Cost-Efficient Optimization Autoformulation


273. Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation


274. Studying, Identifying, and Fixing Hidden Technical Debt in AI-Intensive Cyber-Physical Systems


275. Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds


276. Multimodal Auto-regressive Transformer Surrogate for Modeling Variable Operations and Quantifying Uncertainty in Geological Carbon Storage


277. Deep Divide-and-Reduce in Symbolic Regression


278. Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models



280. Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety


281. Evaluating OpenAI’s Privacy Filter: Cross-Lingual, Cross-Domain PII Detection Across 42 Benchmarks


282. OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning


283. MemArena: An Ego-Centric Benchmark for On-Device Agentic Personal Memory Assistants at Scale


284. KernelBrain: Coarse-to-Fine, Budget-Aware Search for Agentic GPU Kernel Optimization


285. UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations


286. GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement


287. StuPASE: Towards Low-Hallucination Studio-Quality Generative Speech Enhancement


288. PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement


289. Assessing speech quality metrics for evaluation of neural audio codecs under clean speech conditions



291. CLIP-EBC: CLIP Can Count Accurately through Enhanced Blockwise Classification


292. Multi-Camera Trajectory Forecasting with Trajectory Tensors