전체 AI 논문 - 2026-08-11

1. GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis


2. DSLE: A Learning Environment for Dark Souls Boss Encounters


3. SHE: Trajectory-driven Safety Harness Evolution for LLM Agents


4. ArchAgent v2: A Case Study with the Data Prefetching Championship


5. Towards Expert-level Medical AI for Real-time Video Consultations


6. Agentic Auto-Research is Fuzz Testing


7. CEAA: A Cognitive Embodied Agents Architecture for Interactive Computing Systems


8. Mismatch Matters: On-Policy Distillation Beyond Token Agreement


9. CARD: Controlled Agentic Reddit Discussions for Credit Card Simulation


10. AirFlow: Context Preserving and Multi-Rate State Modeling for Air Quality Forecasting


11. Second-Order Muon Done Right: A Principled Marriage of Spectral Geometry and Curvature


12. Matryoshka Language Model Suites


13. Model Discovery Agent: LLM-assisted Bayesian experiment design for data-efficient discovery of mechanistic world models


14. Adaptive Semantic Capacity Allocation for Parallel Generative Recommendation


15. Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models


16. Hallucination-Free GUI Grounding via Regression-Free Layout-Aware Matching


17. Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics


18. Rethinking Self-Evolving Agents: Do We Still Need Prescribed Optimization Pipelines?



20. From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization


21. ICM Out! Better Tournament Strategy from Computed Continuations, vs. Solvers and LLMs


22. CoRCi: Cross-Reconstruction of Coherent Interests Modeling in Cross-Domain Sequential Recommendation


23. ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization


24. The Politician, the Liar, and the Obedient Worker: Emerging Behavior of LLM Agents in Hierarchical Games


25. Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents


26. verdi: retrieval is not transfer for continual world model optimization


27. One Adapter Pair per Model: A Universal Activation Interface for Language Models


28. Renormalising Generative Models for Active Inference: Foundations, Derivations, and Verification


29. Capability Is Not Propensity: Measuring Pressure-Robust Cooperative Behavior in Civic LLM Agents


30. From Prompt to Harness: Coderlet from Scratch


31. Coupled Graph–Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity


32. Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models


33. KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models


34. OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks


35. CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits


36. LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling


37. Control-Oriented Scenario Tree Construction through Reinforcement Learning


38. GeoPhysAdapter: Scale-Matched Geophysical Adaptation for Cross-Domain Landslide Mapping with Vision Foundation Models


39. CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning


40. ASPaeroFlow: Decomposition Heuristics for Joint Air Traffic Flow & Capacity Management


41. Linearized 2-Simplicial Attention


42. CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation


43. ComboShoppingBench: Evaluating LLM Agents for Budget-Constrained Basket Shopping with Coupons


44. MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence


45. P$^{3}$: Joint Program-and-Proof Planning for Verified Code Generation


46. Entropy-based Code Adversarial Translation for Real-world Repository Migration


47. Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation


48. Business Truth, not SQL Accuracy: A Rule-Gated 7B Analytics Agent Outperforms a Direct-Prompted 32B Baseline


49. SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance


50. Emotion2Skill: Model-Internal Emotion Signals for Adaptive Skill Selection and Evolution


51. An Explainable GNN Framework for Component-Level Anomaly Diagnosis


52. SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge


53. Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models


54. CRUISE: Vision-Language Model-Guided Uncertainty-Aware Cross-Modal Sensor Fusion for Robust Autonomous Driving


55. Signature-Guided Capacity Occupancy for Dense Expert Merging



57. Agentic Router: An Execution-Grounded Continual Learning Approach With Memory


58. From Relevance to Execution Utility: Reward-Aware Dynamic Execution Gating for Skill-Based LLM Agents


59. CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment


60. TRACE: TRajectory Attribution for Automated Context Engineering


61. ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models


62. RISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement Learning


63. MELLON - Multimodal Enhanced LLM for Online Navigation


64. Motif 3: Technical Report


65. RAVEN-Eval: Rubric-Guided Automatic Evaluation for AI Video Generation Models Based on LMM Preference Judgement


66. Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models


67. Who Bridges Safety? Identifying and Targeting Cross-Lingual Shared Safety Pathways


68. A Multi-Scale Temporal Framework with Dynamic Fusion for EEG-Based Emotion Recognition


69. DualCert: A Solver for the Traveling Salesman Problem with Constraint-Coupled Learning


70. PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs


71. Context Is Not Authority: Structured Runtime Governance for Financial Market Agents


72. CoRe-UIE: Rethinking Coexisting and Region-wise Degradation for Underwater Image Enhancement


73. Reading is not Reasoning: Bridging the Agentic Policy Gap in Vision-Text Compression


74. Depth-Aware Implicit Neural Representation Priors for 3D Gravity Inversion


75. Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection


76. Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis


77. Decoding Phenotypes: A Framework for Fusing Genomic Language Models and Neuroimaging


78. From Manuals to Maintenance: Fine-Tuning MedGemma for Multi-Modal Imaging System Support in Low-Resource Settings


79. LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing


80. Full-bandwidth transformer


81. AquiLLM: An Architecture for Supporting Tacit Knowledge Capture in Research Groups


82. Theory-Guided Deception Detection: A RAG-Based Artificial Intelligence Exploration


83. Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents



85. Automated Generation of Complexity-Validated Decision Scenarios Using Large Language Models


86. Three Generations of Healthcare IT: From the Digital Record to the Computable Care Process


87. Improving Generalization Robustness of Multimodal RLVR


88. Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs


89. SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification


90. Scale-to-Dialogue: Low-Burden Elicitation of Daily Premenstrual Symptom Ratings with Small Language Models


91. FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models


92. AI Evaluation Should Measure Verification Cost, Not Correctness Alone


93. PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling


94. EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility


95. A Structural Dynamics Graph World Model: Unified Modeling, Constrained Rollout, and Interpretable Calibration


96. Branch2Skill: Efficient Skill Evolution Through Reasoning Trees


97. The Scaffolding Matters More Than the Interface: A Controlled Comparison of MCP and CLI Tool Use Across Seven Agent Scaffoldings, Five Language Models, and One Software Task


98. SkillReason: Reasoning-Enhanced Agent Skill Retrieval for Implicit User Requests


99. Smart Compaction: Predicting Compaction Utility from Lakehouse Table Metadata


100. Can Open-Weight Models Compete on Financial Text Comprehension?


101. A QUBO-Inspired Computational Framework for Airport Landside Bottleneck Diagnosis and Dynamic Dispatch Optimization


102. UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models


103. MedCalc-R1: Knowledge-Guided Reward Framework for Medical Mathematical Reasoning


104. Business Arena: Benchmarking LLM Agents in a Realistic Marketplace


105. Walking through Discussions: A Mobile Visual Analytics System for In-Situ Group Discussion Analysis


106. ForestBench: A Unified Graph Framework for Evaluating Multi-Agent Collaboration


107. Unaccountable Delegation, Fading Skills: Mapping the Risks of Workplace AI Agents


108. SDDBMs: Soft Denoising Diffusion Bridge Models


109. FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents


110. VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference


111. Deep probabilistic logic programming for diagnostic reasoning from incomplete information: A case study in stroke detection


112. Discovering Diverse Planning Policies for Multimodal Embodied Agents with Quality-Diversity Optimization


113. Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing


114. Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding


115. Understanding Calibration and Truncation Error Propagation in Training-Free Low-Rank Compression for LLMs


116. MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models


117. TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models


118. HoloAegis: Frozen Representation, Topological Inference: Minimally Parametric Safety Manifolds for Zero-Shot LLM Guardrails


119. Yesterday’s Shield, Today’s Spear: A Self-Evolving Safety Guardrail in Production


120. Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation


121. LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs


122. Hierarchical Self-Improvement: A Framework for Task-Specific Evolvable Agent Harnesses


123. What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files


124. TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation


125. Forgotten History or Test-of-Time? Retrospect and Prospect on RAG from an IR Perspective


126. Estimating Uncertainty in Galaxy Morphology Classification


127. CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception


128. Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents


129. LLMVisor: A Real-Time Latency Attribution Model for Multi-Tenant LLM Serving


130. StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning


131. Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning


132. Mitigating Over-Personalization in LLMs via Structured Memory


133. Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders


134. Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios


135. OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents


136. Your Prompt Is Not the Only Prompt: How Much Do LLMs Weight Structured-Output Schema Descriptions?


137. SuperLocalMemory 4.0: The Governed Memory Operating System for AI Agents


138. FemWear: A Specialized Wearable Foundation Model for Women’s Health


139. A Fair Objective for Human-Empowerment-Preserving AI: Desiderata, Design, and Likely Behavioral Consequences


140. LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems


141. Metanormative Theory for RL-Based Moral Agents


142. Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment


143. Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue


144. Persuasive and Compliant Tendencies Predict Group Decision-Making in Humans and Language Models


145. A Minimal $κ$–$τ$ Logic for Risk-Sensitive Abduction


146. Janus: An Algorithm-Evaluator Co-Evolution Framework for LLM-Driven Discovery under Expensive Evaluation Budgets


147. Quantization Degradation in Large Language Models: A Signal-Noise Perspective


148. Large Multimodal Agents for Intelligent Transportation Systems: Architectures, Evidence, and Deployment Challenges


149. Matching Supervision to the Student’s Learning Capacity: A Unified Framework for On-Policy Self-Distillation


150. Agentic AI-driven Immersive Simulation: A Knowledge-Aware Virtual Training Platform forHigh Dose Rate (HDR) Brachytherapy


151. When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs


152. A Unified Framework for Dynamic Reward Shaping in Reinforcement Learning


153. Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation


154. TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance


155. Improving Constraint Models with LLM Agents


156. Constraining ontology mappings using metaphysical choices


157. Neurosymbolic Discovery of Algebraic Graph Constructions


158. Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework


159. Generative Models: Principles, Architectures, and Applications


160. PATH: Next-Interval Prediction via Autoregressive Tree Hierarchy on Tabular Data


161. Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?


162. CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models


163. H2: A Dual Hybrid Semantic Data Lake Architecture for Medical Data Harmonization with Human-In-the-Loop verified, LLM Driven Metadata Annotation System


164. SodaMem: Evidence-Grounded Temporal Graph Memory for LLM Agents


165. JustLLMGRPO: Radiographic Control for Chest X-Ray Generation


166. Lingjing: A Simulation Testbed for Multi-Agent Embodied Tasks in Open-Ended Cities


167. SkillSmith: Enhancing Locally Deployed Agents via Automatic Skill Construction and Evolution


168. Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE


169. The Authority Expectancy Effect in Multi-User Conflict



171. Thought-Level Beam Search for Reasoning


172. VDGR-RAG: Vectors, Directories, Graphs, and Reflection Are All You Need for Unified Reasoning over Hierarchical Enterprise Knowledge


173. CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity


174. SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning


175. Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning


176. KGCache: Amortized Subgraph Retrieval for KG Reasoning with LLMs


177. Guixu: Valuation-Driven Data Discovery for Autonomous AI Agents with On-Chain Attestation


178. Directed Neuro-Symbolic Stochastic Execution for Verification of Distributed Parallel AI Programs


179. Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution


180. REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment


181. ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration


182. TongGuOCR: A Layout-Aware and Token-Augmented OCR Framework for Chinese Historical Documents


183. When Is Benchmark Contamination Detectable? Information Limits and Power-Calibrated Audits


184. GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning


185. TelemetrySuffBench: Is Agent Telemetry Sufficient for Failure-Origin Diagnosis?


186. Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills


187. GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering


188. SurgLAT: Surgical Latent Attention Tracking for Depth-Aware Robotic Laparoscope Control


189. Back to the Future: A workbook time machine for spread sheet creation benchmarks


190. Counterfactual Benchmarking and Training for Factuality Consistency and Order-Robust Grounded Reasoning in LLMs over Heterogeneous Knowledge


191. When the Judge Should Not Decide: Evidence-Locked, Non-Compensatory Selection Bounds LLM-Judge Failure in Reasoning Pipelines


192. CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift


193. CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR


194. Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space


195. The Capability Ladder: A Curriculum-Modernization Framework for Workforce Readiness in the AI Era


196. AndroidReality: How Far Are Mobile Agents from the Real World?


197. Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation


198. Adaptive Two-Level Allocation of a Conserved Capacity Budget Across Locations and Service Classes


199. QuantumMind: Constraint-Grounded Agentic Reasoning for Speedup Analysis in Quantum Computing



201. Towards Researcher Agents for Knowledge-Graph Question Answering


202. IntelliAudit: Using Large Language Models to Evaluate Audit Controls


203. An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography


204. Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution


205. Contextual Value Alignment via Multilayer Combinatorial Fusion


206. Agent-MD: Selective LLM Intervention with Event-Driven Escalation for Stateful GCMC–MD Campaigns


207. From Single Chatbots to Governed Agent Ecosystems: An Agentic AI Pattern Catalogue and Orchestration Framework for Mission-Critical Hospital Information Management Systems


208. Controlled Memory Interference in Continual LLM Agents


209. CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models


210. TeXFix-Bench: An Empirically Grounded Multi-Format Benchmark for LLM-Based Document Source Repair


211. The Field Knows: Cross-Dimensional Geometry from Navigation to Black Holes


212. An AI Scientist that Doesn’t Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop


213. TREAT: Evaluating Access to Formal Knowledge across Equivalent Mathematical Representations


214. When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains


215. MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents


216. Dynamic Coalition Formation and Communication Pricing in Skill-Based Agentic AI Systems


217. NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation


218. The Knowing-Saying Gap: When Probes See Errors that Confidence Misses


219. Training Variable Long Sequences with Data-Centric Parallel


220. Emotion in an active inference model of human driving


221. Determinization in Structure Theories: A Unified Framework via Closure, Comparability, and Joint Admissibility


222. Flow-by-Flow:Content-Judgment Bypass for Governing AI Output in High-Loss Domains


223. Towards an Argumentative Foundation for Evaluative AI


224. Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions


225. Multimodal Model Diffing for Feature Discovery and Control


226. From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch


227. Fusion Training for Mathematical Generalization in Large Language Models


228. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning


229. Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning


230. Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains


231. Stealing Reasoning Traces from Proprietary LLM APIs


232. Agentic Harnesses: LLM-Driven Verification Layers for Robot Autonomy


233. Multi-Agent AI Safety as an Institutional Design Problem


234. Distill Skills into Weights, Not Prompts: Abstract Skills as Privileged Signals for On-Policy Self-Distillation


235. MedPixel: A Unified Pixel-Language Model for Medical Reasoning and Segmentation


236. Parameter Exploration for RLVR via Variational Learning


237. Modern Backbones Improve Multi-task DETR for Mammography Classification and Lesion Localization


238. KGCaRe: Explainable Complex Conditional Question Answering using Automatic Knowledge Graph Construction and Context Retrieval with LLMs


239. Cultivar: A Contrastive and Locale-Oriented Translation Benchmark for Investigating Contamination and Localisation Robustness


240. MoNo: Multiscale Optimal Transport Neural Operator for Solving PDEs on General Geometries


241. Defining Decentralization: An Ontological Perspective


242. SR-OPSD: Self-Referenced On-Policy Self-Distillation


243. Rethinking Factor Sharing in Federated LoRA: A Rank-Aware Adaptive Approach


244. ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners


245. How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans


246. Evaluating Generative Time-Series Models on Data with Point Masses


247. Confusion-Geometry Rebalancing for Long-Tailed Adversarial Training


248. Predictive safety filter enhanced curriculum learning control for efficient vehicle dynamics controller


249. DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation


250. NeuroRefiner: Morphology-Aware Multi-Agent Refinement for 3D Fluorescence Microscopy Neuron Segmentation


251. Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks


252. Structure-Enhanced Features and Quality-Aware Dynamic Anchor Scoring for Robust Lane Detection


253. TSPORec: Token Selection via Preference Optimization for LLM-Based Sequential Recommendation


254. LEED: Local Embedding Evolution Distance for over-smoothing estimation and virtual node selection in GNN


255. Illusion or Integrity? Geometrical Consistency Metric for AIGC Video Quality Evaluation


256. MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection


257. Distributed Optimization with Streaming Data: A Temporal Weighting Perspective


258. From Semantic Grounding to Decision Optimization: A Unified Framework for Long-Horizon UAV Vision-Language Navigation


259. ELBench: A Multi-Dimensional Benchmark for Education-Facing Large Language Models


260. Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs


261. TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability


262. Carnot: Interpretable, Interactive, and Optimized Execution of Deep Research Queries


263. RangeFactory: Scalable Construction of Multi-Hop Cyber Ranges


264. STAIR: Effective Incident Response Using an End-to-End Agentic Planning Framework


265. Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts


266. Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learning


267. Beyond Uniform Restoration: Empowering All-in-One Restoration with Pixel-Level Multimodal Guidance


268. ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents


269. MixFormer: Linear Transformer with Mixture of Memory Experts


270. RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation


271. Learning to Modulate, Not to Cycle: Soft Actor—Critic Recovers Inverter-Style Heat-Pump Control


272. WDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-Training


273. How Simple Can It Get? From Interpretable Equations to Readable Rules for Financial Decision Making


274. ZetaGPT: A Reference Implementation of Positional–Encoding–Free State–Space–Attention Language Models


275. LITEWAY: LIghtweight HAR via Temporal Efficient highWAY


276. Sign Language Recognition Using Original and Synthetic Depth Image Based Point Cloud Data Models


277. Monotonicity-Guided Bottom-Up Petri Net Discovery: The SPECpp Framework



279. Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation


280. FeedbackTrack: Visual-Cortex-Inspired Cross-Frame Feedback for Transformer Tracking


281. Deep Learning based Detection of Fishing Vessels and Fishing Monitoring using Nightlight Images


282. Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute


283. RAG-Audio: Retrieval-Augmented Generation for Faithful Brain-to-Audio Reconstruction


284. WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation


285. DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation


286. UniDFKD: A Unified Semantic Prior Framework for Architecture-Agnostic Data-Free Knowledge Distillation


287. VeinCast: Physics-Guided Dynamic Field Graphs with Graph-Conditioned Fusion for Global Medium-Range Weather Forecasting


288. GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization


289. Software Engineering for and with GUI Agent


290. SoftmaxGRPO: Learning to Reason using Softmax Advantage Group Estimation


291. GRASP: Granularity-Aware Region Alignment and Semantic Prototype Learning for Fine-Grained Cross-Modal Understanding in Drone Views


292. Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations


293. SafeQL: Search-based Refinement for Safe and Efficient LLM-based Text-to-SQL


294. MoRSE: Task-Oriented Multi-Agent System with Mixture of Role-Subtask Experts


295. Multimodal Federated Learning under Dual-Axis Modality Missingness


296. Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation


297. RL-Native Distillation: Exploiting Scored Trajectories for Few-Step Image Generation


298. Governing the KV Cache: Preventing Timing Side-Channel Leakage in Multi-Tenant LLM Inference


299. FedTVD: Balancing Data Quality and Quantity for Robust Federated Learning


300. Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training


301. AkasicDB: Demonstrating Omni RAG with a Unified Vector-Graph-Relational DBMS


302. FedA2L: Adaptive layer-wise learning rate adjustment in decentralized federated learning


303. SiriusDeliver: Automating Data Warehouse Delivery at Tencent


304. Rethinking Medical Landmark Localization with Prototype Learning-based Progressive Offset Correction


305. Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression


306. Tabular Numeric Stretch Transformation


307. From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs


308. SpeedTuning: Speeding Up Policy Execution with Lightweight Reinforcement Learning


309. When Latents Forget Pixels: Restoring Fidelity in Diffusion Transformer Super-Resolution


310. MARA: Flow-Matching-Guided Multi-Agent Resource Allocation for Computational Resource Efficient Learning


311. Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments


312. Visual Distortion Detection in UGC Images Using Large Multimodal Models


313. The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora


314. TLDChoiceNet: Quantitatively Choosing a Transfer Learning Dataset


315. When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information


316. A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents


317. Two-Step MV-DeepONet: Probabilistic Operator Learning for Uncertainty Propagation Driven by Random Input Fields


318. Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation


319. Bridging the Gap Between Semantics and Reconstruction:Unifying Sign Language Translation and Production


320. Don’t Scroll Back: Missing-Evidence Memory for Streaming Dialogue Summarization


321. MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation


322. How People Evaluate AI-, Expert-, and Peer-Style Financial Advice


323. SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs


324. DeepFreqMark: End-To-End Learnable Frequency-Domain Watermarking with Spherical Attack Simulation for Latent Diffusion Models


325. Multi-agent discovery of practical quantum LDPC codes


326. Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence


327. How Far Do Foundation Models Transfer to Infant Signals? A Cross-Dataset Transfer Audit with a Unified Need Ontology


328. Detecting Clear Contact Lenses for Iris Recognition: A Two-Stage Mask-Guided Attention Approach


329. How Can Rhetoric Reward-Hack AI Reviewers? Dissecting Rhetorical Sensitivity in AI-Based Peer Review


330. GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices


331. Fourier Self-Supervision for Fine-Grained Generalized Category Discovery


332. Idea Search: Guiding Tree Search with Ideas to Explore Diverse Scientific Methods


333. Do AI Forecast Ensembles Sample the Correct Conditional Distribution?


334. From Operational Design Domain to Action: A Systematic Behavioral Taxonomy for Autonomous Driving


335. Toward CT-Equivalent Image Quality in Low-Dose Radiotherapy Planning: Conditional Diffusion-Based CBCT-to-CT Synthesis and the Impact of CBCT Input Representation


336. ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision


337. From Recovery to Drop-off: How Action Post-training Reduces a VLM’s Late-Layer Depth Decodability


338. A New Approach to Characterising Optimisation Problems Using Programmatic Representation and Complexity Measures


339. Epistemic Transfer in AI-Assisted Verification: A Framework and Evaluation Protocol


340. DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference


341. Agentic Anomaly Detection with ORCA-Style Dynamic Inductive Bias Adaptation in Multimodal Wearable Time Series Data


342. Deployable Per-Instance Multi-Layer Activation Steering for Large Language Models


343. Hybrid Neural-Classical Correction for Frozen Time Series Foundation Models: A Comprehensive Ablation Study on High-Frequency Stock Prediction


344. 360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents


345. Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast


346. Eco-SoC: A Sustainable VLSI Architecture for Energy-Proportional Artificial Intelligence


347. Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs


348. TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases


349. PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation


350. Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure


351. LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization


352. Resolution Meets Reduction: Efficient Visual Context for 3D Radiology Report Generation


353. RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation


354. UniSpace: Unified Visual Representation and Scalable Multimodal Modeling


355. LegoLM: Structured Weight Sharing for Large Language Models


356. CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents


357. Enhancing Scientific Named Entity Recognition via Large Language Models: A Type-driven Multi-task Learning Approach


358. RAG-Based Auto-Configuration for Industrial Fieldbus Devices


359. REVEAL: A Rubric-Guided Agent for Explicit Evidence Sufficiency Verificationin Long-Video Question Answering


360. Mitigating Gender Bias in English to Romanian Machine Translation


361. Population-Scalable Multi-Agent World Modeling


362. CDGC-Net: 3D Medical Image Segmentation with Cooperative Dual-Scale Self-Attention and Grouped Channel Modeling


363. On-Device Multi-Species Malaria Detection with Uncertainty-Calibrated Slide-Level Aggregation


364. A Combined Feature-Based Framework for Disguise and Spoofing Detection in Face Recognition Systems


365. SuperNeuroMAT: An Efficient Matrix-based Simulator for Spiking Neural Networks


366. SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills


367. Halpern Iteration Achieves $\tilde{\mathcal{O} }(ε^{-1/p})$ $p$th-Order Oracle Complexity for Monotone Variational Inequalities


368. Beyond Tables: Doc2DB-Bench for Relationally Faithful Document-to-Database Construction


369. Calling the Bluff: Detecting Ever-Shifting Harmful Chat Dialogue via Ordered Reasoning Chain Regularization


370. Hidden Language Consistency Phenomena in Reasoning LLMs


371. Private Etymology: Designing Relational Reuse of Shared Symbols in Long-Term Human-AI Interaction


372. FSTC-Encoder: Feature–Spatial–Temporal Correlation Learning for Generalizable RF Sensing


373. Human-Guided Causal Knowledge Injection for Virtual Cells


374. Abstracted Away: Resisting Alienation and Ungrounded Abstraction in AI Research Communities


375. Does a Toehold Make a Bidder Bolder? Preemption and Multiplicity in Multi-Round Takeover Auctions


376. From Product Search to Preference Articulation: The Economics of Agentic Commerce


377. Dramarrator: Object-Based Audio Editing for Audio Drama Production from Books


378. PRISM: A Predictive Protocol for Permutation Optimization via Landscape Diagnostics


379. Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution


380. Three Necessary Principles for Self-Supervised Visual Representation Learning


381. Open-World Semantic Segmentation with Sensitivity Modeling


382. Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering


383. Do Evaluation Metrics Detect Errors in Classical Chinese to English Translations?


384. On the Robustness of LLMs’ Internal Representation of Code Correctness


385. Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations


386. VTO: Visual Tool Orchestration for Video Anomaly Detection


387. FreSH: Frequency-Segmented Hierarchical Multi-Expert Framework for Multivariate Time Series Classification


388. Targeted Counterfactual Fingerprinting for Black-Box LLM Ownership Verification


389. Biologically Informed Representation Learning for Robust Cross-Center Generalization of MALDI-TOF Mass Spectrometry


390. A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization


391. $\texttt{DisMorph}$: learning to disentangle technical distortions from true biological change


392. STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs


393. Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives


394. Exact Zarankiewicz Values On Two Finite Frontier Slices


395. DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology


396. Compositional Cross-Modality Translation via Whole-Volume Multitask Latent Flow Matching


397. Compositional Threat Analysis of Latent Compromise in LLM Agent Systems: The Order 66 Scenario


398. Hierarchical Multi-Task Federated Learning in VANETs


399. NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs


400. Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection


401. Adaptive Symmetry Discovery for Dynamical System Identification


402. Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations


403. HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection


404. DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects


405. Tools to Explain Neural Networks for Power System Dynamics


406. Do All LLMs Know When They’re Being Harmful? A Reproducibility Study of Latent-Space Safety Probes Across Model Families


407. DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea


408. Prompt Embedding Probes (PEP): Hallucination Detection in LLMs from Hidden States


409. Evidence-RL: Towards Evidence-intensive Visual Reasoning


410. Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models


411. Evidence-Grounded Forensic Reasoning for Detecting and Grounding Multi-Modal Media Manipulation


412. Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design


413. Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions


414. EasyBalance: Cross-Layer Load Balancing in Distributed MoE Inference


415. Persistent Semantic Entities in Tool-Augmented LLM Systems


416. Metadata Reconstruction from Values Alone: Recovering Column Semantics in Undocumented Warehouses


417. ScaleSense: Cost-Intelligent Scaling Framework via Learned Resource Estimation in Alibaba AnalyticDB


418. Second Order Drifting Models


419. Spectral Outliers Reveal Dominant Learned Structure in Transformer Attention


420. Private Anytime Selective-Risk Certification for Federated Retrieval-Augmented Generation: Guarantees and Empirical Limits


421. Beyond “I Can’t Help With That”: How Child Safety Experts Evaluate AI Chatbot Safety


422. Router Sensitivity Under Lightweight Fine-Tuning Identifies Prunable Experts in Mixture-of-Experts Models


423. Vision-Language Grounding as Bidirectional Concept Correspondence


424. Distilling CT Foundation Models into Editable Concept Bottlenecks for Lung Nodule Malignancy Prediction


425. Shape Mutating Expert Compression:LorExperts and BTExperts


426. The Anatomy of a Prompt Injection: A Component Model for Structured Analysis


427. CFD-Guided Detection of Concept Drift in Multimodal Physiologic Signals


428. Multi-Task Consistency-based Detection of Adversarial Attacks


429. LoRSA: Toward Generalizable Parameter-Efficient Fine-Tuning for Biomedical Downstream Tasks


430. Complete, Scalable, and Robust Prioritized Planning for Multi-Robot Ordered Storage and Retrieval at Maximum Capacity


431. LGNNIC: Acceleration of Large-Scale GNN Training using SmartNICs


432. SpikeWorld: Fast-State Adaptation for Frozen Spiking World Models


433. CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting


434. Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding


435. SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment


436. Adversarial Attacks on Deep OCR Systems


437. PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue


438. Hit Selection Using SSMD-Based Machine Learning Performance Metrics in High-Throughput Screening Assays


439. Enhanced Real-Time 6-DOF Extended Reality Catheter Tracking for Evaluating Potential Improvement in Efficiency, Precision, and Depth Perception for Cardiac Interventions


440. Scaling Inherently Interpretable Language Models


441. Weather- and Location-Aware Agentic Dining Recommendation: Leveraging LLM World Knowledge for Region-Sensitive Contextual Reasoning


442. Multi-Branch Policy Optimization for Multimodal Large Language Models


443. Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real


444. Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects


445. BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference


446. COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping


447. Latent-Frequency Validity: Fast Spectral Editing with Screened Video-VAE Transfer Operators


448. Temporal Generalization in fNIRS-Based Autism Classification: A Cross-Time-Window Transfer Benchmark


449. What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems


450. Coarse-to-Fine Registration of Jawbone CT and Intraoral Scan Data Using GeDi and ICP with Pseudo-IOS Ground Truth


451. AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization


452. MasDrift: Benchmarking Authorization Preservation Across Multi-Agent Architectures


453. P2Voxel: Pyramid Pivot Voxelization for 3D Mesh Tokenization


454. Learning an Interior Layout Policy in a Domain Specific Language Action Space


455. Generalizing deep reinforcement learning across cable-driven parallel robot configurations with actuator-level policies


456. DarwinX: Evolving Agent Harnesses Through Natural Selection


457. MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-based Automated Heuristic Design


458. Performance of large language models in the optical diagnosis of colorectal polyps


459. NeuroPilot: An Agent-Driven Smart Pipeline for Processing, Quality Control, and Managing Neuroimages


460. An evolutionary model of animats with VLM-based subjective evaluation


461. Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards


462. Ultraconstructive Model Theory via Bounded Adversarial Finite Structures


463. Search-G1: Grounded Search Agents via Representation-Based Intrinsic Rewards


464. WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management


465. DocAtlas: Long-Document Understanding as Mutable-State Interaction


466. Unified Hallucination Fuzzing for Multimodal Large Language Models


467. From Evaluated Models to Evaluation Aids: A Multi-Evidence Study of LLM-Based Difficulty Calibration for Programming Examinations


468. KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants


469. Representation Matters in Longitudinal Affective Computing


470. EMMR: Emotion-Mediated Multimodal Reasoning for Personality Assessment in Asynchronous Video Interviews


471. How sensitive do we want AI to be? Socio-communicative competencies of large language models in healthcare


472. PIVOT: Preference-based Intervention Vectors for Pedagogical Tutor Steering


473. JaleesBench: Are AI Assistants Good Spiritual Company?


474. Innovating with Generative AI: A Human Bottleneck Framework


475. Harnessing Abundance: A Generativity Perspective on Human-GenAI Collaboration


476. Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based Simulated Clients


477. Knowing You Is Everything: LLM Agents Achieve Near-Perfect Profile-Consistent Reaction Prediction in Social Media Simulation


478. EmoPatient: An Emotion-Directed Patient Simulator for Realistic Palliative Care Communication Training


479. How to Ask the AI: A User Perspective Survey for Large Language Model Prompting


480. Experience-Sensitive Game Learning: A Behavioral Study of Humans and Language Agents


481. Cross-Model Humor Preference Modeling with Cards Against Humanity


482. Designing for Ethical AI: HCI Feature Considerations to Improve Fairness and User Experience in AutoML use for Human Resources


483. Positioning Generative Artificial Intelligence in STEM Assessment: When to Require, Scaffold, or Restrict Its Use


484. Application of Artificial Intelligence for Fraudulent Banking Operations Recognition


485. Coordinated incentives in AI-generated misinformation governance


486. From Trajectories to Evidence: Auditable Experimental Records for Industrial Research Agents