전체 AI 논문 - 2026-08-31

1. Logos: An Agent Harness on a Cross-Process Bus


2. InstructMesh: Selective Refinement of Generative 3D Models for Fabrication


3. When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI


4. Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration


5. AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction


6. COVER: Identifiable Evaluation of Coalition Routing


7. Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning


8. Prove2Me: An Open Collaborative Platform for Scaling Math Formalization


9. Program Learning with Verifiable Rewards: Symbolic Backpropagation for Post-Training LLMs


10. VERA-8B: Evidence-Grounded Audit Risk Reasoning from SEC Filings


11. RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents


12. Timing-Aware Repurchase Prediction for Web-Scale E-Commerce: Survival Models for Multi-Surface Grocery Recommendation


13. MAP: A Benchmark on Multimodal Accessibility Planning for Real World Places


14. EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses


15. GRACE:Gradient-guided Coreset Selection for LLM Unlearning


16. Propagating construction-time knowledge quality into medical question answering: A framework grounded in clinical guidelines


17. AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents


18. Real-Valued Hyperdimensional Sequence Representations with Hadamard Product Binding and Shift Equivariance


19. MAIL: Memory-driven, Adaptive, Incremental, and Literature-grounded Framework for Hypothesis Generation in Chemistry


20. Memristive-Friendly Hadamard Reservoir Computing: Structured, Multiplier-Free Recurrences at Scale


21. LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering


22. RECAST: Recent & Context-Aware Sampling for Test-Time Adaptation in Streaming Biosignals


23. Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration


24. Physics-Guided Flow Matching for CT Image Reconstruction


25. Regime-Aware Portfolio Management via Retrieval-Augmented LLM-Guided Expert Switching


26. Beyond Task-Only Matching: Personalized Skill Routing with Counterfactual Evaluation


27. REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features


28. Stay Within Your Bounds: Distance-Guided Decoding for Guaranteed Context-Free Grammar Compliance


29. Generative AI Alignment with Hinduism’s Theological Plurality and Sacred Representation


30. Expert Knowledge & Machine Understanding: Bridging Reactome’s Ontology with LLM Semantic Embeddings


31. CrabOS: An Operating System for Human-AI Co-inhabitation


32. Under-Mattress Temporal Sensing for Next-Day Agitation Risk Scoring in Dementia Wards


33. The Shape of Power: A Multilingual Framework for Social Power Reasoning in Dialogues


34. Speculative Probing: LLM Monitoring at Speculative-Decoding Cost


35. SEPO: Evidence-Grounded Prompt Optimization via Structural Editing


36. Learning to Allocate Incentives for Incentivized Advertising via Offline Model-Based Reinforcement Learning


37. WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents


38. String: An Agentic OS Where Every App Is a Markdown File


39. Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents


40. PhenoIntel: A Lifecycle-Aligned Multi-Agent Web Application for Verified, Accessible Plant Phenotype Analysis


41. Automated Analysis Framework for Multilingual Climate-Health Literature Based on Multi-Agent Large Language Model


42. Should I Use This Synthetic Dataset for Training? How to Test with Minimal Real Data


43. GOD: Govern, Observe, and Direct - A Real-Time Control Room for Agent Societies


44. When Evidence Shapes Collaboration: Knowledge-Conditioned Topology Generation for Multi-Agent Systems


45. Learning from Hard Prompts: Difficulty-aware Advantage Amplification in Dynamic Sampling


46. openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents


47. AERA: Adaptive Evidence Residual Allocation for Efficient Test-Time Reasoning


48. SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing


49. When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation


50. The Illusion of $\textit{What If}$: Evaluating the Breakdown of Counterfactual Reasoning in LLMs


51. Cross-Session Decomposition Attacks: Scaling Risk and Intent-Aligned Retrieval Defense


52. CASTANET: Causality-Aware Spatio-Temporal Adversarial Network Using Traffic Incident Effects


53. A Deep Learning-Based Stacking Ensemble Framework for Turbofan Engine Remaining Useful Life Prediction


54. From Documents to Reasoning: A Validated Synthetic Data Pipeline and Semantic-Aware Fine-Tuning for Financial Numerical Reasoning


55. AI Alignment through a Game-theoretic Lens: A Survey


56. Rubric-to-Code Credit Assignment for Reinforcement Learning


57. Resource Constraints and Performance in Agentic AI Systems


58. HyQuant: Hybrid-Precision Quantization for LLM Attention


59. See, Hypothesize, Validate: Multimodal Agentic Framework for Discovering Governing PDEs


60. CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning


61. SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models


62. From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis


63. An Empirical Evaluation of Cross-City POI Recommendation on a Large-Scale Benchmark


64. KLOD: Locality-Preserving Knowledge Editing via Non-Target Distribution Preservation


65. RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests


66. Evidential-Based Higher-Order Set Argumentation Framework


67. AcCoRD: Evaluating User-Agent Collaboration Under Realistic User Preference Dynamics


68. CURA: Certified Runtime Alarms for Computer-Use Agents


69. CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action


70. ReToolSQL: Agentic Reinforcement Learning for Robust Text-to-SQL


71. Credo: Reusable Declarative Primitives for Agentic Workflows


72. Why Didn’t It Check? Unsupported Final Claims and Their Repair in Two Tool-Equipped Language Models


73. Probing Perceptual Priors of MLLMs via Gibbs Sampling with Interpretable Generative Controls


74. PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation


75. Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community


76. A Framework for Object-Centric Predictive Monitoring of Collaborative Processes


77. If Agents Were Angels, No Governance Would Be Necessary: Out-of-Band Policy Enforcement at a Trusted Tool Boundary


78. Generative AI Expands the Intellectual Reach of Course Based Undergraduate Research Experiences (CUREs)


79. LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails


80. Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator


81. SETU: An Agentic Ecosystem for Multilingual, Persona-Aware Communication Coaching


82. WM-R1: Training GUI Agents to Reason and leverage World Models with Reinforcement Learning


83. Thinking Costs Tokens: When More Structure is Worth the Price


84. CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence


85. Context Localization for Generalized Level-Based Evaluation in Knowledge-Based Systems


86. Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations


87. Benchmarking General Mobile Assistants in Challenging Real-World Scenarios


88. Class-Based Heuristic Selection for Solving the Flying Block Puzzle


89. Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields


90. LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation


91. Retrieving Relations, Detecting Fallacies: A RAG Approach to Political Debate Analysis


92. Not All Explanations Are Sought: Information-Seeking Psychology for Human-Centered XAI


93. Rating the Raters: Rasch Measurement Theory for LLM Evaluation


94. Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model


95. Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning


96. Learning a Size-Weight Frontier for Synthetic-Augmented Inference


97. Blog: Survey of Optimizers


98. Video Generative Models as Geometry Learner


99. An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models


100. Texture Image Classification Using DWT AlexNet Feature Fusion and Deep Neural Networks


101. Conformal Uncertainty Quantification Guarantees for Neural Operators


102. On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces


103. LLM-Based Agents for Software and Systems Security: Approaches, Applications, and Assessment


104. How Proper Scoring Rules Shape LLM Forecasting


105. NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry


106. Real-time virtual circuits for plasma shape control via neural network emulators: experimental demonstration on MAST Upgrade


107. Anatomy-Aware Promptable Segmentation with Online Interactive Training for AUTOPET V


108. ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT


109. Fidelity Is Not Enough: Dispatch-Level Instrumentation for Agentic Datasheet Extraction


110. Are These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQL


111. LongPIBench: A Long-Context Benchmark for Prompt Injection


112. When Linguistic and Internal Confidence Diverge in Large Language Models


113. AI as Teammate: Rethinking Task Distribution in Medical Training


114. Real-Time Musculoskeletal Surrogates for Pediatric Cerebral Palsy: a Credibility Pilot


115. Optimal Adversarial Testing: Extracting Honest Test Results from Dishonest Test Takers


116. Cross-Spectral Dense Correspondence for Multimodal Spectral Medical Imaging


117. BanglaMed-QA: A Question Answering System for Healthcare Support in Bangla


118. Layered LLM Defenses as an Ensemble: Access Tiers, Inference Cost, and the Measured Failure Correlation Between Defense Layers


119. Deriving Scaling Laws for OpenEuroLLM Models: Learning Rate, Batch Size and Loss


120. VISTA: Verifier-Informed Student-to-Teacher Adaptation for On-Policy Self-Distillation


121. PanelShield: Verifiable Closed-Loop Safe Planning for Robotic Industrial Panel Operation


122. MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation


123. A Probabilistic Interpretation of KV Cache Eviction


124. Embedding Models for Stance-Aware Argument Retrieval


125. Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations


126. A comprehensive and trustworthy benchmark of AI methods for change detection in Earth observation


127. Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring


128. Performative Privacy: When Differential Privacy Maximizes Utility


129. Beyond Flat Netlist: Hierarchical Graph Representation Learning for Scalable Analysis of Sequential Circuits


130. Conformal Risk-Averse Decision Making with Optimized Certainty Equivalent Risk Control


131. Text Restoration of Ancient Documents with Language Models


132. Gen-TAS: A Generative AI-Aided Hardware-Software Task Allocation Framework for FPGA-GPP Heterogeneous Systems


133. Nested Byte-Level Vocabularies Are Cheap to Deploy and Expensive to Share: A Pre-Registered Negative Result


134. The Approximation Rank of Softmax Attention: Sharp Geometric Laws and Robust Interaction Dimension


135. Post-Edit Re-Verification in Simulator-Backed Engineering Agents: A Controlled Comparison of Verification-Cadence Guidance


136. CheXtriev: Anatomy-Centered Representation for Case-Based Retrieval of Chest Radiographs


137. VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning


138. Do Medical Vision Models Reason About Anatomy? Probing the Spatial Inductive Biases of Learned Visual Representations


139. VersaGauss: A Versatile Framework for Generating Multiphase Dynamics with 3D Gaussians


140. Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models


141. Explainable Uncertainty Estimation for Reliable Medical AI


142. SimpCue: Cue-Based Prompting for Multilingual Text Simplification


143. Compared to What? A Human-Anchored Security Benchmark for LLM-Generated Infrastructure-as-Code


144. Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning


145. When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?


146. A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint


147. CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?


148. Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification


149. Antipatterns in AI-assisted Qualitative Data Analysis: A Catalog of Temptations and Pitfalls for Software Engineering Researchers


150. PCBnet: A Dataset and Automatic Construction of SPICE Netlists from Schematic Images


151. Low-Altitude Fluid Antenna Network with Multi-Agent Reinforcement Learning


152. LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages


153. OpenStamp: A Watermark for Open-Source Language Models


154. SOMTab: Set-Order Mamba for Efficient Tabular In-Context Learning


155. From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation


156. FedEHR-Agents: Federated Agentic Optimization for Automated EHR Modeling


157. FISGuard: Defending Against Membership Inference via Fixed Input Subspaces


158. Actionable CBFI: Integrating Structural Decomposition and Causal Counterfactual Recourse for Tabular Machine Learning


159. ContextLeak: Exfiltrating LLM Agent Context via Malicious Tools


160. How Much Can AI Understand? Toward AI-Assisted Sensemaking of Collaborative Discussion in Groups with Shared History


161. Compositional Failure in Audio-Visual LLMs: Late-Layer Prior Dominance Under Cross-modal Conflict


162. Beyond Search-Imitation: Prior-Directed Exploration for Searchless Chess


163. Efficient Auto-Interpretability of AI Models in Biology


164. RiskBlend: A Multi-Signal Framework for Test Input Prioritization in Machine Learning Regression Testing


165. Evaluating Loss Functions in Differentiable Out-of-Domain Sound-Matching with Partial Parameter Distance


166. CARDINAL Predicts Cardiovascular Risk From Non-contrast Cardiac CT


167. First Make It Playable, Then Make It Good: Staged Interaction Learning for Small Dialogue-Game Agents


168. Semantic Watermarking with Order-Robust Detection over Sub-sentence Units


169. Knowing Before Answering: Decoding Language Models for Reliable RAG


170. Curvature-Aware Radius Shrinkage for Adaptive Nearest Neighbor Classification


171. Depth-Aware Pothole Detection Using YOLO and RT-DETR at the Edge


172. LitCurate: A Configuration-Driven AI-Assisted Framework for Scientific Database Construction with an Application to Lower-Mantle Equation-of-State Data


173. Tensor-Accelerated Eager Multi-Resolution Grids for Evolving Large-Scale Substrates


174. PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models


175. Quanta Perception as Probabilistic Events


176. Self-Explainable Multi-Label Graph Neural Network for Correlated Evidence Attribution


177. FVeinSyn: Synthetic Finger Vein Image Generator


178. Destroy Me: Automatic Artifact Generation for Histopathology Images


179. Trajectory-Level Speculative Decoding for Diffusion Language Models


180. DAMP: Decay-Aware Mixed-Precision Recurrent-State Quantization


181. Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation–Deployment Gap


182. Marginal Coverage Credit Reduces Redundant Exploration in Parallel State-Entropy Optimization


183. A Survey on Rubric-Guided Reinforcement Learning for Language Models


184. XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering


185. Select, Don’t Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection


186. UIC-AIHealth4All at ArchEHR-QA 2026: Answer-First Evidence Grounding for Clinical Question Answering


187. PACE: Publisher-Adaptive Content Extraction via Agentic Automation


188. The Effect of Emotional Context on Large Language Models’ Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models


189. Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech


190. SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction