LLM 관련 주요 논문 - 2026-08-03

1. AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers


2. AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction


3. ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models


4. MAGA: Multi-Platform Self-Fusion of GUI Agents via Structured Action Distillation


5. Tool Specifications Matter: Uncovering and Mitigating Safety Risks in AI Agents


6. Don’t Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL


7. MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft


8. CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents


9. Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration


10. Scaling Scientific Discovery Environments for Turn-Level Agentic RL


11. MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations


12. NeSyFS: A Neuro-symbolic Fast-Slow Thinking Framework for LLM Agent under Partial Observability


13. EarlyDx: An Admission-Anchored Benchmark for Open-Ended Generation of Evidence-Supported ED-Encounter Diagnoses


14. SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition


15. Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery


16. Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support


17. How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories


18. An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents


19. TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter


20. LLM Framework for Discovering Major Mathematical Conjectures: AI’s Quest for the Next Riemann Hypothesis


21. Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems Using Automated Multi-Model Review


22. OpenClaw and Ollama in Agentic AI: Toward Fully Autonomous and Scalable AI Agent Systems


23. When Does On-Policy Interaction Help? Representational Tradeoffs in Value-Based Imitation Learning


24. FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models


25. MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language Models


26. ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation


27. QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models


28. AgenticRepair: Multi-Faceted Program Context Engineering for Agentic Vulnerability Repair


29. Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens


30. The persuasive power of large language models does not depend on their perceived national origin


31. CalibratedRubric: Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation


32. RecHarness: A Bandit-Routed Agentic Harness for Self-Evolving Recommender Systems


33. When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration


34. Small Is Enough: Per-User Style Rewriting of AI-Edited Text via LoRA Adapters


35. CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning


36. Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory



38. Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives



40. PARALLEL: A Prefrontal-Aligned Reinforcement inspired Approach for Language-Model Learning under Explicit Limits


41. A robust association between LLM use and scientific productivity: Assessing stopping-time selection


42. Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates


43. FairFund-Bench: Evaluating Distributive Bias in LLM Resource Allocation


44. Agreement Is Not Quality: Blind Expert Verification of Human and LLM Qualitative Coding When Human Consensus Is Not Ground Truth


45. Human-LLM Collaborative Inductive Coding for Conceptualizing K-12 Educator AI Use


46. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing


47. Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?


48. TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text


49. Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing


50. Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation


51. DragonCrawl: A Generative, Intent-Based Framework for Scalable Mobile End-to-End Testing


52. Metaphor-Induced Algorithmic Steering: Cross-Domain Procedural Transfer in LLM Code Generation


53. Guarantees on Dynamical System Distinguishability for LLM Token Generation


54. Why It Hurts: Identifying the Drivers of Negative Thoughts in Emotional Support Conversations


55. ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning


56. Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation


57. The Formalism Trap: Are LLM-as-a-Judge Evaluators Blinded by Consensus Mimicry under Social Load?


58. The Asymmetric Effects of Knowledge Distillation on Bias in Small Language Models


59. Topology-Aware Data Movement for Disaggregated GPU Inference