LLM 관련 주요 논문 - 2026-08-19

1. Delegation Asymmetry in Agentic Recommender Systems: Measuring Two-Sided Receptivity in Online Dating


2. Can Large Language Models Explain Flight Safety Events? A Prior-Guided Semantic LLM-based Approach


3. Procedural Content Metageneration via Program Search and Continual Abstraction Discovery


4. EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection


5. ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction


6. StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows


7. D$^2$ACCI: A Dual-Loop Diagnostic Protocol for Evidence-Preserving Agent Memory


8. Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals


9. GraphWake: Group Polarization via Memory-Mediated Polarization Cascade in LLM-Agent Communities


10. LLM-Derived Preference Judgments Are Not Self-Consistent


11. Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making


12. When to Review: Spaced Repetition for Continual Pre-Training of Language Models


13. Agent Lightning v1.0: Towards Harnessed Agentic RL


14. SGHA: Evidence-Grounded Research Problem Discovery with Local Language Models


15. When AI Designs AI: Innovation or Imitation?


16. SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution


17. Structure-Internalized Rule Language Model for Faithful Knowledge Graph Reasoning


18. Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations


19. LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents


20. LLM-Only PDDL Domain Repair with Open-Weight Models


21. TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration


22. LLMs for Medical Consultation Are Evaluated Too Late: The Preformulation Gap


23. SignalReasoner: Assessing the Upper Bound of 3B Models for Signal Mathematical Reasoning


24. PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs


25. Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking


26. Fool’s Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models


27. Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models


28. Synthesizing Feature Extractors: An Agentic Approach for Algorithm Selection


29. KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn


30. A decodability criterion predicts when hidden-state selection beats majority voting in large language models


31. DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization


32. SkillEffect: Checked Lowering for Memory-Bounded Agent Tools


33. FedPref: Federated Preference Learning for Structured Radiology Report Extraction


34. GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents


35. Policy-Invariant Reward Shaping from LLM Feedback: A Framework for Hybrid RL Agents


36. Against Political Polarization: A Unified Framework for Tracing Evolving Political Ideologies on Social Media


37. Too Sure to Be Safe: Model Calibration for Reliable Log Anomaly Detection


38. An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models


39. SIGMA: SHAP-Guided Implicit-Trajectory Generation for Metadata-Free LLM-Based AutoFE


40. Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation


41. Grading Needs a Rubric, Not Intelligence


42. BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models


43. Encoded but Not Actionable: Auditing the Decode-Generate-Steer Gap in Frozen LLMs for Geometric Constraints


44. AdaLens: Interactive Storyline for Monitoring and Steering Long-Running Agentic Data Analysis


45. MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure


46. Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses


47. What Aggregate Scores Miss: Measuring Item-Level Regressions in Commercial LLM API Migrations


48. Communicating Credit Risk with Large Language Models: Evaluation of Explanations from Standard and Alternative Data-Based Models


49. GADR: Gathering Architecture Decision Records from Meeting Transcriptions


50. Benchmarking Automated Security Patch Backporting: How Far Are We?


51. MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps


52. DEPT: Document Embedding Preservation Tuning for Unified Query Expansion and Retrieval


53. HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety


54. Domain-Adapted Molecular Language Models for Efficient Search of Make-on-Demand Libraries



56. SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation


57. PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX


58. Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets


59. Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models


60. NeuroAbs: A Neuro-Symbolic RTL Abstraction Framework for Property Checking Acceleration


61. Understanding Curriculum Learning in Large Language Models via Cross-Difficulty Optimization Dynamics


62. Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL


63. COMIC: Reference-Aware Safety Gating for Multimodal Large Language Models


64. PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance


65. Task Specialization Fine-Tuning for Contextual Reinforcement Learning


66. Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases


67. Structured Driving-State Narratives for Small Language Model-Based GNSS Spoofing Detection


68. Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss


69. Cross-Model Memory Transfer via Target-Side Reader Adaptation


70. Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations


71. WIP: LLM Odyssey: A Game-Based Platform for Teaching LLM Engineering Concepts


72. CARA: Cognitive Adaptive Recommendation Agent


73. When Personalization Becomes Bias: Structural and Discursive Religious Framing in AI-Generated Financial Advice


74. Effective Personalized AI Tutors via LLM-Guided Reinforcement Learning


75. CityReal: Human-Aligned Urban Behavior and City Dynamics Simulation with Large-Scale LLM Agents


76. A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications


77. Intent-Driven Dynamic Chunking: Segmenting Documents to Reflect Predicted Information Needs