LLM 관련 주요 논문 - 2026-05-29

1. SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations


2. Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection


3. Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents


4. Demystifying Data Organization for Enhanced LLM Training


5. MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection


6. ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure


7. When Should Models Change Their Minds? Contextual Belief Management in Large Language Models


8. Double-Edged Sword or Sharp Tool? Designing and Evaluating Triadic LLM-Teacher Collaboration for K-12 Writing at Scale


9. Modularizing Educational LLM-Agency for Fostering Responsible Learning Assistance


10. BioRefusalAudit: Auditing Biosecurity Refusal Depth Using General and Domain-Fine-Tuned Sparse Autoencoders


11. Meta-Cognitive Memory Policy Optimization for Long-Horizon LLM Agents


12. Anchorless Diversification for Parallel LLM Ideation


13. AgentSchool: An LLM-Powered Multi-Agent Simulation for Education


14. Enhancing Multi-Agent Communication through Attention Steering with Context Relevance


15. PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers


16. Selective QA over Conflicting Multi-Source Personal Memory: A Diagnostic Testbed and Method Comparison


17. Conformal Certification of Reasoning Trace Prefixes


18. Learning to Choose: An Empowerment-Guided Multi-Agent System with semantic communication for Adaptive Method Selection


19. Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning


20. Teaching Values to Machines: Simulating Human-Like Behavior in LLMs


21. From GPS Points to Travel Patterns: Flexible and Semantic Trajectory Generation with LLMs


22. KairosAgent: Agentic Time Series Forecasting with Fused Semantic Reasoning



24. Accelerating Constrained Decoding with Token Space Compression


25. Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent


26. Formalizing Mathematics at Scale


27. MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization


28. Make LLM Learn to Synthesize from Streaming Experiences through Feedback


29. Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories


30. Moment-KV: Momentum-Based Decode-Time KV Cache Compression for Long Generation


31. OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields


32. OptSkills: Learning Generalizable Optimization Skills from Problem Archetypes via Cluster-Based Distillation


33. Quantifying and Optimizing Simplicity via Polynomial Representations


34. Harnessing non-adversarial robustness in large language models


35. PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing


36. SkillsInjector: Dynamic Skill Context Construction for LLM Agents


37. Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations


38. LFQ: Logit-aware Final-block Quantization for Boosting the Generation Quality of Low-Bit Quantized LLMs


39. Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence


40. Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering


41. NaRA: Noise-Aware LoRA for Parameter-Efficient Fine-Tuning of Diffusion LLMs


42. BitTP: The Lightweight Trajectory Prediction Model with BitLLM for Edge-Devices


43. Reliable Reasoning with Large Language Models via Preference-Based Maximum Satisfiability


44. NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs


45. Notation Matters: A Benchmark Study of Token-Optimized Formats in Agentic AI Systems


46. GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents


47. TRACE: Toulmin-based Reasoning Assessment through Constructive Elements for LLM CoT Evaluation


48. PTCG-Bench: Can LLM Agents Master Pokémon Trading Card Game?


49. Think Fast, Talk Smart: Partitioning Deterministic and Neural Computation for Structured Health Text Generation


50. LLM-Evolved Domain-Independent Heuristics for Symbolic AI Planning


51. VikingMem: A Memory Base Management System for Stateful LLM-based Applications


52. Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures


53. Improving Collaborative Storytelling with a Multi-Agent Framework Based on Large Language Models


54. FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification


55. GPS-Enhanced Tourist Mobility Modeling with Seasonal Spatial Priors and LLM-Based Activity Chain Generation


56. DeepTool: Scaling Interleaved Deliberation in Tool-Integrated Reasoning via Process-Supervised Reinforcement Learning


57. ParaTool: Shifting Tool Representations from Context to Parameters


58. Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation


59. Opt-Verifier: Unleashing the Power of LLMs for Optimization Modeling via Dual-Side Verification


60. UI-KOBE: Knowledge-Oriented Behavior Exploration for Lightweight Graph-Guided GUI Agents


61. MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs


62. The Curse of Helpfulness: Inverse Scaling Law in Robustness to Distractor Instructions via DistractionIF


63. CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials


64. Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation


65. When Does Persona Prompting Actually Help? A Retrieval and Metric Analysis of Expert Role Injection in LLMs


66. Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization


67. EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics


68. Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet


69. PassNet: Scaling Large Language Models for Graph Compiler Pass Generation


70. ConMoE: Expert-Pool Consolidation via Prototype Reassignment for MoE Compression


71. Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models


72. Diagnosing Harmful Continuation in Answer-Correct Long-CoT Training Traces


73. CoHyDE: Iterative Co-Training of LLM Rewriter & Dense Encoder for Tool Retrieval


74. Indexing the Unreadable: LLM-Native Recursive Construction and Search of Service Taxonomies


75. Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling


76. Provably Secure Agent Guardrail


77. DenseSteer: Steering Small Language Models towards Dense Math Reasoning


78. Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth


79. Tailoring the Curriculum: Student-Centered Reasoning Distillation via Dynamic Data-Model Compatibility


80. BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents


81. GTA: Generating Long-Horizon Tasks for Web Agents at Scale


82. ReasonOps: Operator Segmentation for LLM Reasoning Traces


83. Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction


84. The Confidence Shortcut: A Reasoning Failure Mode of Masked Diffusion Models


85. Beyond Consensus: Trace-Level Synthesis in Mixture of Agents



87. Robust and Efficient Guardrails with Latent Reasoning


88. Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching


89. Mind Your Tone: Does Tone Alter LLM Performance?


90. When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis


91. Adopt $\neq$ Adapt: Longitudinal Analyses of LLM Conversations in the Wild


92. BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation


93. VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis


94. Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes


95. Review Arcade: On the Human Alignment and Gameability of LLM Reviews


96. VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion


97. LLMSurgeon: Diagnosing Data Mixture of Large Language Models


98. Unlocking the Working Memory of Large Language Models for Latent Reasoning


99. GPIC: A Giant Permissive Image Corpus for Visual Generation


100. Reasoning with Sampling: Cutting at Decision Points


101. In-Context Reward Adaptation for Robust Preference Modeling


102. MedCase-Structured: A Text-to-FHIR Dataset for Benchmarking Diagnostic Reasoning in Clinically Realistic EHR Settings


103. Loong: A Human-Like Long Document Translation Agent with Observe-and-Act Adaptive Context Selection


104. LLUMI: Improving LLM Writing Assistance for Mental Health Support with Online Community Feedback


105. How LoRA Remembers? A Parametric Memory Law for LLM Finetuning


106. Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models


107. Reinforcement Learning with Robust Rubric Rewards


108. Do Language Models Track Entities Across State Changes?


109. Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning


110. Unifying Temporal and Structural Credit Assignment in LLM-Based Multi-Agent Prompt Optimization


111. Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency


112. Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms


113. Do Proactive Agents Really Need an LLM to Decide When to Wake and What to Anchor?


114. Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies


115. PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding


116. When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems


117. How Reliable Are AI Attackers Against a Fixed Vulnerable Target? A 400-Run Empirical Study of LLM Penetration Testing Consistency


118. Projectional Decoding: Towards Semantic-Aware LLM Generation


119. REPOT: Recoverable Program-of-Thought via Checkpoint Repair


120. Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage


121. Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation


122. Discovering Cooperative Pipelines: Autoresearch for Sequential Social Dilemmas


123. Honeyval: A Comprehensive Evaluation Framework for LLM-powered HTTP Honeypots


124. Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction


125. HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding


126. Label Over Logic? How Source Cues Bias Human Fallacy Judgments More Than LLMs


127. Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents


128. Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents


129. Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate


130. LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training


131. CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation


132. Mitigating Hallucination in Vision-Language Models through Barrier-Regulated Adaptive Closed-form Steering


133. Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension


134. Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation


135. ESPO: Early-Stopping Proximal Policy Optimization


136. HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization


137. Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models


138. Inferring Code Correctness from Specification


139. Data filtering methods for training language models


140. Evolve as a Team: Collaborative Self-Evolution for LLM-based Multi-Agent Systems


141. Hista and Numca: Estimate State Value Effectively for LLM Reinforcement Learning


142. Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking Strategies


143. Personalized Turn-Level User Conversation Satisfaction Benchmark


144. Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content


145. OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning


146. Predicting Causal Effects from Natural Language Queries using Structured Representations


147. DLM-SWAI: Steering Diffusion Language Models Before They Unmask


148. Brain-IT-VQA: From Brain Signals to Answers


149. SCOPE: A Lightweight-training LLM Framework for Air Traffic Control Readback Monitoring


150. GiPL: Generative augmented iterative Pseudo-Labeling for Cross-Domain Few-Shot Object Detection


151. KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing


152. Source-Grounded Semantic Reinforcement Learning for Low-Resource Target-Language Generation


153. MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery


154. Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles


155. SciIntBench: Measuring LLM Compliance with Research Integrity Norms Under Adversarial Framing


156. Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset


157. Adaptive Interviewing for Persona Simulation in LLMs: Evidence-Grounded Reasoning Improves Decision Alignment


158. SkillBrew: Multi-Objective Curation of Skill Banks for LLM Agents


159. Beyond Bilingual Transfer: Multilingual Code-Switching in Instruction Tuning


160. Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge


161. GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models


162. On the Optimizer Dependence of Neural Scaling Laws


163. SURGENT: A Surgical Multi-Agent Assistance System Across the Perioperative Workflow


164. GrepSeek: Training Search Agents for Direct Corpus Interaction


165. MusTBENCH: Benchmarking and Advancing Temporal Grounding in Music LLMs


166. Pocket-Dentist: On-Device Dental Image Understanding via Efficient Multimodal Large Language Models


167. Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA


168. Compute Allocation in Evolutionary Search: From Depth-Breadth to Multi-Armed Bandits


169. DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents


170. BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference


171. Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents


172. Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback


173. Sustainable Metal-Organic Framework Water Harvesters in the Artificial Intelligence Era



175. Parallax: Parameterized Local Linear Attention for Language Modeling


176. SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation


177. Toward User Preference Alignment in LLM Recommendation via Explicit Context Feedback


178. When and How Long? The Readout-Mediator Angle in Temporal Reasoning


179. unix-ctf: Procedural Environments for Unix-Competence Reinforcement Learning


180. GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization


181. OISD: On-Policy Internal Self-Distillation of Language Models


182. Structured Prompt Optimization Meets Reinforcement Learning for Global and Local Interpretability over Complex Text


183. SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers


184. Label-Free Reinforcement Learning via Cross-Model Entropy


185. Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening


186. Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization


187. Conf-Gen: Conformal Uncertainty Quantification for Generative Models


188. CosmicFish-HRM: Adaptive Reasoning via Hierarchical Recurrent Mechanisms in Compact Language Models


189. First head-to-head comparison of agentic AI applied to the analysis of simulated data of the Einstein Telescope


190. Hallucination Detection-Guided Preference Optimization for Clinical Summarization


191. GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human


192. LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis


193. Continuity and Ordinality Matter: Constraining Time Series Tokens for Effective Time Series Analysis with Large Language Models


194. Mechanistic origins of catastrophic forgetting: why RL preserves circuits better than SFT?


195. GPF-LiveNews: A Streaming Evaluation Protocol for Group-Conditioned Framing in Large Language Models


196. Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning


197. How Consistent Are LLM Agents? Measuring Behavioral Reproducibility in Multi-Step Tool-Calling Pipelines


198. Specialty-Specific Medical Language Model for Immune-Mediated Diseases


199. SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation


200. GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling


201. A comparative study of transformer-based embeddings for topic coherence


202. Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation


203. Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning


204. Micro-Macro Retrieval: Reducing Long-Form Hallucination in Large Language Models