LLM 관련 주요 논문 - 2026-06-25

1. InvestPhilBench: A Multi-Layer Dynamic Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy


2. Agentic System as Compressor: Quantifying System Intelligence in Bits


3. GUI agent: Guided Exploration of User-Sensitive Screens


4. Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning


5. Quantization Inflates Reasoning: Token Inflation as a Hidden Cost of Low-Bit Reasoning Models


6. BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding


7. Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions


8. Agentic Knowledge Tracing: A Multi-Agent LLM Architecture for Stealth Assessment of Financial Literacy in Serious Games


9. Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty


10. TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory


11. Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms


12. Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners


13. The Hitchhiker’s Guide to Agentic AI: From Foundations to Systems


14. Learning Action Priors for Cross-embodiment Robot Manipulation


15. Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents


16. Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining


17. TriViewBench: Controlled Complexity Scaling for Multi-View Structural Reasoning in MLLMs


18. SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models


19. Weave of Formal Thought


20. Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study


21. Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift


22. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models



24. Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety


25. Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks


26. Internal Data Repetition Destroys Language Models


27. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning


28. Uncertainty-aware reinforcement learning for chemical language models


29. LLM Performance on a Real, Double-Marked GCSE Benchmark


30. Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models


31. MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios


32. EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis


33. Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction


34. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation


35. LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning


36. Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection


37. Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis


38. TheoremGraph: Bridging Formal and Informal Mathematics


39. Decoupling Reconnaissance and Exploitation: Measuring the Capability Boundaries of LLM-Based Web Penetration Testing


40. Improved Large Language Diffusion Models


41. Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation


42. EPTS: Elastic Post-Training Sparsity for Efficient Large Language Model Compression


43. Stabilizing black-box algorithms through task-oriented randomization


44. ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments


45. What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics


46. ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory


47. Hitting a Moving Target: Test-Time Adaptation for AI Text Detection under Continual Distribution Shift


48. Training for the Model You Return: Improving Optimization for Iterate-Averaged Language Models



50. Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety


51. Geo-Strat-RL: Learning Geological Event Reasoning from Verifiable Tasks


52. Internal Data Repetition Destroys Language Models


53. ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning


54. Uncertainty-aware reinforcement learning for chemical language models


55. LLM Performance on a Real, Double-Marked GCSE Benchmark


56. Perfect Detection, Failed Control: The Geometry of Knowing vs. Steering in Language Models


57. MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios


58. EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis


59. Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction


60. Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation


61. LLM Evolution as an Industry-Scale Ecosystem: A Lifecycle Perspective on Continual Learning


62. Dense Supervision Is Not Enough: The Readout Blind Spot in Looped Language Models



64. ReviewGuard: Aligning LLM-Assisted Peer Review with Long-Term Scientific Impact


65. Small edits, large models: How Wikipedia advocacy shapes LLM values