LLM 관련 주요 논문 - 2026-09-01

1. OntoAligner-Ensemble: Voting-Based Fusion across Heterogeneous Ontology Alignment Techniques


2. When Does Bigger Help? A Controlled Study of LLM Scale for Ontology Learning


3. BLOOM-WILT: Logit Tilting for Behaviour Elicitation in Automated LLM Auditing


4. Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data


5. Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores


6. CARVE: Verified Expansion for Variable-Length Generation in Diffusion Language Models


7. HSRM: Hidden-State Reward Models for Test-Time Verification


8. Autoregressive Mosaics: Probing 2D Spatial Reasoning in Text-Only Language Models


9. ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents


10. HiRS-Agent: A Hierarchical Multi-Agent System for Reliable Long-Horizon Remote Sensing Task Solving


11. Geometry of Divergence: Tracking Hidden-State Trajectories for Adaptive Multi-Turn Reasoning


12. Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle


13. TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI


14. AdaPath: Query-Adaptive Path-Finding via Path-Bank for Multi-Hop Implicit Biomedical KGQA


15. GarmentWeaver: Schema-Aware Structured Synthesis for Multimodal Sewing Patterns


16. Designing an Auditable LLM-Supported Workflow for Qualitative Thematic Analysis


17. DiffPDE: Masked Diffusion Language Models as PDE Solver


18. ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions


19. CM2: Multimodal Cultural Reasoning via an Integrated Multi-Agent Framework


20. CHASE: How Content Ecosystems Are Reshaped When Ranking Is the Only Target


21. EvoSkill Injection: Red-Teaming Autonomous Skill Generation and Evolution in Self-Evolving Agents


22. DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark


23. Dense Clinical Contrasts Enhance Medical Knowledge Updating in Large Language Models


24. Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation


25. Augmenting Human Performance with an XR Agent Learning from Online Behavior and BCI Evidence


26. Will the User Ever Know? Covert Indirect Prompt Injection on Tool-Using LLM Agents



28. Answer Probing-Guided Search for Diverse Solution Exploration of LLMs


29. Ignorance or Incompetence? Constructing Knowledge-Gated, Verifiable Tasks for LLM Agents


30. Generating Workflow DAGs from Natural Language with Non-Reasoning LLMs


31. LLM-Based Knowledge Graph Completion Combining Discrete Structural Coding with Similar Entity Information


32. FaVOR: LLM-Based Agentic Framework for Factor Mining via Empirical Validation


33. A.X K2 Technical Report


34. Spec2Twin-Chain: Orchestrating Bi-Level Optimization with LLMs for Blockchain Digital Twin Construction


35. Can LLM Agents Discover? Evaluating Creativity on ML Engineering Tasks


36. Balance of Benchmarks: Semantic Density Reweighting for Benchmark Multiplicity and Task-Conditioned Evaluation


37. Interpreting and Steering for Safe and Correct Code Generation


38. Automatic Conversion of NICE Guidelines to an Executable Computational Model Using Large Language Models


39. AutoCRAT: Within-trajectory Joint Control of Stochasticity and Compute for LLM Reasoning


40. Review Before Trust: Source-Grounded Integrity Gates for AI-Assisted Personal Health Records


41. Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization


42. FRAMEWORKERS: A Dynamic Multi-Agent Framework for AI-Generated Video Production


43. Ideation Arena: Evaluating LLM Generated Research Ideas with Battle-style Human Expert Assessment


44. Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems


45. LLMs Interpret, Embeddings Organize, Graphs Emerge: Agent-Driven Compilation of Scientific Knowledge


46. Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security


47. Call Neighbours Yourself: Graph Walks with Destination-Conditioned On-Policy Self-Distillation


48. Toward Latent Language Model Skills Steering and Optimization: An Empirical Study


49. EvoGenUI-Bench: Evaluating LLMs as Multi-Turn Generative UI Assistants


50. TRACER: Per-Tool Context Retention for LLM Agents via Consequence-Attributed Reinforcement Learning


51. Cross-Relational Preference Learning for Better LLM Instruction Following


52. BIRD-History: A Benchmark for History-Driven Text-to-SQL with Fine-Grained Knowledge Annotations


53. MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs


54. RACER: Reinforced Agent Collaboration for Explainable Reasoning on Knowledge Graphs


55. GuardianAgent: Policy-Conditioned Risk-Adaptive Anonymization with Verified Adversarial Escalation


56. Validating FKG.in: Soundness Assessment in LLM-Augmented Indian Food Knowledge


57. Localizing Emergent Failures in Agentic AI: Recovering Minimal Repair Families via Counterfactual Replay


58. Hyper-Fold: Exploring the Expressive Limit of Sequence-Geometry Learning for Proteins via Hypergraph Modeling


59. Benevolent Bias in Multi-Turn Human-Agent Dialogue


60. How Identity and Opinion Shape Political Sycophancy in LLMs


61. JudgePanel: A Compact Judge with Panel Deliberation via Adaptive Multi-Reward Reinforcement Learning


62. APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows


63. Beyond Correctness: Validity-Oriented Evaluation of Biomedical LLM Judges


64. Emergent Misalignment Is Not Magical


65. EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation


66. HANIA: Planner-Guided Multimodal Graph Evidence Selection for Grounded Question Answering


67. Agent2UCB: Agentic System for Generative Engine Optimization


68. EmoLASP: Emotion Recognition with Language Models and Answer Set Programming


69. Learning to Follow In-Context Watermark Instructions via Self-Distillation


70. Facts Without Rules: Boundary Metadata Collapse in Multi-Agent LLM Handoffs


71. Agentic AI uncovers conserved cross-tissue protein co-abundance programs inaccessible to single-dataset analysis


72. Selective Forgetting: A Graph-Based Memory Framework for Long-Term LLM Agents



74. Oculi: A Conversational Agentic Platform for Automated Credit Risk Analysis


75. MineCEraft: Evaluating Language Models as Construction Engineers in the World of Minecraft


76. Evaluating the Hidden Costs of Personalization in Large Language Models


77. Discovering Machine Correlates of Consciousness


78. Capability-Stratified Degradation in Ternary Language Models


79. Enhancing SAE-based Steering via Neighbor Integrated Feature Selection


80. PermitGPT: A Unified Generative-AI Pipeline for Construction Hazard Forecasting, Permit Prediction, and Community Impact


81. Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference


82. Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification


83. A Generalized Optimization Engine (GOE) for Edge AI Inference Acceleration


84. How Language Models Choose Sides: Internal Representations of Instruction Hierarchy


85. BiasMix-Finance: Post-Generation KYC Guardrails for LLM Portfolio Advice


86. Reward-Oracle MCTS for Formal Theorem Proving: Sample-Efficient Search and the Need for Kernel-Level Proof Auditing


87. AutoScientist-Quant: Self-Evolving Coding Agents for Automatic Research in Quantitative Investment


88. CDEP Agent: Connecting Meteorologically Detected Temporal Compound Events to Real-World Documentary Evidence


89. TPvG: A Moral Decision Framework for Large Language Models from One-Shot to Sequential Feedback


90. RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences


91. SHAPE of Chain-of-Thought in Math Reasoning


92. CDPR: Counterfactual Advantage-based Credit Assignment for Cost-Aware Sequential Medical Diagnosis


93. The Race between Agentic AI Capabilities and Data Quality Control in Online Surveys


94. Paper Pilot: A Human-in-the-Loop Expert System for Evidence-Traceable Scientific Manuscript Generation in Applied Sciences



96. A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making


97. DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation


98. LLM Post-Training as Brownfield Maintenance: An Industrial Perspective on Dataware Engineering


99. LLM Judges Verify Presence, Not Absence: Omission Blindness in AI Clinical Notes and What Recovers It


100. Stick to What You Know: A Study of Knowledge-Aligned Supervised Fine-Tuning


101. Evaluating and Improving LLM Self-Modeling


102. A Universal Context-Reuse Layer for Cross-Model KV Sharing


103. LOCI: A Locator-Critic with Refinement Loop


104. LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation


105. Stride-k Subsampling: Train-Free Audio Token Reduction for Whisper


106. Evaluating and Mitigating Anti-LGBTQ Biases in German and Multilingual Language Models


107. Personas Differ from Native-Language Generation: Language Pathways Shape LLM Interpersonal Advice


108. On the Prospects of Dynamic LLM Conversations in Software Development


109. Calibrating Small Language Models for Claim Check-Worthiness Detection


110. BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks


111. SingProbe Technical Report


112. An Agentic Retrobiosynthesis Framework with Learned Frontier Selection


113. LCoT-GV: Graph Attention Networks for Verifying Long Reasoning Chains in Large Language Models


114. CoMPASS: Collaborative Molecular Property Prediction via Adaptive Small-Large Model Synergy


115. Fine-Grained Multi Image Object Hallucination Benchmark


116. BiG-SURE - Bipartite Graph for Semantic Uncertainty and Reliability Estimation of LLMs


117. GMTS: Gradient Magnitude-based Token Selection Improves RLVR Training for LLM Reasoning


118. Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text


119. Reading the News: Adapting Large Language Models to Swedish Journalism Through Continued Pre-Training


120. Generative Retrieval for E-commerce: Jointly Learning Embedding and Codebook with Same Product Cluster


121. Q-Strata: Hierarchical Bit Allocation for Mixed-Precision Quantization of Mixture-of-Experts LLMs


122. Lot Machine: Multimodal Lot Extraction from Auction Catalogs


123. Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability


124. ImageEval 2026: Culturally Grounded Arabic Multimodal Evaluation


125. Enhancing Low-Resource Language Reasoning via High-Resource Language Feature Transfer


126. Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions


127. Towards Cognitive Process-Aware Proactive Writing Support


128. Whole-Slide Image Analysis under Realistic Few-Shot Annotation Protocols


129. SemPOI-RL: Aligning LLM Semantic Reasoning for Interpretable Out-of-Town POI Sequential Generation


130. Using Grounded Theory for Agent Behavior Analysis at Scale


131. Beyond Ranking Accuracy: Evaluating LLM-Cited Feature Rationales for Next Basket Repurchase Recommendation


132. Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering


133. Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs


134. ScenePilot: Grow-and-Repair Policy for Text-Driven 3D Indoor Scene Generation


135. CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration


136. Centering before Pruning: Lightweight Geometry Correction for Diversity-Based Visual Token Pruning in LVLMs


137. Using Prosody to Predict Syntactic Structure


138. Stratified Consistency Distillation for Natural Language Formalization


139. Beyond Surface Forms: Symbolic Edits as a Test for Logical Reasoning with LLMs


140. The Differential Reasoning Router: Operationalizing Cost-Aware LLM Annotation in E-commerce


141. SIR: Self-improving Red-teaming for Compute Use Agents


142. CPR for LLMs: Critical-Point Routing against Catastrophic Forgetting in Domain Adaptation


143. E-SENS: Exclusion-Sensitive Penalization for Negative-Constraint Retrieval


144. Can LLMs Take the Pulse of the Economy? A Real-Time Evaluation of LLM Nowcasts on Macroeconomic Indicators


145. Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer


146. How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account


147. Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark


148. Reachability-Based Capability Confinement for LLM Agents under Indirect Prompt Injection


149. “Act Like a 5th Grader” is Not Enough: Bounding Knowledge in LLM-Based User Simulators


150. Error Detection for PET/CT Radiology Reports: Domain-Specific vs Large Language Models


151. TEMPO: Temporally-grounded Multi-task Post-training for Large Audio-Language Models


152. Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models


153. Generating Clinical Vignettes that Preserve Cognitive Formulations


154. Beyond Fluency: A Rubric-Based Benchmark for Evaluating Saudi Dialect and Cultural Competence in Large Language Models


155. Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents


156. Hallucination Mitigation for Large Vision-Language Models via Implicit Feature Stabilization


157. Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With?


158. IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil


159. When Less is More: Understanding When Token Filtering Helps and Fails in AI-generated Text Detection


160. Conducting Stylistic Analysis of Paintings through an Art-History Agent


161. LLMODE: Aligning ODEs with LLMs via Gated Token Injection for Irregular Spatio-Temporal Forecasting


162. AgenticRag-R1: Agentic Reinforcement Learning with Stack Memory for Multi-Step Reasoning, Retrieval and Memorizing


163. CineForge: Self-Improving Agents for Long-Horizon Video Generation


164. SUP-MIMIC: A Multi-Task Clinical Diagnosis Benchmark for Evaluating LLMs’ Robustness to Contradictory Evidence


165. Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift


166. Integrating adaptive human behavior into epidemic models with large language models


167. The Emergent Symbolic Structure of Artificial Neural Networks


168. Argument-Aware Semantic Alignment of Normative Texts: A Toulmin-Based Neuro-Symbolic Approach


169. MUDDLE: Measuring Understanding of Documents under Distractor and Length Effects


170. Arabic Safety Alignment as Selective Refusal: An Empirical Study of SFT, DPO, and Guard Calibration


171. Hyper3-CLIP: Hierarchy-Conditioned Hyperbolic Vision-Language Training


172. Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase


173. Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition


174. Detecting and Repairing Hallucinations in Retrieval-Augmented Generation


175. Learning Simple Test-Time Environments for LLM Web Agents


176. When Do Larger Batches Help Scale LLM Reinforcement Learning?


177. Measurement Validity in LLM Cultural Alignment


178. HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding


179. Auditing and Mitigating Privacy Leakage in Cloud-Edge Collaborative Decoding


180. Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks


181. Not All or None: Dynamic Construction of Target-aware Memory Graph for Conversational Stance Detection


182. DocIntent: Answerability-Guided Agentic Restoration for Real-World Document Visual Question Answering


183. A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability


184. Free Speech and Artificial Intelligence


185. The Hallucination Signal Is a Mean Shift: Why Simple Probes Suffice


186. Structured State Reconciliation for Human-AI Task Handover


187. A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives


188. ASTRA - Agentic System for Ticket Resolution and Analysis


189. RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction


190. Defending Wearable VLMs Against Private Attribute Inference


191. GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon


192. Test-Time Scaling for Scientific Equation Discovery


193. Can Large Language Models Identify Meaningful Touchpoints in Conversion Attribution?


194. Do MLLMs Really Understand Low-Resource Khmer Documents? A Pilot Study on Khmer Document VQA


195. Intelligent Identification and Repair of Design Defects in BIM via Domain-Specific Large Language Models


196. Do large language models scrutinise what they review? A multimodal audit of scoring calibration, error detection, and author-identity effects


197. MA-RAG: Multi-Agent Retrieval-Augmented Generation for Query-Driven Summarization of Longitudinal Parkinson’s Disease Assessments


198. Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure


199. PUFFER: Incremental Fuzzy Deduplication for Continuously Evolving Corpora


200. Gurukul AI: An Interactive AI-Driven Educational Platform for Indian Education System


201. Parametric Multimodal User Memory: Storing What Captions Cannot Carry


202. PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response