LLM 관련 주요 논문 - 2026-09-14

1. Rethinking Heterogeneous System Disaggregation for Subquadratic Attention


2. Autonomous Research for Open-Ended Problems: A Case Study on Telecom Ticket Retrieval


3. Anchoring Clinical Events in Time: UID-Preserving Multimodal Reconstruction and Source-Grounded Adjudication


4. How Good Are Frontier Models at Physics? Expert Re-Grading Reveals Broken Evaluations and Near-Saturation of Leading Benchmarks


5. EduFair-Bench: Evaluating Pedagogical Fairness of LLM Tutors Across Student Demographics


6. MedRoundsQA: A Persona and Difficulty Aware Evaluation for Multi-Turn Medical Consultations


7. Scaling Clinical Judgment to Evaluate Medical AI


8. K-Bench: A Benchmark for LLM Unlearning in Agentic Deployments


9. Assisted Spatial Cognition Through Vision-Language Models


10. What Drives Recovery in Agentic Text-to-Cypher? LAST-CQ: An LLM Agent Self-Refinement Framework


11. Implicit Personality Representations in Humans and LLMs


12. I Am AdMan: A Pipeline for Automatic Generation of Personalized Advertising Imagery


13. Residual Vector-based Reconstruction as Long-Context Recall Regardless of Context Window Size


14. From Collaboration to Capability: Internalizing Routed LLM Experts into Compact Reasoners


15. Information Specialization and Constrained Synthesis in Multi-Agent LLM Forecasting: A Prospective Live-Study of the 2026 FIFA World Cup


16. Confidence-Gated Transductive Test Generation for Code Reranking


17. TripPattern: A Pattern-based Text Watermarking Method for Large Language Models


18. Beyond Vector Similarity: Hierarchical Context-Aware Graph RAG vs Standard RAG in Enterprise Code Migration


19. Do LLMs Trust the Accuser or the Accusation? Measuring Belief Shifts in Werewolf


20. LifeFuse-Mem: Lifecycle-Aware State Fusion Against Temporary Overwriting for Long-Term Memory


21. SoK: Rethinking Jailbreaking in the Era of Agentic AI: Attacks, Defenses, and Practical Consideration


22. VRL-Bench: Benchmarking agents on computer control tasks under finite trial budgets


23. Beyond ID Embeddings: Process-Grounded Language Modeling for Cognitive Diagnosis


24. Toward Robust Personalized Alignment for LLMs: Mitigating Persona Drift in Multi-Turn Dialogue


25. Affective Agent: On-Device Personalized Intervention Reasoning for Wearable Systems


26. AIM: A Privacy-Aware Interoperable Memory Framework for Multi-Agent Multi-User LLM Systems


27. T-GADE: Thermodynamical Generative-AI-Driven Evolution of LLM Artifacts


28. GTA: Graph Theory Agent and Benchmark for Algorithmic Graph Reasoning with LLMs


29. Can LLMs in Draft-Verify-Revise Pipelines Resolve Deictic Ambiguity?


30. Language Is an Insufficient Substrate for Quantitative Reasoning, and Consequential Domains Need Large Quantitative Models


31. Competence-Gated Pooling of Language Models and Priors for Event Forecasting


32. Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite


33. ASTRIL-MPC: Autonomous Traversal Framework of Articulated Tracked Robots with Language-Guided Neural-Kinematic MPC


34. MAxBench: A Multinomial Concept Recovery Benchmark


35. Attention Quantization for Tabular Foundation Models


36. Tasks over Application Manuals: Revealing Gaps in Long-Horizon Procedural Reasoning for Language Models


37. LLM-Enhanced Dual-Branch Learning for Large-Scale Multi-Label Text Classification


38. Behavior Quotient Learning for Low-Rank Adaptation of LLM Agents


39. A Graph-Based Approach for Mapping Kernel-Level Telemetry to MITRE ATT&CK


40. Evaluating Context Segmentation in Locally Deployable SLMs for Cybersecurity CTF Tasks


41. Cognition on Graph: Navigating Massive Knowledge Space via Cognitive Cycles and Bidirectional Graph-Text Synergy


42. Separating Engineering Reasoning from DEXPI Serialization in LLM-Based Greenfield Surface-Process Design: A Three-Case Study for Underground Gas Storage


43. Direct Preference Density Alignment for Conversational Audio Equalization


44. Clustering-Based Balanced Sampling and Allocation with Data Parallelism for High-Performance Fine-Tuning


45. Calibrated Ambiguity in Multimodal Language Models: Humans reach for cultural references, while models describe the picture


46. RoofLang: Enabling AI-Driven Architecting of LLM Inference Systems


47. Earth-Agent-Pro: Towards Real-World Full-Chain Earth Observation with Agents


48. Bridging Vision Foundation Model Priors with CLIP for Spatial-aware Few-shot Anomaly Detection in Medical Images


49. Debiasing as a Measurement Intervention: Calibrated Ties and Resolution Loss in LLM-as-a-Judge Evaluation


50. UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation


51. ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge


52. HypoKG: Evidence-Disciplined Biomedical Hypothesis Generation Beyond Endpoint Knowledge



54. Chopthin-Consensus Power Sampling: A Diversity-Preserving Approach to LLM Decoding


55. Repair Before Reinforce: Context-Augmented Knowledge Graph Reasoning for Multi-Hop Question Answering


56. Retrieval-Augmented Generation for Scientific Code Understanding


57. Agentic TCAD Calibration Workflow for Oxide Semiconductor Transistors


58. NDT Factory: Synthesizing Verified Network Digital Twins from Semantic Models via Multi-Agent LLM


59. A decision-basis contract for auditable LLM-assisted medical billing verification: deterministic rules, verbatim evidence, and fail-closed abstention


60. Extracting Dataset Mentions in Forced Displacement and FCV Documents: A Weakly Supervised Framework with LLM-Based Label Refinement


61. Creating an Atomic User Model for Personality-Aware Large Language Model Interaction


62. Can We Trust LLM Judges: A Study of Capability-Dependent Biases and Multi-Judge Ensemble for Bias Calibration


63. PRISMA-LLM: An Empirical Reporting Framework for AI-Assisted Systematic Reviews