LLM 관련 주요 논문 - 2026-09-10

1. ConvMem: Convolutional Memory for Long-Context Reasoning


2. Fortunate Recall: Ontology-Driven Memory Lifecycle Management for Persistent Coherence in LLMs


3. From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning


4. Beyond Surface Imitation: Contrastive Modeling for Reasoning Path Alignment in Multimodal In-Context Learning


5. Agent-Based ML-LLM Fusion with Self-Optimizing Prompts for Plateau Weather Alerts


6. RAP: Research Attention Prediction Reveals Target-Conditioned Evidence Acquisition Biases


7. OntologyAligner: Ontology-Aligned Retrieval and Hierarchy-Guided Large Language Model Reranking for Biomedical Ontology Normalization


8. Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability


9. Grounded Evaluation and Repair for NL-to-PDDL Problem Generation


10. Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format


11. AgentAudit: An Open, Extensible Framework for Full-Lifecycle Trust Evaluation of AI Agents


12. The Era by Eon Benchmark: A Generated Enterprise Estate with Exact Ground Truth for Benchmarking LLM Agents


13. UnitBoost: Managing Compound LLM Systems with a Merge Operator, Not a Model


14. Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward



16. PRAGMA: Evaluating Personalized Guidance with Memory Alignment in Lifelong Conversations


17. Black-Box Red Teaming of Agentic AI: A Taxonomy-Driven Framework for Automated Risk Discovery


18. From State Synchronization to Cognitive Self-Evolution: An Operational Architecture for Cognitive Digital Twins


19. CityPlanner: A Sandbox Agent for Executable Urban Planning


20. Multi-Agent Agentic Graph Learning via Structural Signatures


21. ContractEval: Query-Conditioned Execution Matching for Procedural Instruction Conformance


22. XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?


23. The Menu Is an Execution Prior: State-Path Tool Menus for Online Agents


24. Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks


25. OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows


26. Show-Harness: Just a VLM Agent Can Play Robots


27. Forgetting Only What Matters: Layer-Selective Unlearning toward Robust LLMs


28. Emergency Department Revisit Quality Review Screening: Exploring Human Decision-Making and Artificial Intelligence Support


29. Can Foundation Models Moderate Online Content? Evaluating Instruction- vs. Example-Driven Policy Operationalization


30. PACE: Perceived-Latency-Aware Cascading Service Routing and Filler Control for QoE-Efficient Retrieval-Augmented Dialogue Serving


31. Beyond One-Size-Fits-All: Sample-Adaptive Strategy Routing for Vision Token Pruning in MLLMs


32. RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding


33. DiSCo: A Distribution-First Steering and Cultural Prior Evaluation Framework for Measuring Cultural Preference Bias in LLMs


34. LiteRAG: Cost-Efficient Graph-Based Retrieval-Augmented Generation


35. Active Adaptation, Not Static Defense: Temporal Dynamics of Preventative Steering in Adversarial Fine-Tuning


36. Context operations to architecture modelling output from large language models and evaluation criteria for their use in systems engineering design


37. Direct Diversity Optimization for Diverse Successful Trajectories in Preference Post-Training


38. MetroLLM-Bench: Evaluating Language Models as Transit Kiosk Runtimes


39. Strangers to Themselves: What Language Models Say About Themselves Is Generic


40. Forward-Free LLM Depth Pruning via Weight Redundancy


41. CS-Guard: Benchmarking LLM Guardrails for Code Generation Security


42. How Fragile Is Safety Alignment at Frontier Scale? A Single-Direction Attack on a 320B MoE


43. LogiScope-VQA: Benchmarking Vision-Language Models for Logistics Hazard Identification in Industrial Scenarios


44. BRACE: Anchored Bellman-Residual Correction for Stale Critics in Asynchronous RL


45. When Auditors Fabricate: Batch-Size Degradation and Confident Hallucination in LLM Detection of Planted Document Contamination


46. The Vibe Shift in Software Engineering: Evaluating AI-Led Conversational Programming for Performance, Cognition, and Responsible Adoption


47. Arbitrary Cipher Attacks Against Large Language Models Do Not Require Fine-Tuning


48. From Fixed Keys to Readable Schemas: Small Language Models for Vehicle Agent Function Calls


49. Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements


50. An Experimental Evaluation of Multimodal Prompt Injection Attacks on Agentic AI Frameworks


51. VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models


52. Auditable Emergency Triage for Maternal and Newborn Care in India


53. Smart Adaptive Computing Across the Continuum: LLMs in IoT-Edge-Cloud Resource Management


54. In RAG We Trust? Measuring Robustness of Retrieval-Augmented Generation Under Document Poisoning


55. Talking to Itself While Coding: What Makes Comments Help Code Generation?


56. Scaling Post-Training Ternarisation to Qwen3-8B Capability Retention, Reproduction, Lossless Packing, and Packed Execution


57. Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents


58. Geometry Conditioning in an Embodied SLM: Training Controls and Robustness Diagnostics in a 0.8B Hybrid Model


59. Trust Me, I’m Your Developer: Self-Issued Authentication in Large Language Models


60. Characterizing Text Branch Sensitivity in Medical Vision-Language Segmentation via Evidence Decoupling


61. From Plausible to Actionable: A Position on LLM Self-Explanations


62. Quantifying Logical Consistency in Transformers via Query-Key Alignment