Skip to content

Agentic AI / LLM Agents — 2025 · Paper list (400)

December 2025 (103)

Date Paper Venue Why selected
2025-12-31 MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes AAAI 2026
2025-12-30 What Drives Success in Physical Planning with Joint-Embedding Predictive World Models? TMLR
2025-12-30 Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks AAAI 2026
2025-12-29 The World Is Bigger! A Computationally-Embedded Perspective on the Big World Hypothesis NEURIPS 2025
2025-12-29 AI4Reading: Chinese Audiobook Interpretation System Based on Multi-Agent Collaboration ACL 2025
2025-12-29 It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents ICML 2026
2025-12-27 Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks ACL 2026
2025-12-27 Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring AAAI 2026
2025-12-26 SpatialBench: Can Agents Analyze Real-World Spatial Biology Data? NEURIPS 2024
2025-12-26 MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting NEURIPS 2025
2025-12-25 MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles ICML 2025
2025-12-25 AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design AAAI 2026
2025-12-25 Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations NEURIPS 2025
2025-12-24 LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs AAAI 2026
2025-12-23 AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent ICLR 2026
2025-12-23 SlideTailor: Personalized Presentation Slide Generation for Scientific Papers AAAI 2026
2025-12-23 M\(^3\)KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation CVPR 2026
2025-12-23 Spatio-Temporal Graphs Beyond Grids: Benchmark for Maritime Anomaly Detection NEURIPS 2025
2025-12-22 EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration CVPR 2026
2025-12-22 With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems AAAI 2026
2025-12-22 Reflection-Driven Control for Trustworthy Code Agents AAAI 2026
2025-12-21 LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction AAAI 2026
2025-12-21 Toward Training Superintelligent Software Agents through Self-Play SWE-RL ICML 2026
2025-12-20 LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators EMNLP 2025
2025-12-20 LLM-based Few-Shot Early Rumor Detection with Imitation Agent KDD 2026
2025-12-20 Intelligent Human-Machine Partnership for Manufacturing: Enhancing Warehouse Planning through Simulation-Driven Knowledge Graphs and LLM Collaboration AAAI
2025-12-19 iOS as Acceleration NEURIPS 2025
2025-12-18 Meta-RL Induces Exploration in Language Agents ICLR 2026
2025-12-18 Open Ad-hoc Categorization with Contextualized Feature Learning CVPR 2025
2025-12-17 Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning AAAI 2026
2025-12-17 Autonomous Pressure Control in MuVacAS via Deep Reinforcement Learning and Deep Learning Surrogate Models NEURIPS 2025
2025-12-16 Understanding and Improving Hyperbolic Deep Reinforcement Learning ICLR 2026
2025-12-15 Workflows vs Agents for Code Translation NEURIPS 2025
2025-12-15 Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors AAAI 2026
2025-12-15 A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments ICML 2026
2025-12-15 AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning ICCV 2025
2025-12-15 What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty ACL 2026
2025-12-15 Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows ACL 2026
2025-12-15 An Open and Reproducible Deep Research Agent for Long-Form Question Answering NEURIPS
2025-12-15 GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training CVPR 2026
2025-12-15 Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion AAAI
2025-12-14 WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment ICLR 2026
2025-12-13 RAST-MoE-RL: A Regime-Aware Spatio-Temporal MoE Framework for Deep Reinforcement Learning in Ride-Hailing ICML 2026
2025-12-13 VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding CVPR 2026
2025-12-12 Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms NEURIPS 2025
2025-12-12 Factor(U,T): Controlling Untrusted AI by Monitoring their Plans AAAI 2026
2025-12-12 BAID: A Benchmark for Bias Assessment of AI Detectors AAAI 2026
2025-12-12 Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance AAAI 2026
2025-12-12 A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation NEURIPS 2025
2025-12-11 Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution ACL 26
2025-12-11 InfoCom: Kilobyte-Scale Communication-Efficient Collaborative Perception with Information Bottleneck AAAI
2025-12-10 INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT MIDL 2026
2025-12-10 Structured Personalization: Modeling Constraints as Matroids for Data-Minimal LLM Agents AAAI 2026
2025-12-10 SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration NEURIPS 2025
2025-12-10 SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation ICLR 2025
2025-12-10 Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning CVPR 2026
2025-12-09 WOLF: Werewolf-based Observations for LLM Deception and Falsehoods NEURIPS 2025
2025-12-09 ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making NEURIPS 2025
2025-12-09 SoMe: A Realistic Benchmark for LLM-based Social Media Agents AAAI 2026
2025-12-09 rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection ACL
2025-12-08 Automating High Energy Physics Data Analysis with LLM-Powered Agents NEURIPS 2025
2025-12-08 LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services KDD 2026
2025-12-08 Training Language Models to Use Prolog as a Tool ACL 2025
2025-12-08 Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning AAAI 2026
2025-12-07 LLM-Driven Composite Neural Architecture Search for Multi-Source RL State Encoding NEURIPS 2025
2025-12-07 Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis AAAI 2026
2025-12-07 TeachMaster: Generative Teaching via Code ACL 2026
2025-12-05 ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment AAAI 2026
2025-12-05 JaxWildfire: A GPU-Accelerated Wildfire Simulator for Reinforcement Learning NEURIPS 2025
2025-12-05 FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction NEURIPS 2025
2025-12-05 ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education ICML 2026
2025-12-05 CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning NEURIPS 2025
2025-12-05 Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment AAAI 2026
2025-12-05 The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems AAAI 2026
2025-12-04 Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective AAAI 26
2025-12-04 Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs ACL 2026
2025-12-04 Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operation Orchestration AAAI
2025-12-04 Executable Governance for AI: Translating Policies into Rules Using LLMs AAAI
2025-12-04 Learning to Orchestrate Agents in Natural Language with the Conductor ICLR 2026
2025-12-04 Love First, Know Later: Persona-Based Romantic Compatibility Through LLM Text World Engines NEURIPS 2025
2025-12-04 Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism ICML 2026
2025-12-03 Evaluating Long-Context Reasoning in LLM-Based WebAgents NEURIPS 25
2025-12-03 Toward Virtuous Reinforcement Learning: A Critique and Roadmap AAAI 2026
2025-12-03 EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths NEURIPS 2025
2025-12-03 Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks AAAI 2026
2025-12-03 AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation NEURIPS
2025-12-03 Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia NEURIPS
2025-12-02 Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases AAAI 2026
2025-12-02 Scaling Internal-State Policy-Gradient Methods for POMDPs ICML 2002
2025-12-02 SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control SIGGRAPH 2026
2025-12-02 Measuring Agents in Production ICML 2026
2025-12-02 Hypothesis Testing for Generalized Thurstone Models ICML 2025
2025-12-02 Zero-Shot Instruction Following in RL via Structured LTL Representations ICML 2025
2025-12-02 Spoken Conversational Agents with Large Language Models EMNLP 2025
2025-12-02 When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents AAAI 2026
2025-12-02 WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning CVPR 2026
2025-12-01 STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls NEURIPS 2025
2025-12-01 Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading NEURIPS 2025
2025-12-01 Forecasting in Offline Reinforcement Learning for Non-stationary Environments NEURIPS 2025
2025-12-01 Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning NEURIPS 2025
2025-12-01 InnoGym: Benchmarking the Innovation Potential of AI Agents ICLR 2026
2025-12-01 Extending NGU to Multi-Agent RL: A Preliminary Study NEURIPS 2025
2025-12-01 DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks AAAI 2026

November 2025 (108)

Date Paper Venue Why selected
2025-11-30 CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding ICML 2026
2025-11-30 CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents ACL 2026
2025-11-30 Agentic Persona Control and Task State Tracking for Realistic User Simulation in Interactive Scenarios NEURIPS 2025
2025-11-30 Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning CVPR 2026
2025-11-30 Memory-Integrated Reconfigurable Adapters: A Unified Framework for Settings with Multiple Tasks NEURIPS 2025
2025-11-30 On the Regulatory Potential of User Interfaces for AI Agent Governance NEURIPS 2025
2025-11-29 AgentODRL: A Large Language Model-based Multi-agent System for ODRL Generation AAAI 2026
2025-11-29 Evaluating LLMs in Open-Source Games NEURIPS 2025
2025-11-29 Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning NEURIPS 2025
2025-11-29 Provable Memory Efficient Self-Play Algorithm for Model-free Reinforcement Learning ICLR 2024
2025-11-29 Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models ICML 2026
2025-11-28 Does Self-Evaluation Enable Wireheading in Language Models? AAAI 2026
2025-11-28 MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents CVPR 2026
2025-11-28 Language-conditioned world model improves policy generalization by reading environmental descriptions NEURIPS 2025
2025-11-27 Exact Learning of Arithmetic with Differentiable Agents NEURIPS 2025
2025-11-27 A Computable Game-Theoretic Framework for Multi-Agent Theory of Mind AAAI 2026
2025-11-27 Asking like Socrates: Socrates helps VLMs understand remote sensing images CVPR 2026
2025-11-27 Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation CVPR 2026
2025-11-27 Real-Time Procedural Learning From Experience for AI Agents ICLR 2026
2025-11-26 Heterogeneous Multi-Agent Reinforcement Learning with Attention for Cooperative and Scalable Feature Transformation KDD 2026
2025-11-26 Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving NEURIPS 2025
2025-11-26 BAMAS: Structuring Budget-Aware Multi-Agent Systems AAAI 2026
2025-11-26 Prune4Web: DOM Tree Pruning Programming for Web Agent AAAI 2026
2025-11-25 MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology NEURIPS 2025
2025-11-25 Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection CVPR
2025-11-25 "Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents AAAI 2026
2025-11-24 Agint: Agentic Graph Compilation for Software Engineering Agents NEURIPS 2025
2025-11-24 DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research ICML 2026
2025-11-24 PRInTS: Reward Modeling for Long-Horizon Information Seeking ACL 2026
2025-11-24 A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis AAAI 2026
2025-11-24 AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention CVPR 2026
2025-11-24 Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations NEURIPS 2024
2025-11-24 Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion CVPR 2026
2025-11-23 Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning NEURIPS 2025
2025-11-23 Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems AAAI 2026
2025-11-23 \(A^2Flow:\) Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators AAAI
2025-11-23 Hierarchical Deep Research with Local-Web RAG: Toward Automated System-Level Materials Discovery NEURIPS 2025
2025-11-23 Coherent Multi-Agent Trajectory Forecasting in Team Sports with CausalTraj AAAI 2026
2025-11-22 Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning TMLR
2025-11-22 The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems NEURIPS
2025-11-22 A superpersuasive autonomous policy debating system AAAI 2026
2025-11-21 ToC: Tree-of-Claims Search with Multi-Agent Language Models AAAI 2026
2025-11-20 D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies AAAI 2026
2025-11-20 Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense AAAI
2025-11-20 PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization AAAI 2026
2025-11-20 Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art NEURIPS 2025
2025-11-19 AquaSentinel: Next-Generation AI System Integrating Sensor Networks for Urban Underground Water Pipeline Anomaly Detection via Collaborative MoE-LLM Agent Architecture AAAI 2026
2025-11-19 IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation ISBI 2026
2025-11-19 Identifying the Supply Chain of AI for Trustworthiness and Risk Management in Critical Applications AAAI
2025-11-19 IPR-1: Interactive Physical Reasoner CVPR 2026
2025-11-19 DEPO: Dual-Efficiency Preference Optimization for LLM Agents AAAI 2026
2025-11-19 SOLID: a Framework of Synergizing Optimization and LLMs for Intelligent Decision-Making NEURIPS 2025
2025-11-19 Learning Human-Like RL Agents Through Trajectory Optimization With Action Quantization NEURIPS 2025
2025-11-18 AutoTool: Efficient Tool Selection for Large Language Model Agents AAAI 2026
2025-11-18 ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing ICML 2026
2025-11-18 Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning ACL
2025-11-18 Object-Centric World Models for Causality-Aware Reinforcement Learning AAAI
2025-11-18 PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval ICLR 2026
2025-11-17 Causal Reinforcement Learning based Agent-Patient Interaction with Clinical Domain Knowledge AAAI
2025-11-17 FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI AAAI 2026
2025-11-17 Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction AAAI 2026
2025-11-17 Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment AAAI 2026
2025-11-17 Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition AAAI 2026
2025-11-17 Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction AAAI 2026
2025-11-17 Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-Making AAAI 2026
2025-11-17 Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance AAAI 2026
2025-11-16 Expressive Temporal Specifications for Reward Monitoring AAAI
2025-11-16 Adaptively Coordinating with Novel Partners via Learned Latent Strategies NEURIPS 2025
2025-11-16 Beyond Fixed Tasks: Unsupervised Environment Design for Task-Level Pairs AAAI
2025-11-16 Co-Layout: LLM-driven Co-optimization for Interior Layout AAAI 2026
2025-11-15 More Than Irrational: Modeling Belief-Biased Agents AAAI 2026
2025-11-15 MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning AAAI 2026
2025-11-15 HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning AAAI 2026
2025-11-14 Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping AAAI 2026
2025-11-14 From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions AAAI
2025-11-14 LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models ACL 2026
2025-11-14 RLSLM: A Hybrid Reinforcement Learning Framework Aligning Rule-Based Social Locomotion Model with Human Social Norms AAAI 2026
2025-11-14 iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference AAAI 2026
2025-11-14 Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning AAAI 2026
2025-11-14 Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA AAAI 2026
2025-11-14 Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents AAAI
2025-11-14 ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving KDD 2026
2025-11-14 Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection AAAI
2025-11-14 Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization AAAI 2026
2025-11-13 Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning NEURIPS 2025
2025-11-13 Optimal Welfare in Noncooperative Network Formation under Attack AAAI 2026
2025-11-13 Regular Games -- an Automata-Based General Game Playing Language AAAI 2026
2025-11-13 Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models AAAI 2026
2025-11-13 Explaining Decentralized Multi-Agent Reinforcement Learning Policies AAAI
2025-11-13 VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction WACV 2026
2025-11-13 GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt AAAI
2025-11-13 Multi-agent In-context Coordination via Decentralized Memory Retrieval AAAI
2025-11-13 SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models AAAI 2026
2025-11-13 Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents AAAI 2026
2025-11-13 CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D NEURIPS 2025
2025-11-12 Beyond Monotonicity: Revisiting Factorization Principles in Multi-Agent Q-Learning AAAI 2026
2025-11-12 Out-of-Distribution Generalization with a SPARC: Racing 100 Unseen Vehicles with a Single Policy AAAI 2026
2025-11-12 Echoing: Identity Failures when LLM Agents Talk to Each Other ICLR
2025-11-12 Robust and Diverse Multi-Agent Learning via Rational Policy Gradient NEURIPS 2025
2025-11-12 Environment Scaling for Interactive Agentic Experience Collection: A Survey NEURIPS 2025
2025-11-12 ProBench: Benchmarking GUI Agents with Accurate Process Information AAAI 2026
2025-11-12 Enabling Agents to Communicate Entirely in Latent Space ACL 2026
2025-11-12 History-Aware Reasoning for GUI Agents AAAI 2026
2025-11-12 Good-for-MDP State Reduction for Stochastic LTL Planning AAAI 2026
2025-11-12 The Double Contingency Problem: AI Recursion and the Limits of Interspecies Understanding NEURIPS 2025
2025-11-11 Adaptive Multi-Agent Response Refinement in Conversational Systems AAAI 2026
2025-11-11 Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates AAAI
2025-11-11 SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories AAAI 2026

January 2025 (189)

Date Paper Venue Why selected
2025-01-01 MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching NeurIPS 2025
2025-01-01 Multi-Agent Imitation by Learning and Sampling from Factorized Soft Q-Function NeurIPS 2025
2025-01-01 MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis NeurIPS 2025
2025-01-01 MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks NeurIPS 2025
2025-01-01 AI-Researcher: Autonomous Scientific Innovation NeurIPS 2025
2025-01-01 Multi-Agent Reinforcement Learning with Communication-Constrained Priors NeurIPS 2025
2025-01-01 AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration NeurIPS 2025
2025-01-01 WebDancer: Towards Autonomous Information Seeking Agency NeurIPS 2025
2025-01-01 MisoDICE: Multi-Agent Imitation from Mixed-Quality Demonstrations NeurIPS 2025
2025-01-01 Are Large Language Models Sensitive to the Motives Behind Communication? NeurIPS 2025
2025-01-01 Learning “Partner-Aware” Collaborators in Multi-Party Collaboration NeurIPS 2025
2025-01-01 Fair Cooperation in Mixed-Motive Games via Conflict-Aware Gradient Adjustment NeurIPS 2025
2025-01-01 Many LLMs Are More Utilitarian Than One NeurIPS 2025
2025-01-01 Collaborative Reasoner: Self-Improving Social Agents with Synthetic Conversations NeurIPS 2025
2025-01-01 Generative Caching for Structurally Similar Prompts and Responses NeurIPS 2025
2025-01-01 TRAP: Targeted Redirecting of Agentic Preferences NeurIPS 2025
2025-01-01 Robust and Diverse Multi-Agent Learning via Rational Policy Gradient NeurIPS 2025
2025-01-01 SpecMAS: A Multi-Agent System for Self-Verifying System Generation via Formal Model Checking NeurIPS 2025
2025-01-01 Evaluating LLMs in Open-Source Games NeurIPS 2025
2025-01-01 Policy Gradient Methods Converge Globally in Imperfect-Information Extensive-Form Games NeurIPS 2025
2025-01-01 Solving Continuous Mean Field Games: Deep Reinforcement Learning for Non-Stationary Dynamics NeurIPS 2025
2025-01-01 Scalable Neural Incentive Design with Parameterized Mean-Field Approximation NeurIPS 2025
2025-01-01 Cooperative Bargaining Games Without Utilities: Mediated Solutions from Direction Oracles NeurIPS 2025
2025-01-01 How to Train Your LLM Web Agent: A Statistical Diagnosis NeurIPS 2025
2025-01-01 A-Mem: Agentic Memory for LLM Agents NeurIPS 2025
2025-01-01 Multi-Agent Learning under Uncertainty: Recurrence vs. Concentration NeurIPS 2025
2025-01-01 Planning with Quantized Opponent Models NeurIPS 2025
2025-01-01 MALinZero: Efficient Low-Dimensional Search for Mastering Complex Multi-Agent Planning NeurIPS 2025
2025-01-01 Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs NeurIPS 2025
2025-01-01 LOPT: Learning Optimal Pigovian Tax in Sequential Social Dilemmas NeurIPS 2025
2025-01-01 Social World Model-Augmented Mechanism Design Policy Learning NeurIPS 2025
2025-01-01 InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning NeurIPS 2025
2025-01-01 TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration NeurIPS 2025
2025-01-01 Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL NeurIPS 2025
2025-01-01 Retro-R1: LLM-based Agentic Retrosynthesis NeurIPS 2025
2025-01-01 Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies NeurIPS 2025
2025-01-01 Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation NeurIPS 2025
2025-01-01 SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly NeurIPS 2025
2025-01-01 DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents NeurIPS 2025
2025-01-01 SE-Agent: Self-Evolution Trajectory Optimization in Multi-Step Reasoning with LLM-Based Agents NeurIPS 2025
2025-01-01 OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning NeurIPS 2025
2025-01-01 DyFlow: Dynamic Workflow Framework for Agentic Reasoning NeurIPS 2025
2025-01-01 Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL NeurIPS 2025
2025-01-01 Among Us: A Sandbox for Measuring and Detecting Agentic Deception NeurIPS 2025
2025-01-01 Certifying Deep Network Risks and Individual Predictions with PAC-Bayes Loss via Localized Priors NeurIPS 2025
2025-01-01 Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration NeurIPS 2025
2025-01-01 Automated Model Discovery via Multi-modal & Multi-step Pipeline NeurIPS 2025
2025-01-01 OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation NeurIPS 2025
2025-01-01 LILO: Learning to Reason at the Frontier of Learnability NeurIPS 2025
2025-01-01 SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches NeurIPS 2025
2025-01-01 PARCO: Parallel AutoRegressive Models for Multi-Agent Combinatorial Optimization NeurIPS 2025
2025-01-01 Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning NeurIPS 2025
2025-01-01 STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds NeurIPS 2025
2025-01-01 Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective NeurIPS 2025
2025-01-01 Distilling LLM Agent into Small Models with Retrieval and Code Tools NeurIPS 2025
2025-01-01 VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents NeurIPS 2025
2025-01-01 From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review NeurIPS 2025
2025-01-01 MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures NeurIPS 2025
2025-01-01 SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning NeurIPS 2025
2025-01-01 SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks NeurIPS 2025
2025-01-01 Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction NeurIPS 2025
2025-01-01 ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning NeurIPS 2025
2025-01-01 Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents NeurIPS 2025
2025-01-01 TAI3: Testing Agent Integrity in Interpreting User Intent NeurIPS 2025
2025-01-01 Stackelberg Learning with Outcome-based Payment NeurIPS 2025
2025-01-01 High-order Interactions Modeling for Interpretable Multi-Agent Q-Learning NeurIPS 2025
2025-01-01 Role-aware Multi-agent Reinforcement Learning for Coordinated Emergency Traffic Control NeurIPS 2025
2025-01-01 SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds NeurIPS 2025
2025-01-01 Heterogeneous Graph Transformers for Simultaneous Mobile Multi-Robot Task Allocation and Scheduling under Temporal Constraints NeurIPS 2025
2025-01-01 SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration NeurIPS 2025
2025-01-01 Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection NeurIPS 2025
2025-01-01 4KAgent: Agentic Any Image to 4K Super-Resolution NeurIPS 2025
2025-01-01 LLM Strategic Reasoning: Agentic Study through Behavioral Game Theory NeurIPS 2025
2025-01-01 HMARL-CBF – Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems NeurIPS 2025
2025-01-01 Eliciting Reasoning in Language Models with Cognitive Tools NeurIPS 2025
2025-01-01 Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents NeurIPS 2025
2025-01-01 Hogwild! Inference: Parallel LLM Generation via Concurrent Attention NeurIPS 2025
2025-01-01 Distributed Multi-Agent Bandits Over Erdős-Rényi Random Networks NeurIPS 2025
2025-01-01 GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies NeurIPS 2025
2025-01-01 Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks NeurIPS 2025
2025-01-01 Memory Injection Attacks on LLM Agents via Query-Only Interaction NeurIPS 2025
2025-01-01 Continuous Soft Actor-Critic: An Off-Policy Learning Method Robust to Time Discretization NeurIPS 2025
2025-01-01 Sequential Multi-Agent Dynamic Algorithm Configuration NeurIPS 2025
2025-01-01 Encouraging metric-aware diversity in contrastive representation space NeurIPS 2025
2025-01-01 UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning NeurIPS 2025
2025-01-01 Contextual Integrity in LLMs via Reasoning and Reinforcement Learning NeurIPS 2025
2025-01-01 Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models NeurIPS 2025
2025-01-01 Adaptive Context Length Optimization with Low-Frequency Truncation for Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 Enhancing LLM Planning for Robotics Manipulation through Hierarchical Procedural Knowledge Graphs NeurIPS 2025
2025-01-01 Agents Robust to Distribution Shifts Learn Causal World Models Even Under Mediation NeurIPS 2025
2025-01-01 Abstract Counterfactuals for Language Model Agents NeurIPS 2025
2025-01-01 KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows NeurIPS 2025
2025-01-01 Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data NeurIPS 2025
2025-01-01 Self-Generated In-Context Examples Improve LLM Agents for Sequential Decision-Making Tasks NeurIPS 2025
2025-01-01 Privacy Reasoning in Ambiguous Contexts NeurIPS 2025
2025-01-01 Learning Equilibria from Data: Provably Efficient Multi-Agent Imitation Learning NeurIPS 2025
2025-01-01 HypRL: Reinforcement Learning of Control Policies for Hyperproperties NeurIPS 2025
2025-01-01 Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics NeurIPS 2025
2025-01-01 On Feasible Rewards in Multi-Agent Inverse Reinforcement Learning NeurIPS 2025
2025-01-01 Regret Lower Bounds for Decentralized Multi-Agent Stochastic Shortest Path Problems NeurIPS 2025
2025-01-01 HyperMARL: Adaptive Hypernetworks for Multi-Agent RL NeurIPS 2025
2025-01-01 Knowledge Starts with Practice: Knowledge-Aware Exercise Generative Recommendation with Adaptive Multi-Agent Cooperation NeurIPS 2025
2025-01-01 Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers NeurIPS 2025
2025-01-01 Emergent Risk Awareness in Rational Agents under Resource Constraints NeurIPS 2025
2025-01-01 Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding NeurIPS 2025
2025-01-01 Pragmatic Heterogeneous Collaborative Perception via Generative Communication Mechanism NeurIPS 2025
2025-01-01 Towards Principled Unsupervised Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 Multi-agent KTO: Enhancing Strategic Interactions of Large Language Model in Language Game NeurIPS 2025
2025-01-01 ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding NeurIPS 2025
2025-01-01 Mechanism Design via the Interim Relaxation NeurIPS 2025
2025-01-01 LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration NeurIPS 2025
2025-01-01 A Principle of Targeted Intervention for Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 Bayesian Ego-graph Inference for Networked Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement NeurIPS 2025
2025-01-01 VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture NeurIPS 2025
2025-01-01 Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays NeurIPS 2025
2025-01-01 Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning NeurIPS 2025
2025-01-01 KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment NeurIPS 2025
2025-01-01 Towards Doctor-Like Reasoning: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients NeurIPS 2025
2025-01-01 MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems NeurIPS 2025
2025-01-01 Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools NeurIPS 2025
2025-01-01 Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations NeurIPS 2025
2025-01-01 RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving NeurIPS 2025
2025-01-01 Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis NeurIPS 2025
2025-01-01 SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications NeurIPS 2025
2025-01-01 Multi-Agent Debate for LLM Judges with Adaptive Stability Detection NeurIPS 2025
2025-01-01 GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling NeurIPS 2025
2025-01-01 Measuring AI Ability to Complete Long Software Tasks NeurIPS 2025
2025-01-01 Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve NeurIPS 2025
2025-01-01 Language Modeling by Language Models NeurIPS 2025
2025-01-01 Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling NeurIPS 2025
2025-01-01 ContextAgent: Context-Aware Proactive LLM Agents with Open-world Sensory Perceptions NeurIPS 2025
2025-01-01 SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent NeurIPS 2025
2025-01-01 Bi-Level Knowledge Transfer for Multi-Task Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning NeurIPS 2025
2025-01-01 CoP: Agentic Red-teaming for Large Language Models using Composition of Principles NeurIPS 2025
2025-01-01 LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs NeurIPS 2025
2025-01-01 OPHR: Mastering Volatility Trading with Multi-Agent Deep Reinforcement Learning NeurIPS 2025
2025-01-01 Conformal Information Pursuit for Interactively Guiding Large Language Models NeurIPS 2025
2025-01-01 ToolRL: Reward is All Tool Learning Needs NeurIPS 2025
2025-01-01 Crucible: Quantifying the Potential of Control Algorithms through LLM Agents NeurIPS 2025
2025-01-01 Effective Policy Learning for Multi-Agent Online Coordination Beyond Submodular Objectives NeurIPS 2025
2025-01-01 WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents NeurIPS 2025
2025-01-01 AutoData: A Multi-Agent System for Open Web Data Collection NeurIPS 2025
2025-01-01 The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement NeurIPS 2025
2025-01-01 Learning and Planning Multi-Agent Tasks via an MoE-based World Model NeurIPS 2025
2025-01-01 MLZero: A Multi-Agent System for End-to-end Machine Learning Automation NeurIPS 2025
2025-01-01 Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems NeurIPS 2025
2025-01-01 Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning NeurIPS 2025
2025-01-01 AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents NeurIPS 2025
2025-01-01 LLM-PySC2: Starcraft II learning environment for Large Language Models NeurIPS 2025
2025-01-01 Robust Cross-modal Alignment Learning for Cross-Scene Spatial Reasoning and Grounding NeurIPS 2025
2025-01-01 OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis NeurIPS 2025
2025-01-01 MOSDT: Self-Distillation-Based Decision Transformer for Multi-Agent Offline Safe Reinforcement Learning NeurIPS 2025
2025-01-01 Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration NeurIPS 2025
2025-01-01 MAT-Agent: Adaptive Multi-Agent Training Optimization NeurIPS 2025
2025-01-01 Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving NeurIPS 2025
2025-01-01 From Self-Check to Consensus: Bayesian Strategic Decoding in Large Language Models NeurIPS 2025
2025-01-01 A Near-optimal, Scalable and Parallelizable Framework for Stochastic Bandits Robust to Adversarial Corruptions and Beyond NeurIPS 2025
2025-01-01 Graphs Help Graphs: Multi-Agent Graph Socialized Learning NeurIPS 2025
2025-01-01 Thought Communication in Multiagent Collaboration NeurIPS 2025
2025-01-01 PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer NeurIPS 2025
2025-01-01 MaintainCoder: Maintainable Code Generation Under Dynamic Requirements NeurIPS 2025
2025-01-01 RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills NeurIPS 2025
2025-01-01 In-Context Fully Decentralized Cooperative Multi-Agent Reinforcement Learning NeurIPS 2025
2025-01-01 Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation NeurIPS 2025
2025-01-01 OpenHype: Hyperbolic Embeddings for Hierarchical Open-Vocabulary Radiance Fields NeurIPS 2025
2025-01-01 CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation NeurIPS 2025
2025-01-01 CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension NeurIPS 2025
2025-01-01 Multi-Agent Collaboration via Evolving Orchestration NeurIPS 2025
2025-01-01 G-Memory: Tracing Hierarchical Memory for Multi-Agent Systems NeurIPS 2025
2025-01-01 Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning NeurIPS 2025
2025-01-01 Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks NeurIPS 2025
2025-01-01 KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems NeurIPS 2025
2025-01-01 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation NeurIPS 2025
2025-01-01 AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems NeurIPS 2025
2025-01-01 TwinMarket: A Scalable Behavioral and Social Simulation for Financial Markets NeurIPS 2025
2025-01-01 Multi-agent Markov Entanglement NeurIPS 2025
2025-01-01 Many Minds, One Goal: Time Series Forecasting via Sub-task Specialization and Inter-agent Cooperation NeurIPS 2025
2025-01-01 Group-in-Group Policy Optimization for LLM Agent Training NeurIPS 2025
2025-01-01 Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models? NeurIPS 2025
2025-01-01 GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning NeurIPS 2025
2025-01-01 GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments NeurIPS 2025
2025-01-01 Video Action Differencing ICLR 2025
2025-01-01 ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization ICLR 2025
2025-01-01 Monte Carlo Planning with Large Language Model for Text-Based Game Agents ICLR 2025