Skip to content

Harnesses / Meta-Harnesses — 2025 · Paper list (400)

December 2025 (114)

Date Paper Venue Why selected
2025-12-31 Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
2025-12-31 Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
2025-12-31 AstroReview: An LLM-driven Multi-Agent Framework for Telescope Proposal Peer Review and Refinement
2025-12-31 R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
2025-12-31 Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
2025-12-31 Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
2025-12-30 Automated Analysis of Sustainability Reports: Using Large Language Models for the Extraction and Prediction of EU Taxonomy-Compliant KPIs
2025-12-30 LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm
2025-12-29 CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
2025-12-29 Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks
2025-12-29 AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis
2025-12-28 Accelerating Language Model Workflows with Prompt Choreography
2025-12-28 Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens
2025-12-27 Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation
2025-12-27 Monadic Context Engineering
2025-12-26 MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting NEURIPS 2025
2025-12-26 VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
2025-12-26 PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis
2025-12-26 Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
2025-12-26 VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
2025-12-26 AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization
2025-12-25 Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning
2025-12-24 Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing
2025-12-24 Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks
2025-12-24 Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
2025-12-24 TrafficSimAgent: A Hierarchical Agent Framework for Autonomous Traffic Simulation with MCP Control
2025-12-23 AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent ICLR 2026
2025-12-23 SlideTailor: Personalized Presentation Slide Generation for Scientific Papers AAAI 2026
2025-12-23 Domain-Partitioned Hybrid RAG for Legal Reasoning: Toward Modular and Explainable Legal AI for India
2025-12-23 LongVideoAgent: Multi-Agent Reasoning with Long Videos
2025-12-23 DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
2025-12-23 AprielGuard
2025-12-23 From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration
2025-12-22 PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation
2025-12-22 HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data
2025-12-22 An Agentic Framework for Autonomous Materials Computation
2025-12-22 MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
2025-12-22 Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6
2025-12-22 A Declarative Language for Building And Orchestrating LLM-Powered Agent Workflows
2025-12-21 A Modular Reference Architecture for MCP-Servers Enabling Agentic BIM Interaction
2025-12-21 InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
2025-12-20 An Agentic AI Framework for Training General Practitioner Student Skills
2025-12-20 Sophia: A Persistent Agent Framework of Artificial Life
2025-12-19 Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool use
2025-12-18 Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
2025-12-18 PAACE: A Plan-Aware Automated Agent Context Engineering Framework
2025-12-18 cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
2025-12-18 PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving
2025-12-17 Optimizing Agentic Language Model Inference via Speculative Tool Calls
2025-12-17 Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework
2025-12-17 CodeMem: Architecting Reproducible Agents via Dynamic MCP and Procedural Memory
2025-12-17 CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications
2025-12-16 AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally
2025-12-16 Astraea: A State-Aware Scheduling Engine for LLM-Powered Agents
2025-12-15 Workflows vs Agents for Code Translation NEURIPS 2025
2025-12-15 MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
2025-12-15 MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
2025-12-15 Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments
2025-12-15 QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
2025-12-15 Building from Scratch: A Multi-Agent Framework with Human-in-the-Loop for Multilingual Legal Terminology Mapping
2025-12-14 Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution
2025-12-12 VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation
2025-12-12 How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism
2025-12-12 AutoFSM: A Multi-agent Framework for FSM Code Generation with IR and SystemC-Based Testing
2025-12-12 TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning
2025-12-12 FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
2025-12-11 GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
2025-12-11 Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
2025-12-11 EpiPlanAgent: Agentic Automated Epidemic Response Planning
2025-12-10 Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing
2025-12-10 DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
2025-12-10 Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
2025-12-10 SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs
2025-12-10 GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection
2025-12-09 A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
2025-12-09 Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
2025-12-09 See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
2025-12-09 Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance
2025-12-09 From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change
2025-12-09 Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework
2025-12-08 The Agent Capability Problem: Predicting Solvability Through Information-Theoretic Bounds
2025-12-08 VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
2025-12-08 Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
2025-12-08 DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
2025-12-08 ClinNoteAgents: An LLM Multi-Agent System for Predicting and Interpreting Heart Failure 30-Day Readmission from Clinical Notes
2025-12-07 TeachMaster: Generative Teaching via Code ACL 2026
2025-12-07 TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding
2025-12-07 Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
2025-12-07 BabelCoder: Agentic Code Translation with Specification Alignment
2025-12-07 DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
2025-12-06 Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation
2025-12-06 GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols
2025-12-06 AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity
2025-12-05 ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment AAAI 2026
2025-12-05 FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction NEURIPS 2025
2025-12-05 Trusted AI Agents in the Cloud
2025-12-05 Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
2025-12-05 Please Don't Kill My Vibe: Empowering Agents with Data Flow Control
2025-12-04 WhatsCode: Large-Scale GenAI Deployment for Developer Efficiency at WhatsApp
2025-12-04 David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?
2025-12-04 Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
2025-12-04 Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems
2025-12-04 ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
2025-12-03 EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths NEURIPS 2025
2025-12-03 ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
2025-12-03 HarnessAgent: Scaling Automatic Fuzzing Harness Construction with Tool-Augmented LLM Pipelines
2025-12-02 Agent-Based Modular Learning for Multimodal Emotion Recognition in Human-Agent Systems
2025-12-02 Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization
2025-12-02 Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting
2025-12-02 Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents
2025-12-02 IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai
2025-12-02 UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
2025-12-01 DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses
2025-12-01 An Empirical Study of Agent Developer Practices in AI Agent Frameworks

November 2025 (114)

Date Paper Venue Why selected
2025-11-30 Agentic Persona Control and Task State Tracking for Realistic User Simulation in Interactive Scenarios NEURIPS 2025
2025-11-29 CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
2025-11-28 Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis
2025-11-28 Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent
2025-11-28 TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
2025-11-27 Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation CVPR 2026
2025-11-27 Solving Context Window Overflow in AI Agents
2025-11-27 Automated Design Optimization via Strategic Search with Large Language Models
2025-11-27 NOMAD: A Multi-Agent LLM System for UML Class Diagram Generation from Natural Language Requirements
2025-11-27 Co-Evolving Agents: Learning from Failures as Hard Negatives
2025-11-27 A Safety and Security Framework for Real-World Agentic Systems
2025-11-26 Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
2025-11-26 EWE: An Agentic Framework for Extreme Weather Analysis
2025-11-26 AI Urban Scientist: Multi-Agent Collaborative Automation for Urban Research
2025-11-25 MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology NEURIPS 2025
2025-11-25 EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids
2025-11-25 VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
2025-11-25 Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
2025-11-24 Agint: Agentic Graph Compilation for Software Engineering Agents NEURIPS 2025
2025-11-24 A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis AAAI 2026
2025-11-24 Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion CVPR 2026
2025-11-24 HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization
2025-11-24 IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response
2025-11-24 Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
2025-11-24 Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
2025-11-24 AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
2025-11-24 Addressing Situated Teaching Needs: A Multi-Agent Framework for Automated Slide Adaptation
2025-11-24 MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
2025-11-23 \(A^2Flow:\) Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators AAAI
2025-11-23 FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
2025-11-23 End-to-End Automated Logging via Multi-Agent Framework
2025-11-23 LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework
2025-11-23 A Multimodal Conversational Agent for Tabular Data Analysis
2025-11-23 DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
2025-11-23 Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing
2025-11-22 A superpersuasive autonomous policy debating system AAAI 2026
2025-11-22 ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
2025-11-21 Episodic Memory in Agentic Frameworks: Suggesting Next Tasks
2025-11-21 AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
2025-11-20 Trustworthy AI in the Agentic Lakehouse: from Concurrency to Governance
2025-11-20 Distributed Agent Reasoning Across Independent Systems With Strict Data Locality
2025-11-20 ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
2025-11-20 InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
2025-11-20 Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
2025-11-20 A Scalable NorthPole System with End-to-End Vertical Integration for Low-Latency and Energy-Efficient LLM Inference
2025-11-19 What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
2025-11-19 Know Your Intent: An Autonomous Multi-Perspective LLM Agent Framework for DeFi User Transaction Intent Mining
2025-11-19 Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization
2025-11-19 Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response
2025-11-19 Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
2025-11-19 Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering
2025-11-18 AutoTool: Efficient Tool Selection for Large Language Model Agents AAAI 2026
2025-11-18 Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning ACL
2025-11-18 Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
2025-11-18 MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
2025-11-18 DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
2025-11-18 APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page Design
2025-11-17 Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction AAAI 2026
2025-11-17 Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
2025-11-17 P1: Mastering Physics Olympiads with Reinforcement Learning
2025-11-17 Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation
2025-11-17 MedDCR: Learning to Design Agentic Workflows for Medical Coding
2025-11-16 Co-Layout: LLM-driven Co-optimization for Interior Layout AAAI 2026
2025-11-16 Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
2025-11-16 Multi-agent Self-triage System with Medical Flowcharts
2025-11-15 Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation
2025-11-15 GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
2025-11-14 Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA AAAI 2026
2025-11-14 DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
2025-11-14 ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
2025-11-14 NOVA: An Agentic Framework for Automated Histopathology Analysis and Discovery
2025-11-14 AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
2025-11-14 Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
2025-11-14 Generative Caching for Structurally Similar Prompts and Responses
2025-11-13 Towards an Agentic Workflow for Internet Measurement Research
2025-11-13 Evaluating Prompting Strategies with MedGemma for Medical Order Extraction
2025-11-13 Mastering Olympiad-Level Physics with Artificial Intelligence
2025-11-13 SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering
2025-11-13 EnvTrace: Simulation-Based Semantic Evaluation of LLM Code via Execution Trace Alignment -- Demonstrated at Synchrotron Beamlines
2025-11-13 MINDS: A Cross-cultural Dialogue Corpus for Social Norm Classification and Adherence Detection
2025-11-12 SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
2025-11-12 Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
2025-11-12 BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
2025-11-12 ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
2025-11-12 Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
2025-11-12 BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
2025-11-11 Adaptive Multi-Agent Response Refinement in Conversational Systems AAAI 2026
2025-11-11 QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
2025-11-11 LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost
2025-11-10 FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation AAAI 2026
2025-11-10 Voice-Interactive Surgical Agent for Multimodal Patient Data Control
2025-11-10 Discourse Graph Guided Document Translation with Large Language Models
2025-11-10 AgentSUMO: An Agentic Framework for Interactive Simulation Scenario Generation in SUMO via Large Language Models
2025-11-09 Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
2025-11-09 PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
2025-11-09 WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
2025-11-08 MTTR-A: Measuring Cognitive Recovery Latency in Multi-Agent Systems
2025-11-08 EduAgentQG: A Multi-Agent Workflow Framework for Personalized Question Generation
2025-11-08 Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
2025-11-07 AdvisingWise: Supporting Academic Advising in Higher Education Settings Through a Human-in-the-Loop Multi-Agent Framework
2025-11-07 SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
2025-11-06 RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
2025-11-06 Multi-Agent Collaborative Framework For Math Problem Generation
2025-11-06 PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
2025-11-05 AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
2025-11-05 U2F: Encouraging SWE-Agent to Seize Novelty without Losing Feasibility
2025-11-05 Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
2025-11-05 Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework
2025-11-04 No-Human in the Loop: Agentic Evaluation at Scale for Recommendation NEURIPS 2025
2025-11-04 MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning ACL 2026
2025-11-04 PublicAgent: Multi-Agent Design Principles From an LLM-Based Open Data Analysis Framework
2025-11-04 PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts
2025-11-04 VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
2025-11-04 Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework

October 2025 (17)

Date Paper Venue Why selected
2025-10-30 SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding ACL 2026
2025-10-28 Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content NEURIPS 2025
2025-10-20 What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations ACL 2026
2025-10-20 PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits ICLR 2026
2025-10-16 MAFA: A Multi-Agent Framework for Enterprise-Scale Annotation with Configurable Task Adaptation AAAI
2025-10-15 FACTS: Table Summarization via Offline Template Generation with Agentic Workflows ACL 2026
2025-10-13 Rethinking Agentic Workflows: Evaluating Inference-Based Test-Time Scaling Strategies in Text2SQL Tasks COLM 2025
2025-10-10 MAT-Agent: Adaptive Multi-Agent Training Optimization NEURIPS 2025
2025-10-10 Modeling Layered Consciousness with Multi-Agent Large Language Models EMNLP 2025
2025-10-10 The Idola Tribus of AI: Large Language Models tend to perceive order where none exists EMNLP 2025
2025-10-09 MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding NEURIPS
2025-10-09 AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment EMNLP 2025
2025-10-08 ExpertAgent: Enhancing Personalized Education through Dynamic Planning and Retrieval-Augmented Long-Chain Reasoning NEURIPS 2025
2025-10-08 TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents EMNLP 2025
2025-10-06 MedPAO: A Protocol-Driven Agent for Structuring Medical Reports MICCAI 2025
2025-10-06 ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering ACL 2026
2025-10-01 LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation AAAI

September 2025 (19)

Date Paper Venue Why selected
2025-09-30 AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models ACL 2026
2025-09-29 SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents ICLR 2026
2025-09-28 MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models AAAI
2025-09-28 SafeSearch: Automated Red-Teaming of LLM-Based Search Agents ICML 2026
2025-09-26 InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios ICLR 2026
2025-09-26 NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use EMNLP 2025
2025-09-26 MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference ACL 2026
2025-09-26 AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering EMNLP
2025-09-24 LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning NEURIPS 2025
2025-09-24 RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows MIDL 2026
2025-09-24 Automated Multi-Agent Workflows for RTL Design NEURIPS 2025
2025-09-23 AutoSpec: An Agentic Framework for Automatically Drafting Patent Specification EMNLP
2025-09-22 FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis EMNLP 2025
2025-09-22 Generalizable End-to-End Tool-Use RL with Synthetic CodeGym ICLR 2026
2025-09-18 SWE-QA: Can Language Models Answer Repository-level Code Questions? ACL 2026
2025-09-15 PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization EMNLP 2025
2025-09-11 Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search AAAI 2026
2025-09-04 Code Like Humans: A Multi-Agent Solution for Medical Coding EMNLP
2025-09-01 FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games EMNLP 2025

August 2025 (10)

Date Paper Venue Why selected
2025-08-29 MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents ICLR 2026
2025-08-29 The Complexity Trap: Simple Observation Masking Is as Efficient as LLM Summarization for Agent Context Management NEURIPS 25
2025-08-28 Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision ICLR 2026
2025-08-26 VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft EMNLP 2025
2025-08-22 IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra ICLR 2026
2025-08-11 EMPATHIA: Multi-Faceted Human-AI Collaboration for Refugee Integration NEURIPS 2025
2025-08-08 Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning COLM 2025
2025-08-06 OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use ACL 2025
2025-08-06 ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients" ACL 2026
2025-08-06 ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents ACL 2026

July 2025 (11)

Date Paper Venue Why selected
2025-07-30 MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines ICML 2025
2025-07-23 Agent WARPP: Workflow Adherence via Runtime Parallel Personalization ICML 2025
2025-07-23 Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance EMNLP 2025
2025-07-22 Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems AAAI 2026
2025-07-21 HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics ICLR 2026
2025-07-14 A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends ACL 2026
2025-07-11 What Factors Affect LLMs and RLLMs in Financial Question Answering? ACL 2026
2025-07-09 Open Source Planning & Control System with Language Agents for Autonomous Scientific Discovery ICML 2025
2025-07-09 MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection ACL 2025
2025-07-07 Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment EMNLP 2025
2025-07-01 TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law ACL 2026

June 2025 (14)

Date Paper Venue Why selected
2025-06-30 Auto-TA: Towards Scalable Automated Thematic Analysis (TA) via Multi-Agent Large Language Models with Reinforcement Learning ACL 2025
2025-06-24 MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration ACL 2025
2025-06-09 From Debate to Equilibrium: Belief-Driven Multi-Agent LLM Reasoning via Bayesian Nash Equilibrium ICML 2025
2025-06-09 HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization ICLR 26
2025-06-08 BIMgent: Towards Autonomous Building Modeling via Computer-use Agents ICML 2025
2025-06-08 Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models ACL 2025
2025-06-06 PersonaAgent: Bridging Memory and Action for Personalized LLM Agents ACL 2026
2025-06-06 AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search AAAI
2025-06-05 ProRefine: Inference-Time Prompt Refinement with Textual Feedback NEURIPS 2025
2025-06-05 ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development ACL 2025
2025-06-04 CLAIM: An Intent-Driven Multi-Agent Framework for Analyzing Manipulation in Courtroom Dialogues ACL
2025-06-04 MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis NEURIPS 2025
2025-06-03 A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems ACL 2025
2025-06-03 Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework AAAI 2026

May 2025 (20)

Date Paper Venue Why selected
2025-05-31 DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments NEURIPS 2025
2025-05-31 PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreements EMNLP 2025
2025-05-31 MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning ICLR 2026
2025-05-29 Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve NEURIPS 2025
2025-05-29 Agent-SAMA: State-Aware Mobile Assistant AAAI
2025-05-27 Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration ACL 2026
2025-05-27 AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage ACL 2026
2025-05-26 MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research NEURIPS 2025
2025-05-26 Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows ICLR 2026
2025-05-26 Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation ACL 2025
2025-05-25 MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems NEURIPS 2025
2025-05-24 DDO: Dual-Decision Optimization for LLM-Based Medical Consultation via Multi-Agent Collaboration EMNLP 2025
2025-05-23 Provably Efficient Algorithm for Best Scoring Rule Identification in Online Principal-Agent Information Acquisition ICML 2025
2025-05-22 SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence CVPR 2026
2025-05-22 EMULATE: A Multi-Agent Framework for Determining the Veracity of Atomic Claims by Emulating Human Actions ACL 2025
2025-05-21 R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization NEURIPS 2025
2025-05-17 Retrospex: Language Agent Meets Offline Reinforcement Learning Critic EMNLP 2024
2025-05-16 Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction ICML 2026
2025-05-13 LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries ACL 2025
2025-05-08 EcoAgent: An Efficient Device-Cloud Collaborative Multi-Agent Framework for Mobile Automation AAAI 2026

April 2025 (8)

Date Paper Venue Why selected
2025-04-26 Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition ICML 2025
2025-04-23 IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery ACL 2025
2025-04-23 LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation ACL 2025
2025-04-23 WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model EMNLP 2025
2025-04-20 An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework CVPR 2025
2025-04-17 MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation ACL 2025
2025-04-12 A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems TMLR
2025-04-01 AI Hiring with LLMs: A Context-Aware and Explainable Multi-Agent Framework for Resume Screening CVPR 2025

March 2025 (12)

Date Paper Venue Why selected
2025-03-23 MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection ACL
2025-03-22 GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration CVPR 2025
2025-03-20 Survey on Evaluation of LLM-based Agents ACL
2025-03-18 Personalized Attacks of Social Engineering in Multi-turn Conversations: LLM Agents for Simulation and Detection COLM 2025
2025-03-18 EnvBench: A Benchmark for Automated Environment Setup ICLR 25
2025-03-17 VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning ICLR 2026
2025-03-10 Video Action Differencing ICLR 2025
2025-03-10 DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation EMNLP 2025
2025-03-04 BRIDGE: Bootstrapping Text to Control Time-Series Generation via Multi-Agent Iterative Optimization and Diffusion Modeling ICML 2025
2025-03-03 Mind the (Belief) Gap: Group Identity in the World of LLMs ACL 2025
2025-03-03 RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections AAAI 2025
2025-03-01 Structured Reasoning for Fairness: A Multi-Agent Approach to Bias Detection in Textual Data AAAI 2025

February 2025 (15)

Date Paper Venue Why selected
2025-02-27 Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents EMNLP 2025
2025-02-26 MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis ACL 2025
2025-02-25 MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning ACL
2025-02-21 Self-Taught Agentic Long Context Understanding ACL 2025
2025-02-18 Training Turn-by-Turn Verifiers for Dialogue Tutoring Agents: The Curious Case of LLMs as Your Coding Tutors ACL 2025
2025-02-18 Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning EMNLP 2025
2025-02-18 Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through Options ICML 2025
2025-02-18 Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Research EMNLP 2025
2025-02-17 Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration ACL 2025
2025-02-17 Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning ACL 2025
2025-02-17 LLM Agents Making Agent Tools ACL 2025
2025-02-16 OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning ACL 2026
2025-02-16 PlanGenLLMs: A Modern Survey of LLM Planning Capabilities ACL 2025
2025-02-16 SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human Intervention ACL
2025-02-12 DiMA: An LLM-Powered Ride-Hailing Assistant at DiDi KDD 2025

January 2025 (46)

Date Paper Venue Why selected
2025-01-06 Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation CVPR 2025
2025-01-01 MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis NeurIPS 2025
2025-01-01 MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks NeurIPS 2025
2025-01-01 AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration NeurIPS 2025
2025-01-01 Generative Caching for Structurally Similar Prompts and Responses NeurIPS 2025
2025-01-01 InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning NeurIPS 2025
2025-01-01 TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration NeurIPS 2025
2025-01-01 SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly NeurIPS 2025
2025-01-01 OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation NeurIPS 2025
2025-01-01 SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches NeurIPS 2025
2025-01-01 Self-Challenging Language Model Agents NeurIPS 2025
2025-01-01 MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning NeurIPS 2025
2025-01-01 KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows NeurIPS 2025
2025-01-01 Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach NeurIPS 2025
2025-01-01 Strategic Hypothesis Testing NeurIPS 2025
2025-01-01 ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding NeurIPS 2025
2025-01-01 AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement NeurIPS 2025
2025-01-01 Adaptive Preference Arithmetic: A Personalized Agent with Adaptive Preference Arithmetic for Dynamic Preference Modeling NeurIPS 2025
2025-01-01 MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems NeurIPS 2025
2025-01-01 RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving NeurIPS 2025
2025-01-01 Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve NeurIPS 2025
2025-01-01 ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling NeurIPS 2025
2025-01-01 CoP: Agentic Red-teaming for Large Language Models using Composition of Principles NeurIPS 2025
2025-01-01 MLZero: A Multi-Agent System for End-to-end Machine Learning Automation NeurIPS 2025
2025-01-01 CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems NeurIPS 2025
2025-01-01 CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation NeurIPS 2025
2025-01-01 TwinMarket: A Scalable Behavioral and Social Simulation for Financial Markets NeurIPS 2025
2025-01-01 GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning NeurIPS 2025
2025-01-01 GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments NeurIPS 2025
2025-01-01 Video Action Differencing ICLR 2025
2025-01-01 SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement ICLR 2025
2025-01-01 Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows ICLR 2025
2025-01-01 Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence ICLR 2025
2025-01-01 ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration ICLR 2025
2025-01-01 Flow: Modularized Agentic Workflow Automation ICLR 2025
2025-01-01 Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents ICLR 2025
2025-01-01 Steering Large Language Models between Code Execution and Textual Reasoning ICLR 2025
2025-01-01 Re-Aligning Language to Visual Objects with an Agentic Workflow ICLR 2025
2025-01-01 Aligning Generative Denoising with Discriminative Objectives Unleashes Diffusion for Visual Perception ICLR 2025
2025-01-01 MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses ICLR 2025
2025-01-01 EIA: ENVIRONMENTAL INJECTION ATTACK ON GENERALIST WEB AGENTS FOR PRIVACY LEAKAGE ICLR 2025
2025-01-01 EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents ICLR 2025
2025-01-01 Benchmarking Agentic Workflow Generation ICLR 2025
2025-01-01 Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems ICLR 2025
2025-01-01 AFlow: Automating Agentic Workflow Generation ICLR 2025
2025-01-01 MindSearch: Mimicking Human Minds Elicits Deep AI Searcher ICLR 2025