🏷️ Tags¶
Browse digested papers by tag.
agent-harness¶
- A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
- AgentAbstain: Do LLM Agents Know When Not to Act?
- AgentSPEX: An Agent SPecification and EXecution Language
- Architectural Design Decisions in AI Agent Harnesses
- BrainPilot: Automating Brain Discovery with Agentic Research
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- Building Agent Harnesses for Scientific Curation from Multimodal Sources
- CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
- ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
- Code as Agent Harness
- Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1
- Dissecting model behavior through agent trajectories
- Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority Stratification
- Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions
- Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
- Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable
- Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
- LLM-as-Code Agentic Programming for Agent Harness
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching
- MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents
- MemoHarness: Agent Harnesses That Learn from Experience
- MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
- NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
- Natural-Language Agent Harnesses
- PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization
- PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
- Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- Recursive Multi-Agent Systems
- Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making
- SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
- SETA: Scaling Environments for Terminal Agents
- Scaling Laws for Agent Harnesses via Effective Feedback Compute
- Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
- SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
- SkillReducer: Optimizing LLM Agent Skills for Token Efficiency
- Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting
- Survey on Evaluation of LLM-based Agents
- TTHE: Test-Time Harness Evolution
- TTHE: Test-Time Harness Evolution
- ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
- Toward AI VIS Co-Scientists: A General and End-to-End Agent Harness for Solving Complex Data Visualization Tasks
- Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents
- Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
- UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
- VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
- WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
- Who Checks the Citations? Benchmarking Legal Hallucination Detection
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
- Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems
agentic-ai¶
- "Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents
- 3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows
- A Deterministic Control Plane for LLM Coding Agents
- A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
- A Multimodal Conversational Agent for Tabular Data Analysis
- A New Framework for Cybersecurity Refusals in AI Agents
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
- A Safety and Security Framework for Real-World Agentic Systems
- A Security Analysis of the OpenClaw AI Agent Framework
- A Self-Evolving Agent for Longitudinal Personal Health Management
- A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression
- A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- ACE: Pluggable Adaptive Context Elasticizer across Agents
- AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and Large Language Models
- AI Research Agents Narrow Scientific Exploration
- AI scientists produce results without reasoning scientifically
- AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model
- AI-accelerated End-to-End Framework for Rapid Professional Upskilling
- AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
- AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
- ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
- ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation
- Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
- Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
- Adaptive Preference Arithmetic: A Personalized Agent with Adaptive Preference Arithmetic for Dynamic Preference Modeling
- Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
- Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows
- AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
- AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
- AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
- AgentSPEX: An Agent SPecification and EXecution Language
- AgentSUMO: An Agentic Framework for Interactive Simulation Scenario Generation in SUMO via Large Language Models
- AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems
- Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
- Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Agentic Data Environments
- Agentic Hardware Design as Repository-Level Code Evolution
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- Agentic Neural Architecture Search
- Agentic Routing: The Harness-Native Data Flywheel
- Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
- Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
- An Agentic AI Framework to Accelerate Scientific Discovery in Plant Phenotyping
- An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
- An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment
- An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing
- AnalogAgent: Self-Improving Analog Circuit Design Automation with LLM Agents
- Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis
- AprielGuard
- Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents
- AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
- AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
- AutoTrainess: Teaching Language Models to Improve Language Models Autonomously
- Autoformalizing Memory Specifications with Agents
- Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection
- Automated Design Optimization via Strategic Search with Large Language Models
- BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation via Lens of Dynamic Interactions
- Benchmarking Agentic Workflow Generation
- Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
- Benchmarking LLM Tool-Use in the Wild
- Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution
- Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
- Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
- Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
- BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
- BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
- BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents
- Building Persona-Based Agents On Demand: Tailoring Multi-Agent Workflows to User Needs
- CARD: Towards Conditional Design of Multi-agent Topological Structures
- CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
- CPAgents: Agentic Composite Phenotype Generation for Cardiac Disease Association
- CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market
- CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness
- Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
- Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
- Can Language Models Discover Scaling Laws?
- Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
- Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
- ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
- Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- Code as Agent Harness
- CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents
- Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- Composing Verifiable Conceptual Models via Building Blocks: Towards Design-Time Verification of Agentic AI Workflows
- Confidence-Aware Tool Orchestration for Robust Video Understanding
- Content-Based Smart E-Mail Dispatcher Using Large Language Models
- ContextNest: Verifiable Context Governance for Autonomous AI Agent
- Control Tax: The Price of Keeping AI in Check
- Controlling Tool Use with Heading-Specific Activation Steering
- Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
- DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection
- Data Leakage Prevention in Agentic Applications via Preemptive Hardening
- DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
- David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?
- Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS
- DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
- DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
- Diagnosing Task Insensitivity in Language Agents
- Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- Does Self-Evaluation Enable Wireheading in Language Models?
- Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement
- DreamProver: Evolving Transferable Lemma Libraries via a Wake-Sleep Theorem-Proving Agent
- Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems
- EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- ETAS: An Effect-Typed Language for Agent Systems
- Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents
- EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
- Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
- Empowering LLM Tool Invocation with Tool-call Reward Model
- Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
- Engineering Trustworthy Agentic AI for Critical Systems
- Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning
- EpiPlanAgent: Agentic Automated Epidemic Response Planning
- Estimating Worst-Case Frontier Risks of Open-Weight LLMs
- EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair
- EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution
- ExpertAgent: Enhancing Personalized Education through Dynamic Planning and Retrieval-Augmented Long-Chain Reasoning
- Explainable Model Routing for Agentic Workflows
- FARS: A Fully Automated Research System Deployed at Scale
- FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
- Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
- Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through Options
- FlowSearcher: Synthesizing Memory-Guided Agentic Workflows for Web Information Seeking
- FlowSearcher: Synthesizing Memory-Guided Agentic Workflows for Web Information Seeking
- Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming
- From Accuracy to Impact: The Impact-Driven AI Framework (IDAIF) for Aligning Engineering Architecture with Theory of Change
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents
- From Detection to Action: Using LLM Agents for Fault-Tolerant Control
- From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
- From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
- From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
- From Task-Guided Conversational Graphs to Goal-Oriented Dialogue Runtimes
- From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence
- GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
- GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
- GISclaw: A Comprehensive Open-Source LLM Agent System for Realistic Multi-Step Geospatial Analysis
- GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
- Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Generative Caching for Structurally Similar Prompts and Responses
- GitLake: Git-for-data for the agentic lakehouse
- Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents
- Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software
- Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- GuardianAgentBench: Where Agents Fail and How to Guard Them
- Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- Heterogeneous Scientific Foundation Model Collaboration
- HeurekaBench: A Benchmarking Framework for AI Co-scientist
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
- Hierarchical Experimentalist Agents
- Hilbert: Recursively Building Formal Proofs with Informal Reasoning
- How and Why Agents Can Identify Bug-Introducing Commits
- Human-Guided Harm Recovery for Computer Use Agents
- Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery
- ICaRus: Identical Cache Reuse for Efficient Multi-Model Inference
- INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
- IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response
- Identifying the Supply Chain of AI for Trustworthiness and Risk Management in Critical Applications
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
- In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation
- InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
- Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills
- It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
- KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents
- KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- Kimi-Dev: Agentless Training as Skill Prior for SWE-agents
- Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
- Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization
- Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking
- LLM-based Few-Shot Early Rumor Detection with Imitation Agent
- LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- LandslideAgent with Multimodal LandslideBench: A Domain-Rule-Augmented Agent for Autonomous Landslide Identification and Analysis
- Language Modeling by Language Models
- Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- Lessons from Penetration Tests on Large-Scale Agent Systems
- Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
- LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
- Localizing RL-Induced Tool Use to a Single Crosscoder Feature
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
- MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
- MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
- MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- Mako: A Self-Evolving Agentic Operating System (SE-AOS) for Autonomous Web Exploitation
- ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
- Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
- Measuring AI Ability to Complete Long Software Tasks
- Measuring Agents in Production
- MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
- MedPAO: A Protocol-Driven Agent for Structuring Medical Reports
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
- MemoHarness: Agent Harnesses That Learn from Experience
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
- Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems
- Monitoring Decomposition Attacks with Lightweight Sequential Monitors
- Multi-Agent Debate with Memory Masking
- Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies
- Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response
- MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning
- Multimodal Policy Internalization for Conversational Agents
- NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
- NOVA: An Agentic Framework for Automated Histopathology Analysis and Discovery
- NVAITC AI Scientist: A Governed End-to-End Research System -- A Hypertension GWAS Case Study
- Native Active Perception as Reasoning for Omni-Modal Understanding
- Natural-Language Agent Harnesses
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Near-Miss: Latent Policy Failure Detection in Agentic Workflows
- Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
- Nonuniformity Principle in Human-AI Coworking
- Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models
- OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- On the Regulatory Potential of User Interfaces for AI Agent Governance
- One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
- OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- Optimizing Agentic Language Model Inference via Speculative Tool Calls
- Orchard: An Open-Source Agentic Modeling Framework
- OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios
- Out of Sight: Compression-Aware Content Protection against Agentic Crawlers
- PAACE: A Plan-Aware Automated Agent Context Engineering Framework
- PACE: A Proxy for Agentic Capability Evaluation
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- PLAGUE: Plug-and-play Framework for Lifelong Adaptive Generation of Multi-turn Jailbreaks
- PLAGUE: Plug-and-play Framework for Lifelong Adaptive Generation of Multi-turn Jailbreaks
- PM-Bench: Evaluating Prospective Memory in LLM Agents
- PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
- PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
- PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
- Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection
- PerfGuard: A Performance-Aware Agent for Visual Content Generation
- PersonaAgent: Bridging Memory and Action for Personalized LLM Agents
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach
- Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- PlanGenLLMs: A Modern Survey of LLM Planning Capabilities
- PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
- Position: Agentic AI System Is a Foreseeable Pathway to AGI
- Privacy Reasoning in Ambiguous Contexts
- Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents
- Progressive Crystallization: Turning Agent Exploration into Deterministic, Lower-Cost Workflows in Production
- Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications
- Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery
- RMA: an Agentic System for Research-Level Mathematical Problems
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Reducing Token Usage of State-in-Context Agents using Minification
- ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
- Reliable Weak-to-Strong Monitoring of LLM Agents
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
- Responsible Agentic AI Requires Explicit Provenance
- Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases
- Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning
- Risk-Sensitive Agent Compositions
- Risk-Sensitive Agent Compositions
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- SHERLOC: Structured Diagnostic Localization for Code Repair Agents
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SMetric: Rethink LLM Scheduling for Serving Agents with Balanced Session-centric Scheduling
- SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
- SR-Scientist: Scientific Equation Discovery With Agentic AI
- STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices
- STRIDE: A Self-Reflective Agent Framework for Reliable Automatic Equation Discovery
- STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls
- SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
- Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
- Scaling Agents via Continual Pre-training
- Scaling Generalist Data-Analytic Agents
- Scaling Synthetic Task Generation for Agents via Exploration
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- SciNav: A General Agent Framework for Scientific Coding Tasks
- SciNav: A General Agent Framework for Scientific Coding Tasks
- Searching for Privacy Risks in LLM Agents via Simulation
- Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
- Self-Improvements in Modern Agentic Systems: A Survey
- Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
- SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories
- Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning
- Socratic agents for autonomous scientific discovery in high-dimensional physical systems
- Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- Solving Context Window Overflow in AI Agents
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
- SpecMAS: A Multi-Agent System for Self-Verifying System Generation via Formal Model Checking
- Speculative Actions: A Lossless Framework for Faster AI Agents
- Stackelberg Learning with Outcome-based Payment
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
- Stateful Online Monitoring Catches Distributed Agent Attacks
- Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications
- Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
- SwarmX: Agentic Scheduling for Low-Latency Agentic Systems
- TRAP: Targeted Redirecting of Agentic Preferences
- TaskCraft: Automated Generation of Agentic Tasks
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents
- Testing Agentic Workflows with Structural Coverage Criteria
- The Agent Capability Problem: Predicting Solvability Through Information-Theoretic Bounds
- The Complexity Trap: Simple Observation Masking Is as Efficient as LLM Summarization for Agent Context Management
- The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
- The Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model and the Net Human-Agent Score (NHAS) in Autonomous Commerce
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Hitchhiker's Guide to Agentic AI: From Foundations to Systems
- The Idola Tribus of AI: Large Language Models tend to perceive order where none exists
- The Last Harness You'll Ever Build
- The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
- The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development
- They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface
- Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction
- Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents
- ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
- Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows
- ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning
- ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
- TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning
- TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
- Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- Towards Agentic Investigation of Security Alerts
- Towards Automating Scientific Review with Google's Paper Assistant Tool
- Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
- Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
- Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
- Trusted AI Agents in the Cloud
- Trustworthy AI in the Agentic Lakehouse: from Concurrency to Governance
- TusoAI: Agentic Optimization for Scientific Methods
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations
- Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
- VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
- Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
- WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
- When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
- Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
- Who Checks the Citations? Benchmarking Legal Hallucination Detection
- Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents
- Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems
- Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
- Xiaomi-GUI-0 Technical Report
- scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology
agentic-framework¶
- A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
- A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation
- APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- ASI-Evolve: AI Accelerates AI
- ASMR: Agentic Schema Generation for Ship Maintenance Report Writing
- ASMR: Agentic Schema Generation for Ship Maintenance Report Writing
- ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
- AUTOGATE: Automated Clock Gating via Toggling-Aware LLM-based RTL Rewriting
- Agent WARPP: Workflow Adherence via Runtime Parallel Personalization
- Agentic Frameworks for Reasoning Tasks: An Empirical Study
- An Agentic Framework for Autonomous Materials Computation
- Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis
- Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
- AutoB2G: A Large Language Model-Driven Agentic Framework For Automated Building-Grid Co-Simulation
- AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation
- AutoSpec: An Agentic Framework for Automatically Drafting Patent Specification
- Automated Benchmark Auditing for AI Agents and Large Language Models
- BIMgent: Towards Autonomous Building Modeling via Computer-use Agents
- BabelCoder: Agentic Code Translation with Specification Alignment
- Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics
- Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
- CAMO: An Agentic Framework for Automated Causal Discovery from Micro Behaviors to Macro Emergence in LLM Agent Simulations
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CHORUS: An Agentic Framework for Generating Realistic Deliberation Data
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
- CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
- Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
- Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG
- DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- EWE: An Agentic Framework for Extreme Weather Analysis
- Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation
- Enhancing Small Language Models Reasoning through Knowledge Graph Grounding
- Episodic Memory in Agentic Frameworks: Suggesting Next Tasks
- FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
- GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling
- HarnessAgent: Scaling Automatic Fuzzing Harness Construction with Tool-Augmented LLM Pipelines
- HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
- PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits
- ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration
- Pursuing Minimal Sufficiency in Spatial Reasoning
- QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
- R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
- RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections
- RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision
- ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
- ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering
- SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
- SWEnergy: An Empirical Study on Energy Efficiency in Agentic Issue Resolution Frameworks with SLMs
- SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
- Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
- UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
- Veritas: A Semantically Grounded Agentic Framework for Memory Corruption Vulnerability Detection in Binaries
- VideoAgent: All-in-One Framework for Video Understanding and Editing
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
- What Factors Affect LLMs and RLLMs in Financial Question Answering?
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
agentic-workflow¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- A Modular Reference Architecture for MCP-Servers Enabling Agentic BIM Interaction
- A superpersuasive autonomous policy debating system
- AFlow: Automating Agentic Workflow Generation
- APWA: A Distributed Architecture for Parallelizable Agentic Workflows
- AVDA: Autonomous Vibe Detection Authoring for Cybersecurity
- Addressing Situated Teaching Needs: A Multi-Agent Framework for Automated Slide Adaptation
- AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance
- Agentic Generation of AST Transformation Rules for Fixing Breaking Updates
- AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization
- Agint: Agentic Graph Compilation for Software Engineering Agents
- Aligning Generative Denoising with Discriminative Objectives Unleashes Diffusion for Visual Perception
- All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models
- An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework
- AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
- ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- Astraea: A State-Aware Scheduling Engine for LLM-Powered Agents
- AutoSynthesis: An agentic system for automated meta-analysis
- Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
- Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services
- COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows
- CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem
- CoDA: Agentic Systems for Collaborative Data Visualization
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- CodeMem: Architecting Reproducible Agents via Dynamic MCP and Procedural Memory
- Coding-agents can replicate scientific machine learning papers
- ContextNav: Towards Agentic Multimodal In-Context Learning
- ContextNav: Towards Agentic Multimodal In-Context Learning
- DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
- DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
- DyFlow: Dynamic Workflow Framework for Agentic Reasoning
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EMPATHIA: Multi-Faceted Human-AI Collaboration for Refugee Integration
- Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens
- EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
- EnvBench: A Benchmark for Automated Environment Setup
- Environment-Grounded Multi-Agent Workflow for Autonomous Penetration Testing
- EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
- Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
- Evaluating Prompting Strategies with MedGemma for Medical Order Extraction
- Exploring Agentic Workflows for Generating High Quality Math Visual Aids
- FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
- Flow: Modularized Agentic Workflow Automation
- GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols
- GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
- Generative Caching for Structurally Similar Prompts and Responses
- Generative Caching for Structurally Similar Prompts and Responses
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows
- KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows
- Knowledge Starts with Practice: Knowledge-Aware Exercise Generative Recommendation with Adaptive Multi-Agent Cooperation
- LLM Agents Making Agent Tools
- LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost
- LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research
- Language Models as Measurement Apparatus for Culture
- Language Models as Measurement Apparatus for Culture
- Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation
- LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
- MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
- MAS$^2$: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- Multi-Agent Collaborative Framework For Math Problem Generation
- Multi-Agent LLM-based Metamorphic Testing for REST APIs
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- On the risk of coding before testing: An empirical study on LLM-based test generation workflow
- Open Source Planning & Control System with Language Agents for Autonomous Scientific Discovery
- PExA: Parallel Exploration Agent for Complex Text-to-SQL
- PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning
- PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- Prompt Codebooks: Discrete Compositional Optimization for Language Model Instruction Refinement
- Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows
- Re-Aligning Language to Visual Objects with an Agentic Workflow
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Recursive Harness Self-Improvement
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- Rethinking Agentic Workflows: Evaluating Inference-Based Test-Time Scaling Strategies in Text2SQL Tasks
- Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks
- Scepsy: Serving Agentic Workflows Using Aggregate LLM Pipelines
- Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
- Self-Taught Agentic Long Context Understanding
- Semantic Browsing: Controllable Diversity for Image Generation
- Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization
- SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward
- Software Supply Chains are Dead: Use-Case-Oriented Regeneration
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- TeachMaster: Generative Teaching via Code
- Textual Equilibrium Propagation for Deep Compound AI Systems
- Textual Equilibrium Propagation for Deep Compound AI Systems
- Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Context-Aware Image Anonymization with Multi-Agent Reasoning
- Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning
- Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications
- Towards an Agentic Workflow for Internet Measurement Research
- Trace-Level Analysis of Information Contamination in Multi-Agent Systems
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6
- Video Action Differencing
- Video Action Differencing
- Video Action Differencing
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
- WhatsCode: Large-Scale GenAI Deployment for Developer Efficiency at WhatsApp
- When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
- Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing
- Workflows vs Agents for Code Translation
- Workflows vs Agents for Code Translation
benchmark¶
- 3D Visual Illusion Depth Estimation
- 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- A Benchmark for Deep Information Synthesis
- A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
- A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments
- A Hierarchical Benchmark of Foundation Models for Dermatology
- A New Framework for Cybersecurity Refusals in AI Agents
- A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols
- A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
- A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory
- A2ASecBench: A Protocol-Aware Security Benchmark for Agent-to-Agent Multi-Agent Systems
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration
- AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
- AI scientists produce results without reasoning scientifically
- AI translation of literary texts is "fine", but readers still prefer human translations
- AI-Researcher: Autonomous Scientific Innovation
- AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design
- AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
- APeB: Benchmarking Personalization Ability of Large Language Model Agents
- ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving
- ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
- AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
- Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection
- Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- AgentAbstain: Do LLM Agents Know When Not to Act?
- AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
- AgentFairBench: Do LLM Agents Discriminate When They Act?
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
- AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Agentic Data Environments
- Agentic Frameworks for Reasoning Tasks: An Empirical Study
- Agentic Hardware Design as Repository-Level Code Evolution
- Agentic Hardware Design as Repository-Level Code Evolution
- Agentic Routing: The Harness-Native Data Flywheel
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
- Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
- AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems
- Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents
- Aloe-Vision: Robust Vision-Language Models for Healthcare
- Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
- Among Us: A Sandbox for Measuring and Detecting Agentic Deception
- An Agentic Framework for Autonomous Materials Computation
- An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering
- An Exam for Active Observers
- Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis
- Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
- AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
- AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation
- AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation
- Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- Auditing Agent Harness Safety
- Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
- Auto-FL-Research: Agentic Search for Federated Learning Algorithms
- AutoData: A Multi-Agent System for Open Web Data Collection
- AutoFSM: A Multi-agent Framework for FSM Code Generation with IR and SystemC-Based Testing
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
- AutoTrainess: Teaching Language Models to Improve Language Models Autonomously
- Autoformalizing Memory Specifications with Agents
- Automated Analysis of Sustainability Reports: Using Large Language Models for the Extraction and Prediction of EU Taxonomy-Compliant KPIs
- Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
- Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operation Orchestration
- Automating High Energy Physics Data Analysis with LLM-Powered Agents
- Autonomous Scientific Discovery via Iterative Meta-Reflection
- BAID: A Benchmark for Bias Assessment of AI Detectors
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation via Lens of Dynamic Interactions
- Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
- Benchmarking Agentic Workflow Generation
- Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
- Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- Benchmarking Foundation Models for Renal Lesion Stratification in CT
- Benchmarking LLM Tool-Use in the Wild
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
- Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
- Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
- BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
- BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
- Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems
- BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding
- BrainPilot: Automating Brain Discovery with Agentic Research
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- Bringing Agentic Search to Earth Observation Data Discovery
- Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
- Building a Precise Video Language with Human-AI Oversight
- CARD: Towards Conditional Design of Multi-agent Topological Structures
- CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
- CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
- CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents
- CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
- CUPCase: Clinically Uncommon Patient Cases and Diagnoses Dataset
- CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
- CaReBench: A Fine-grained Benchmark for Video Captioning and Retrieval
- Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment
- Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
- Can Language Models Discover Scaling Laws?
- Can We Talk Models Into Seeing the World Differently?
- Caption This, Reason That: VLMs Caught in the Middle
- CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
- ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
- Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
- ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
- CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
- Co-Director: Agentic Generative Video Storytelling
- CoMind: Towards Community-Driven Agents for Machine Learning Engineering
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- ColPali: Efficient Document Retrieval with Vision Language Models
- Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
- Collaborative Reasoner: Self-Improving Social Agents with Synthetic Conversations
- Collaborative Spatial Learning with Multi-LLM Agents in Networked Social Experiments
- Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks
- Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
- Computer Agent Arena: Toward Human-Centric Evaluation and Analysis of Computer-Use Agents
- Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations
- ContextAgent: Context-Aware Proactive LLM Agents with Open-world Sensory Perceptions
- Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
- Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
- Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
- Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision
- Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
- DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection
- DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
- DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
- Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- Data Scaling Laws for Radiology Foundation Models
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
- DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
- Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
- Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
- Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
- DeepStress: Stress-Testing Deep Search Agents
- DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
- DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
- Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language
- DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses
- Discovering Compositional Hallucinations in LVLMs
- Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Distributed Attacks in Persistent-State AI Control
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
- Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
- Do Image Editing Models Understand Lighting?
- Do LLM Agents Know How to Ground, Recover, and Assess? Evaluating Epistemic Competence in Information-Seeking Agents
- Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
- Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?
- DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- Does Multi-Agent Debate Improve AI Feedback on Research Papers?
- Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- DynEval: Holistic Evaluations of T2I Generative Models in the Wild
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
- Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems
- Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
- EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
- ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
- EWE: An Agentic Framework for Extreme Weather Analysis
- Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- EduArt: An educational-level benchmark for evaluating art history knowledge in large language models
- Efficient Benchmarking of AI Agents
- EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding
- Eigen-Agent: Adaptive Multi-Agent Scientific Reasoning with Monitor-Based RAG
- Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
- EnvBench: A Benchmark for Automated Environment Setup
- EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
- Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
- Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
- Evaluating LLMs in Open-Source Games
- Evaluating LLMs in Open-Source Games
- Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings
- Evaluating Long-Context Reasoning in LLM-Based WebAgents
- Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
- Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition
- Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models
- Evian: Towards Explainable Visual Instruction-tuning Data Auditing
- Evidence Triangulation for Multimodal Fact-Checking in the Wild
- EvoClaw: Evaluating AI Agents on Continuous Software Evolution
- EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
- EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems
- Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
- ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization
- FHE-Coder: Benchmarking Secure Agentic Code Generation for Fully Homomorphic Encryption
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- Fantastic Tractor-Dogs and How Not to Find Them With Open-Vocabulary Detectors
- Feature Quality and Adaptability of Medical Foundation Models: A Comparative Evaluation for Radiographic Classification and Segmentation
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
- FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents
- FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- From Agent Failures to Text Policies: What Works and What Breaks
- From Assistant to Independent Developer — Are GPTs Ready for Software Development?
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
- From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning
- FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAVEL: Grounded Caption Error Verification and Localization
- GEM: A Gym for Generalist LLMs
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
- Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments
- Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics
- Generating CAD Code with Vision-Language Models for 3D Designs
- Generative Universal Verifier as Multimodal Meta-Reasoner
- GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
- GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks
- GuardianAgentBench: Where Agents Fail and How to Guard Them
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
- Harness Engineering for LLM-Driven GPU Kernel Generation
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
- Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- HeurekaBench: A Benchmarking Framework for AI Co-scientist
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
- Hierarchical Experimentalist Agents
- Human-Guided Harm Recovery for Computer Use Agents
- Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation
- Hypothesis Testing for Generalized Thurstone Models
- ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
- IPO Finance Agent: Evaluation of LLM Financial Analysts beyond Finance Agent v2, with Automated Rubric Generation -- the Case of the SpaceX (SPCX) IPO
- IPR-1: Interactive Physical Reasoner
- IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
- In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
- Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation
- Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
- InnoGym: Benchmarking the Innovation Potential of AI Agents
- Instance-Level Composed Image Retrieval
- InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
- Investigating Multi-Agent Deliberation in Law
- Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
- Is Your Video Language Model a Reliable Judge?
- IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
- It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
- Just A Rather Very Intelligent Spoken Agent
- K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
- KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
- Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams
- Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs
- LLM Agents Making Agent Tools
- LLM Strategic Reasoning: Agentic Study through Behavioral Game Theory
- LLM-PySC2: Starcraft II learning environment for Large Language Models
- LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research
- LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
- Learning Multi-View Spatial Reasoning from Cross-View Relations
- LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
- LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
- Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference
- MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
- MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
- MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation
- MINDS: A Cross-cultural Dialogue Corpus for Social Norm Classification and Adherence Detection
- MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
- MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation
- MMReD: a Cross-Modal Benchmark for Dense Context Reasoning
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
- MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- MOSDT: Self-Distillation-Based Decision Transformer for Multi-Agent Offline Safe Reinforcement Learning
- MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
- MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
- Mako: A Self-Evolving Agentic Operating System (SE-AOS) for Autonomous Web Exploitation
- ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
- ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
- Many LLMs Are More Utilitarian Than One
- Many Minds, One Goal: Time Series Forecasting via Sub-task Specialization and Inter-agent Cooperation
- Mastering Olympiad-Level Physics with Artificial Intelligence
- Measuring AI Ability to Complete Long Software Tasks
- Measuring And Improving Engagement of Text-to-Image Generation Models
- Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA
- Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
- MedCalc-Pro: Solving Complex Medical Calculations with LLM Agents
- MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents
- MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
- MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
- MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
- MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
- Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction
- MemEIC: A Step Toward Continual and Compositional Knowledge Editing
- MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory
- MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
- MemTools: A Unified Research Framework for Interoperable Agent Memory
- Memento: Toward an All-Day Proactive Assistant for Ultra-Long Streaming Video
- MemoHarness: Agent Harnesses That Learn from Experience
- MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution
- MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach
- Monitoring Decomposition Attacks with Lightweight Sequential Monitors
- More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
- MuSLR: Multimodal Symbolic Logical Reasoning
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
- Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
- NL-Eye: Abductive NLI For Images
- NOVA: An Agentic Framework for Automated Histopathology Analysis and Discovery
- NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- Near-Miss: Latent Policy Failure Detection in Agentic Workflows
- NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
- NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents
- Noisy Test-Time Adaptation in Vision-Language Models
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
- OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- On the risk of coding before testing: An empirical study on LLM-based test generation workflow
- One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
- OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- OpenCUA: Open Foundations for Computer-Use Agents
- OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
- Optimas: An Intelligent Analytics-Informed Generative AI Framework for Performance Optimization
- Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
- OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning
- OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios
- P1: Mastering Physics Olympiads with Reinforcement Learning
- P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
- PACE: A Proxy for Agentic Capability Evaluation
- PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
- PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving
- PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization
- PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- PM-Bench: Evaluating Prospective Memory in LLM Agents
- PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis
- PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval
- PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning
- PRiSM: Prototype Regularization for Few-Shot VLMs
- Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning
- PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates
- PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
- PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
- PerfGuard: A Performance-Aware Agent for Visual Content Generation
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
- PoSh: Using Scene Graphs to Guide LLMs-as-a-Judge for Detailed Image Descriptions
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Prismata: Confining Cross-Site Prompt Injection in Web Agents
- Privacy Reasoning in Ambiguous Contexts
- ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration
- ProBench: Benchmarking GUI Agents with Accurate Process Information
- Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
- QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- RAT: RunAnyThing via Fully Automated Environment Configuration
- RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- REMem: Reasoning with Episodic Memory in Language Agent
- RL Forgets! Towards Continual Policy Optimization
- RLSLM: A Hybrid Reinforcement Learning Framework Aligning Rule-Based Social Locomotion Model with Human Social Norms
- RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems
- ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
- Read the Room: Video Social Reasoning with Mental-Physical Causal Chains
- Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
- Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
- RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
- Regular Games -- an Automata-Based General Game Playing Language
- Reliable Weak-to-Strong Monitoring of LLM Agents
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
- ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge
- Rethinking Agentic Workflows: Evaluating Inference-Based Test-Time Scaling Strategies in Text2SQL Tasks
- Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
- Rethinking the Evaluation of Harness Evolution for Agents
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
- RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- Robust Cross-modal Alignment Learning for Cross-Scene Spatial Reasoning and Grounding
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
- SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?
- SCARE: A Benchmark for SQL Correction and Question Answerability Classification for Reliable EHR Question Answering
- SCUBA: Salesforce Computer Use Benchmark
- SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SETA: Scaling Environments for Terminal Agents
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
- SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
- SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
- SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
- Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
- SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
- SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Safety and accuracy follow different scaling laws in clinical large language models
- Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- Scaling Laws for Agent Harnesses via Effective Feedback Compute
- Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks
- SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions
- SciNav: A General Agent Framework for Scientific Coding Tasks
- Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
- See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm
- Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
- Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- Self-Generated In-Context Examples Improve LLM Agents for Sequential Decision-Making Tasks
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Set-shifting Behavioral Test for Harnessed Agents
- Set-shifting Behavioral Test for Harnessed Agents
- Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents
- Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Show Me Examples: Inferring Visual Concepts from Image Sets
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
- SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
- SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe
- SkillSight: Seeing Through Shared Descriptions for Accurate Skill Retrieval
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
- Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
- Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection
- SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- Spatio-Temporal Graphs Beyond Grids: Benchmark for Maritime Anomaly Detection
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
- Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
- SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- SportD: Can VLMs Physically Strategize?
- Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
- SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows
- Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
- StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
- State Representation Matters in Deep Reinforcement Learning: Application to Energy Trading
- StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems
- Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
- StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows
- Structured Output Collapses Answer Diversity Across 44 Language Models
- Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents
- Supra Cognitive Modes: A Routed Architecture for Agent Memory
- Survey on Evaluation of LLM-based Agents
- Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
- TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
- TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
- TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
- Tactile: Giving Computer-Using Agents Hands and Feet
- TaskCraft: Automated Generation of Agentic Tasks
- Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge
- Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents
- Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
- Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
- TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution
- The Amazing Agent Race: Strong Tool Users, Weak Navigators
- The Energy Society: A Simulation Environment for Studying Agent Cooperation under Survival Pressure
- The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
- The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
- The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution
- The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
- The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
- The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
- The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
- The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search
- The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
- The Surface You Test Is Not the Surface That Breaks
- Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action
- Theory-Scale Auto-Formalization of Logics for Computer Science
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction
- Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
- ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
- ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval
- TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
- Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
- Toward Scalable Terminal Task Synthesis via Skill Graphs
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- Towards All-in-One Medical Image Re-Identification
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
- Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
- Trace-Level Analysis of Information Contamination in Multi-Agent Systems
- Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
- TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
- TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning
- TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models
- TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning Capabilities of LLMs as Urban Agents
- Uncovering Modality Discrepancy and Generalization Illusion for General-Purpose 3D Medical Segmentation
- Understanding Agent-Based Patching of Compiler Missed Optimizations
- UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VLMgineer: Vision-Language Models as Robotic Toolsmiths
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
- Video Action Differencing
- Video Action Differencing
- Video Action Differencing
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- Virtual Community: An Open World for Humans, Robots, and Society
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- Vision Language Models are Biased
- Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It
- Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
- VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
- WOLF: Werewolf-based Observations for LLM Deception and Falsehoods
- WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding
- WebDS: An End-to-End Benchmark for Web-based Data Science
- WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
- What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
- What Factors Affect LLMs and RLLMs in Financial Question Answering?
- What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
- What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents
- What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models
- When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
- When Agents “Misremember” Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
- When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
- When Does Continual Learning Require Learning
- When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering
- When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
- When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
- When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
- Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
- Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding
- Who Checks the Citations? Benchmarking Legal Hallucination Detection
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
- Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
- Xiaomi-GUI-0 Technical Report
- Xiaomi-GUI-0 Technical Report
- Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems
- Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning
- Zephyrus: An Agentic Framework for Weather Science
- ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
- lmgame-Bench: How Good are LLMs at Playing Games?
- scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology
chain-of-thought¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents
- AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
- Benefits and Limitations of Communication in Multi-Agent Reasoning
- Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- CLAIM: An Intent-Driven Multi-Agent Framework for Analyzing Manipulation in Courtroom Dialogues
- CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- Caption This, Reason That: VLMs Caught in the Middle
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
- ContextAgent: Context-Aware Proactive LLM Agents with Open-world Sensory Perceptions
- Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
- DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION
- Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents
- EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning
- EWE: An Agentic Framework for Extreme Weather Analysis
- Eliciting Reasoning in Language Models with Cognitive Tools
- Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
- Empowering Long-form Omni-modal Understanding with Robust Audio Perception
- EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- ExpertAgent: Enhancing Personalized Education through Dynamic Planning and Retrieval-Augmented Long-Chain Reasoning
- FLUX-Reason-6M & PRISM-Bench: A Million-Scale Text-to-Image Reasoning Dataset and Comprehensive Benchmark
- Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents
- From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
- Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
- Goal-Aware Identification and Rectification of Misinformation in Multi-Agent Systems
- Grounded 3D-Aware Spatial Vision-Language Modeling
- Grounded Reinforcement Learning for Visual Reasoning
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- History-Aware Reasoning for GUI Agents
- Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation
- Hybrid Training for Vision-Language-Action Models
- Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
- Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
- Knowledge-Centric Agents for Workflow Generation
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- LLM Strategic Reasoning: Agentic Study through Behavioral Game Theory
- LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
- LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- Latent Chain-of-Thought for Visual Reasoning
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
- Mastering Olympiad-Level Physics with Artificial Intelligence
- MentalThink: Shaping Thoughts in Mental SVG World
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
- MuSLR: Multimodal Symbolic Logical Reasoning
- Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- On Test-Time Scaling for Vision-Language Models
- OpenCUA: Open Foundations for Computer-Use Agents
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- ProRefine: Inference-Time Prompt Refinement with Textual Feedback
- PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models
- Reasoning-Driven Multimodal LLM for Domain Generalization
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
- RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
- Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
- SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- Scaling RL to Long Videos
- Self-Taught Agentic Long Context Understanding
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
- Tandem Reinforcement Learning with Verifiable Rewards
- Teaching Vision-Language-Action Models What to See and Where to Look
- Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
- The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary
- Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
- Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models
- Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
- TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- What Factors Affect LLMs and RLLMs in Financial Question Answering?
- Where Do CoT Training Gains Land in LLM based Agents?
- WorkDrive: Roadwork Chain of Causation for Autonomous Driving
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
clip¶
- $\Delta \mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models
- A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation
- A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
- AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
- AdaBoosting Text Prompts for Vision-Language Models
- Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation
- AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models
- Aligning Visual Contrastive learning models via Preference Optimization
- An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models
- Approximate Domain Unlearning for Vision-Language Models
- Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval
- Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- Bilateral Information-aware Test-time Adaptation for Vision-Language Models
- BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning
- BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection
- Causal Graphical Models for Vision-Language Compositional Understanding
- Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations
- Conditional Representation Learning for Customized Tasks
- Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
- Cross-Modal Redundancy and the Geometry of Vision–Language Embeddings
- Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- Data Scaling Laws for Radiology Foundation Models
- DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection
- Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
- Discrete Latent Features Ablate Adversarial Attack: A Robust Prompt Tuning Framework for VLMs
- Divergence-enhanced Knowledge-guided Context Optimization for Visual-Language Prompt Tuning
- Domain Adaptive Hashing Retrieval via VLM Assisted Pseudo-Labeling and Dual Space Adaptation
- Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning
- Domain Generalization via Text-Anchored Information Bottleneck
- Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
- Enhanced Continual Learning of Vision-Language Models with Model Fusion
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- Explaining CLIP Zero-shot Predictions Through Concepts
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere
- Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
- FHGS: Feature-Homogenized Gaussian Splatting
- FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts
- Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining
- Fine-grained CLIP fine-tuning with self-annotated region alignment
- Flatness Guided Test-Time Adaptation for Vision-Language Models
- FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
- Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation
- From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit
- From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
- GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
- GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- GenIR: Generative Visual Feedback for Mental Image Retrieval
- GeoDetect: Geometric Adversarial Detection for VLPs
- Hierarchically Robust Zero-shot Vision-language Models
- How can embedding models bind concepts?
- Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models
- Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
- Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
- InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
- Instance-Level Composed Image Retrieval
- InstructSAM: A Training-free Framework for Instruction-Oriented Remote Sensing Object Recognition
- Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models
- KeepLoRA: Continual Learning with Residual Gradient Adaptation
- LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models
- LVLM-Driven Attribute-Aware Modeling for Visible-Infrared Person Re-Identification
- Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Language-Assisted Feature Transformation for Anomaly Detection
- Language-Assisted Super-Resolution from Real-World Low-Resolution Patches
- Learning Robust Vision-Language Models from Natural Latent Spaces
- Learning a Cross-Modal Schrödinger Bridge for Visual Domain Generalization
- MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification
- MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
- MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration
- MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning
- Machine Unlearning via Task Simplex Arithmetic
- MaskInversion: Localized Embeddings via Optimization of Explainability Maps
- Matched Data, Better Models: Target Aligned Data Filtering with Sparse Autoencoders
- MedForge: Building Medical Foundation Models Like Open Source Software Development
- Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
- Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
- Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities
- Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
- MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
- MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
- Multi-Modal Interactive Agent Layer for Few-Shot Universal Cross-Domain Retrieval and Beyond
- Multimodal Causal Reasoning for UAV Object Detection
- Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- Noisy Test-Time Adaptation in Vision-Language Models
- NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data
- Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions
- OOD-Barrier: Build a Middle-Barrier for Open-Set Single-Image Test Time Adaptation via Vision Language Models
- Object-Centric Refinement for Enhanced Zero-Shot Segmentation
- Object-centric binding in Contrastive Language-Image Pretraining
- One-for-All Few-Shot Anomaly Detection via Instance-Induced Prompt Learning
- Open Ad-hoc Categorization with Contextualized Feature Learning
- PRiSM: Prototype Regularization for Few-Shot VLMs
- Perception Encoder: The best visual embeddings are not at the output of the network
- Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning
- Post-hoc Probabilistic Vision-Language Models
- Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models
- ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection
- QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
- QuARI: Query Adaptive Retrieval Improvement
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing
- Ramen: Robust Test-Time Adaptation of Vision-Language Models with Active Sample Selection
- Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification
- Repurposing CLIP to Localize at Pixel Level
- Reversible Primitive–Composition Alignment for Continual Vision–Language Learning
- Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
- Revisiting Confidence Calibration for Misclassification Detection in VLMs
- Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- Robustifying Vision-Language Models via Test-Time Prompt Adaptation
- Robustness in Both Domains: CLIP Needs a Robust Text Encoder
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs
- Seeing What’s Not There: Negation Understanding Needs More Than Training
- Seeing What’s Wrong: A Trajectory-Guided Approach to Caption Error Detection
- Selective Test-Time Debiasing for CLIP via Reward Gating
- Semantic Robustness Certification for Vision-Language Models
- SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
- Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
- Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning
- Statistics Caching Test-Time Adaptation for Vision-Language Models
- Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition
- SuperCLIP: CLIP with Simple Classification Supervision
- TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- TRAP: Targeted Redirecting of Agentic Preferences
- TRAP: Targeted Redirecting of Agentic Preferences
- TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
- TULIP: Token-length Upgraded CLIP
- Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
- Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
- Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation
- ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
- Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- Towards Text-Mask Consistency in Medical Image Segmentation
- ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
- Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models
- U-shaped Multi-granularity Learning for Vision-Language Models
- USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning
- Unleashing Vision-Language Semantics for Deepfake Video Detection
- Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
- VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning
- VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
- Video Action Differencing
- Video Action Differencing
- Vision Transformers Don't Need Trained Registers
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- Vocabulary-Guided Gait Recognition
- Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction
- WIMFRIS: WIndow Mamba Fusion and Parameter Efficient Tuning for Referring Image Segmentation
- WRING Out The Bias: A Rotation-Based Alternative To Projection Debiasing
- Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
- When Negation Is a Geometry Problem in Vision-Language Models
- When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs
- pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
code-generation¶
- A Multimodal Conversational Agent for Tabular Data Analysis
- A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols
- A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation
- AI-Researcher: Autonomous Scientific Innovation
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
- ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
- AVDA: Autonomous Vibe Detection Authoring for Cybersecurity
- AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization
- Agint: Agentic Graph Compilation for Software Engineering Agents
- Agint: Agentic Graph Compilation for Software Engineering Agents
- An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
- AnalogAgent: Self-Improving Analog Circuit Design Automation with LLM Agents
- Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition
- AutoB2G: A Large Language Model-Driven Agentic Framework For Automated Building-Grid Co-Simulation
- AutoFSM: A Multi-agent Framework for FSM Code Generation with IR and SystemC-Based Testing
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
- Autoformalizing Memory Specifications with Agents
- Automated Design Optimization via Strategic Search with Large Language Models
- Automating High Energy Physics Data Analysis with LLM-Powered Agents
- BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution
- Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
- Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
- ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
- Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
- CoDA: Agentic Systems for Collaborative Data Visualization
- CoDA: Agentic Systems for Collaborative Data Visualization
- Code Aesthetics with Agentic Reward Feedback
- Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks
- CodeDistiller: Automatically Generating Code Libraries for Scientific Coding Agents
- CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
- ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
- Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
- DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
- Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework
- Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents
- EnvTrace: Simulation-Based Semantic Evaluation of LLM Code via Execution Trace Alignment -- Demonstrated at Synchrotron Beamlines
- Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs
- From Assistant to Independent Developer — Are GPTs Ready for Software Development?
- GISclaw: A Comprehensive Open-Source LLM Agent System for Realistic Multi-Step Geospatial Analysis
- GS-Agent: Creating 4D Physical Worlds With Generative Simulation
- Generating CAD Code with Vision-Language Models for 3D Designs
- Generative Caching for Structurally Similar Prompts and Responses
- Harness Engineering for LLM-Driven GPU Kernel Generation
- Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval
- INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
- InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning
- InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning
- IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration
- LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research
- Language Modeling by Language Models
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
- MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- On the risk of coding before testing: An empirical study on LLM-based test generation workflow
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
- PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning
- PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
- Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Reflection-Driven Control for Trustworthy Code Agents
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Rethinking Code Performance Benchmarks for LLMs
- Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- STARK: Strategic Team of Agents for Refining Kernels
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- Scaling Generalist Data-Analytic Agents
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- Software Supply Chains are Dead: Use-Case-Oriented Regeneration
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- SpecMAS: A Multi-Agent System for Self-Verifying System Generation via Formal Model Checking
- TTHE: Test-Time Harness Evolution
- TTHE: Test-Time Harness Evolution
- TeachMaster: Generative Teaching via Code
- The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Corpus-Grounded Agentic LLMs for Multilingual Grammatical Analysis
- Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
- TraceDev: A Traceability-Driven Multi-agent Framework for Requirement-to-Code Development
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- TusoAI: Agentic Optimization for Scientific Methods
- UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
- UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
- VLMaterial: Procedural Material Generation with Large Vision-Language Models
- Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
- What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations
- When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering
- Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- Zephyrus: An Agentic Framework for Weather Science
contrastive-learning¶
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- Aegis: Automated Error Generation and Attribution for Multi-Agent Systems
- Aligning Visual Contrastive learning models via Preference Optimization
- Asynchronous Matching with Dynamic Sampling for Multimodal Dataset Distillation
- Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval
- BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis
- BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning
- Building a General SimCLR Self-Supervised Foundation Model Across Neurological Diseases to Advance 3D Brain MRI Diagnoses
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- Compress & Cache: Vision token compression for efficient generation and retrieval
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
- DDO: Dual-Decision Optimization for LLM-Based Medical Consultation via Multi-Agent Collaboration
- Diagnosing Task Insensitivity in Language Agents
- Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence
- Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
- Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
- Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
- Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- Encouraging metric-aware diversity in contrastive representation space
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory
- FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging
- FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
- Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining
- Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
- Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
- Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- GLOW: Graph-Language Co-Reasoning for Agentic Workflow Performance Prediction
- GeoDetect: Geometric Adversarial Detection for VLPs
- HAMLET: Switch Your Vision-Language-Action Model into a History-Aware Policy
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models
- HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space
- Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
- Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
- Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models
- Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning
- LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
- Language-Assisted Super-Resolution from Real-World Low-Resolution Patches
- Language-Instructed Vision Embeddings for Controllable and Generalizable Perception
- Layer-wise Cross-Lingual Depression Detection from Speech: Analysis with Contrastive Alignment
- Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge
- Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis
- Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
- Lightweight Neural App Control
- M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
- MEDFORM: A Foundation Model for Contrastive Learning of CT Imaging and Clinical Numeric Data in Multi-Cancer Analysis
- MM-EMBED: UNIVERSAL MULTIMODAL RETRIEVAL WITH MULTIMODAL LLMS
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- Mind the Heads: Topological Representation Alignment for Multimodal LLMs
- MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- Multimodal Distribution Matching for Vision-Language Dataset Distillation
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
- OOD-Barrier: Build a Middle-Barrier for Open-Set Single-Image Test Time Adaptation via Vision Language Models
- OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation
- Object-centric binding in Contrastive Language-Image Pretraining
- On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
- One-for-All Few-Shot Anomaly Detection via Instance-Induced Prompt Learning
- Perception Encoder: The best visual embeddings are not at the output of the network
- Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
- QuARI: Query Adaptive Retrieval Improvement
- RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization
- RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification
- Revealing Multimodal Causality with Large Language Models
- Reversible Primitive–Composition Alignment for Continual Vision–Language Learning
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
- Semantic Anchoring for Robotic Action Representations
- Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning
- Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition
- Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy
- SuperCLIP: CLIP with Simple Classification Supervision
- TULIP: Token-length Upgraded CLIP
- Temporal Inversion for Learning Interval Change in Chest X-Rays
- Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning
- The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
- Towards Text-Mask Consistency in Medical Image Segmentation
- ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
- Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
- VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
- Vision Foundation Models for Computed Tomography
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
- ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
credit-assignment¶
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- Agentic Reinforcement Learning with Implicit Step Rewards
- AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning
- BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition
- DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
- EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
- Empowering LLM Tool Invocation with Tool-call Reward Model
- From Agent Failures to Text Policies: What Works and What Breaks
- From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
- GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
- GEM: A Gym for Generalist LLMs
- Group-in-Group Policy Optimization for LLM Agent Training
- Heterogeneous Multi-Agent Reinforcement Learning with Attention for Cooperative and Scalable Feature Transformation
- Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- High-order Interactions Modeling for Interpretable Multi-Agent Q-Learning
- In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
- Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents
- LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- Multi-agent In-context Coordination via Decentralized Memory Retrieval
- OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
- STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
- SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
- Sequential Multi-Agent Dynamic Algorithm Configuration
- Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
- SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
- Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
- ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives
- UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- When Does Muon Help Agentic Reinforcement Learning?
embodied-ai¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
- 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
- Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Active Test-time Vision-Language Navigation
- ActiveVOO: Value of Observation Guided Active Knowledge Acquisition for Open-World Embodied Lifted Regression Planning
- AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- An Intelligent-Cloud Edge Multimodal Interaction System for Robots
- Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
- Automating the Design of Embodied AgentArchitectures
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
- BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification
- Context Learning for Multi-Agent Discussion
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
- DreamPhase: Offline Imagination and Uncertainty-Guided Planning for Large-Language-Model Agents
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- EA3D: Online Open-World 3D Object Extraction from Streaming Videos
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
- EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
- Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- Enhancing LLM Planning for Robotics Manipulation through Hierarchical Procedural Knowledge Graphs
- Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
- Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting
- Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization
- Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
- FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
- FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
- ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
- From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
- GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
- Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation
- Grounded 3D-Aware Spatial Vision-Language Modeling
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- Hybrid Training for Vision-Language-Action Models
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision
- Infinite Worlds with Versatile Interactions
- Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
- Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics
- Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs
- LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- LIME: Learning Intent-aware Camera Motion from Egocentric Video
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- Learning Multi-View Spatial Reasoning from Cross-View Relations
- Learning Spatial-Aware Manipulation Ordering
- Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching
- Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
- Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
- ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
- MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality
- Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
- No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
- Object-Centric World Models for Causality-Aware Reinforcement Learning
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- One Video, One World: Turning Monocular Video into Physical 4D Scenes
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Patch Policy: Efficient Embodied Control via Dense Visual Representations
- Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation
- Pelican-VLA 0.5: Attending Before Acting Benefits Generalization
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- PhysX-3D: Physical-Grounded 3D Asset Generation
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
- Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
- QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
- ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
- ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
- Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
- Scaling Behavior Foundation Model for Humanoid Robots
- Scaling up Memory for Robotic Control via Experience Retrieval
- SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
- See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
- SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
- Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference
- Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation
- Seek to Segment: Active Perception for Panoramic Referring Segmentation
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Semantic Anchoring for Robotic Action Representations
- Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning
- Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
- SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
- The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems
- The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection
- Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models
- Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies
- Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
- Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation
- Uncertainty-Aware Gaussian Map for Vision-Language Navigation
- UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning
- Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VLMgineer: Vision-Language Models as Robotic Toolsmiths
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- Virtual Community: An Open World for Humans, Robots, and Society
- Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review
- WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
- Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
- What Can RL Bring to VLA Generalization? An Empirical Study
- World-aware Planning Narratives Enhance Large Vision-Language Model Planner
- Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
evaluation¶
- "Are We Done Yet?": A Vision-Based Judge for Autonomous Task Completion of Computer Use Agents
- A Benchmark for Deep Information Synthesis
- A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments
- A New Framework for Cybersecurity Refusals in AI Agents
- A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents
- A superpersuasive autonomous policy debating system
- AI Research Agents Narrow Scientific Exploration
- AI translation of literary texts is "fine", but readers still prefer human translations
- AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
- AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
- AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
- Agentic Persona Control and Task State Tracking for Realistic User Simulation in Interactive Scenarios
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents
- Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
- Agents in the Wild: Where Research Meets Deployment
- An Exam for Active Observers
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
- AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation
- Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
- BAID: A Benchmark for Bias Assessment of AI Detectors
- Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
- Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- Benchmarking LLM Tool-Use in the Wild
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
- Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems
- CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
- CUPCase: Clinically Uncommon Patient Cases and Diagnoses Dataset
- CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
- Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Concept-Guided Spatial Regularization for World Models in Atari Pong
- Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations
- Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
- Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
- Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
- Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling
- DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
- Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do LLM Agents Know How to Ground, Recover, and Assess? Evaluating Epistemic Competence in Information-Seeking Agents
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems
- Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
- Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs
- EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
- Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
- Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
- Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
- EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- FARS: A Fully Automated Research System Deployed at Scale
- FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
- From Assistant to Independent Developer — Are GPTs Ready for Software Development?
- From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review
- FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
- GAVEL: Grounded Caption Error Verification and Localization
- GISclaw: A Comprehensive Open-Source LLM Agent System for Realistic Multi-Step Geospatial Analysis
- Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments
- GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- GuardianAgentBench: Where Agents Fail and How to Guard Them
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
- HeurekaBench: A Benchmarking Framework for AI Co-scientist
- IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- ImpossibleBench: Measuring LLMs' Propensity of Exploiting Test Cases
- In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations
- Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation
- InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
- InnoGym: Benchmarking the Innovation Potential of AI Agents
- K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge
- Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
- LH-DECEPTION: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions
- Language Models as Measurement Apparatus for Culture
- Language Models as Measurement Apparatus for Culture
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
- MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
- MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMReD: a Cross-Modal Benchmark for Dense Context Reasoning
- MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
- ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
- Measuring AI Ability to Complete Long Software Tasks
- Measuring Agents in Production
- MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents
- MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- MuSLR: Multimodal Symbolic Logical Reasoning
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
- Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
- Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
- MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents
- NL-Eye: Abductive NLI For Images
- NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
- NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
- OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios
- P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
- PACE: A Proxy for Agentic Capability Evaluation
- PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization
- PM-Bench: Evaluating Prospective Memory in LLM Agents
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
- ProBench: Benchmarking GUI Agents with Accurate Process Information
- QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
- RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
- RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
- Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
- SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
- StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
- Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
- Strategic Hypothesis Testing
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
- Uncovering Modality Discrepancy and Generalization Illusion for General-Purpose 3D Medical Segmentation
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
- When Negation Is a Geometry Problem in Vision-Language Models
- When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
- When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More
- Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
- Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
- scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology
fine-tuning¶
- A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation
- Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
- Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
- Aloe-Vision: Robust Vision-Language Models for Healthcare
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CLAIM: An Intent-Driven Multi-Agent Framework for Analyzing Manipulation in Courtroom Dialogues
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- Caption This, Reason That: VLMs Caught in the Middle
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning
- EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- Environmental Understanding Vision-Language Model for Embodied Agent
- Estimating Worst-Case Frontier Risks of Open-Weight LLMs
- ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
- Feature Quality and Adaptability of Medical Foundation Models: A Comparative Evaluation for Radiographic Classification and Segmentation
- Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives
- Fine-grained CLIP fine-tuning with self-annotated region alignment
- Gatekeeper: Improving Model Cascades Through Confidence Tuning
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- ICaRus: Identical Cache Reuse for Efficient Multi-Model Inference
- Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
- Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
- MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
- MedImageInsight for Thoracic Cavity Health Classification from Chest X-rays
- Multi-modal Rail Crossing Safety Analysis
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
- Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
- Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Quantifying Cross-Modality Memorization in Vision-Language Models
- RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
- Reasoning-Driven Multimodal LLM for Domain Generalization
- Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
- Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging
- Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- Semantic Anchoring for Robotic Action Representations
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
- SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
- Small Language Models for Efficient Agentic Tool Calling: Outperforming Large Models with Targeted Fine-tuning
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- Spilling the Beans: Teaching LLMs to Self-Report Their Hidden Objectives
- Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
- Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
- StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation
- The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
- Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
- Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports
- Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
- Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
- VLMaterial: Procedural Material Generation with Large Vision-Language Models
- What Can RL Bring to VLA Generalization? An Empirical Study
- What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models
- Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems
- Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
- ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
foundation-model¶
- A Hierarchical Benchmark of Foundation Models for Dermatology
- A Nationwide Japanese Medical Claims Foundation Model: Balancing Model Scaling and Task-Specific Computational Efficiency
- A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology
- A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts
- AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
- Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
- Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets
- Benchmarking Foundation Models for Renal Lesion Stratification in CT
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- Building a General SimCLR Self-Supervised Foundation Model Across Neurological Diseases to Advance 3D Brain MRI Diagnoses
- CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
- CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?
- Certifying Deep Network Risks and Individual Predictions with PAC-Bayes Loss via Localized Priors
- CheXWorld: Exploring Image World Modeling for Radiograph Representation Learning
- Collective Intelligence with Foundation Models
- Deep Reprogramming Distillation for Medical Foundation Models
- Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language
- Diffusion-empowered AutoPrompt MedSAM
- EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT
- Embodied Navigation Foundation Model
- FMIR, a foundation model-based Image Registration Framework for Robust Image Registration
- Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments
- Forecasting in Offline Reinforcement Learning for Non-stationary Environments
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- Free Lunch in Medical Image Foundation Model Pre-training via Randomized Synthesis and Disentanglement
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- GROW$^2$: Grounding Which and Where for Robot Tool Use
- Generalist versus Specialist Vision Foundation Models for Ocular Disease and Oculomics
- Generative Artificial Intelligence in Medical Imaging: Foundations, Progress, and Clinical Translation
- Health system learning achieves generalist neuroimaging models
- Imaging-anchored Multiomics in Cardiovascular Disease: Integrating Cardiac Imaging, Bulk, Single-cell, and Spatial Transcriptomics
- Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning
- LapFM: A Laparoscopic Segmentation Foundation Model via Hierarchical Concept Evolving Pre-training
- Large (Vision) Language Models are Unsupervised In-Context Learners
- Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- Masked and Predictive Self-Supervised Foundation Models for 3D Brain MRI
- MedImageInsight for Thoracic Cavity Health Classification from Chest X-rays
- Multimodal Medical Code Tokenizer
- Multimodal, Multi-Disease Medical Imaging Foundation Model (MerMED-FM)
- PEFT-MedSAM: Efficient Fine-Tuning of Medical Foundation Models for Explainable Skin Lesion Segmentation
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling
- PathVQ: Reforming Computational Pathology Foundation Model for Whole Slide Image Analysis via Vector Quantization
- Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT
- Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
- ProstNFound+: A Prospective Study using Medical Foundation Models for Prostate Cancer Detection
- Quantum Kernel Advantage over Classical Collapse in Medical Foundation Model Embeddings
- RELICT: A Replica Detection Framework for Medical Image Generation
- Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
- SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
- The Double Contingency Problem: AI Recursion and the Limits of Interspecies Understanding
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning
- UNICON: UNIfied CONtinual Learning for Medical Foundational Models
- Uncovering Modality Discrepancy and Generalization Illusion for General-Purpose 3D Medical Segmentation
- UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
- Weight Group-wise Post-Training Quantization for Medical Foundation Model
grounding¶
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs
- Boundary-Aware Context Grounding for A Low-Channel EEG Agent
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging the gap to real-world language-grounded visual concept learning
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
- Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models
- EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- Fantastic Tractor-Dogs and How Not to Find Them With Open-Vocabulary Detectors
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs
- Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
- Grounding Computer Use Agents on Human Demonstrations
- Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
- H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning
- HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector
- InstanceControl: Controllable Complex Image Generation without Instance Labeling
- LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension
- M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
- One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
- OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts
- Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models
- ProBench: Benchmarking GUI Agents with Accurate Process Information
- Prune4Web: DOM Tree Pruning Programming for Web Agent
- RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- Tactile: Giving Computer-Using Agents Hands and Feet
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
- Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
- V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
- WebDS: An End-to-End Benchmark for Web-based Data Science
- XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models
grpo¶
- $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
- A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
- Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- AlphaAgentEvo: Evolution-Oriented Alpha Mining via Self-Evolving Agentic Reinforcement Learning
- AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
- CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics
- CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
- ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
- Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
- CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Code Aesthetics with Agentic Reward Feedback
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Confidence-Aware Tool Orchestration for Robust Video Understanding
- Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
- Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing
- CurateEvo: Data-Curation Evolving for Agentic Post-Training
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
- DaVinci: Reinforcing Visual-Structural Syntax in MLLMs for Generalized Scientific Diagram Parsing
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION
- Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
- DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
- DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
- Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment
- EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
- EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- Empowering LLM Tool Invocation with Tool-call Reward Model
- Environmental Understanding Vision-Language Model for Embodied Agent
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space
- GRASP: GRanularity-Aware Search Policy for Agentic RAG
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- GRIT: Teaching MLLMs to Think with Images
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Grounded Reinforcement Learning for Visual Reasoning
- Group-in-Group Policy Optimization for LLM Agent Training
- Guava: An Effective and Universal Harness for Embodied Manipulation
- H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning
- History-Aware Reasoning for GUI Agents
- HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
- How to Train Your LLM Web Agent: A Statistical Diagnosis
- IPR-1: Interactive Physical Reasoner
- Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
- Improving Vision-language Models with Perception-centric Process Reward Models
- In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents
- Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- Joint Learning of Experiential Rules and Policies for Large Language Model Agents
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
- Learning to Orchestrate Agents in Natural Language with the Conductor
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
- Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- MedDDC-Eval: Diagnosis-Decoupled Evaluation of Multi-Turn Medical Consultation Agents
- MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
- MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
- MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
- More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multimodal Policy Internalization for Conversational Agents
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
- PRInTS: Reward Modeling for Long-Horizon Information Seeking
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
- PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
- Post-Training in End-to-End Autonomous Driving
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
- Process Reward Informed Tree Rollout for Effective Multi-Turn RL
- RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
- RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents
- Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- SETA: Scaling Environments for Terminal Agents
- SEVerA: Verified Synthesis of Self-Evolving Agents
- SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
- SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
- STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- Scaling RL to Long Videos
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents
- Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- TREK: Distill to Explore, Reinforce to Refine
- TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning
- Talking Points: Describing and Localizing Pixels
- Tandem Reinforcement Learning with Verifiable Rewards
- Teaching Vision-Language-Action Models What to See and Where to Look
- The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works
- The Hitchhiker's Guide to Agentic AI: From Foundations to Systems
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- ToolRL: Reward is All Tool Learning Needs
- ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
- ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training Language Models to Use Prolog as a Tool
- Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
- Tree Search for LLM Agent Reinforcement Learning
- UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction as Reasoning
- UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Unlocking Long-Horizon Agentic Search with Large-Scale End-to-End RL
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
- WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
- WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
- When Does Muon Help Agentic Reinforcement Learning?
- WorkDrive: Roadwork Chain of Causation for Autonomous Driving
- Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
gui-agent¶
- AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
- Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
- CoAct-1: Computer-using Multi-agent System with Coding Actions
- Computer Agent Arena: Toward Human-Centric Evaluation and Analysis of Computer-Use Agents
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
- GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
- GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- History-Aware Reasoning for GUI Agents
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control
- Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- OmniGUI: Benchmarking GUI Agents in Omni-Modal Smartphone Environments
- OpenCUA: Open Foundations for Computer-Use Agents
- OpenForgeRL: Train Harness-native Agents in Any Environment
- Plover: Steering GUI Agents through Plan-Centric Interaction
- ProBench: Benchmarking GUI Agents with Accurate Process Information
- SCUBA: Salesforce Computer Use Benchmark
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- VisCritic: Visual State Comparison as Process Reward for GUI Agents
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
- Xiaomi-GUI-0 Technical Report
- Xiaomi-GUI-0 Technical Report
hallucination¶
- AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
- AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
- Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
- Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
- Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models
- DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
- Discovering Compositional Hallucinations in LVLMs
- Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding
- Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models
- Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
- Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
- Evian: Towards Explainable Visual Instruction-tuning Data Auditing
- Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs
- Fantastic Tractor-Dogs and How Not to Find Them With Open-Vocabulary Detectors
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- GAVEL: Grounded Caption Error Verification and Localization
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs
- Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
- Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
- HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector
- Hallucination Reduction with CASAL: Contrastive Activation Steering for Amortized Learning
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- Hallucination-aware Intermediate Representation Edit in Large Vision-Language Models
- Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
- Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Improving Vision-language Models with Perception-centric Process Reward Models
- Information-Regularized Attention for Visual-Centric Reasoning
- Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- Is Your Video Language Model a Reliable Judge?
- LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction
- LLM-PySC2: Starcraft II learning environment for Large Language Models
- Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation
- Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI
- MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
- Mind the Heads: Topological Representation Alignment for Multimodal LLMs
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement
- Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
- Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
- Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
- ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
- Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering
- STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
- Search-based Testing of Vision Language Models for In-Car Scene Understanding
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding
- Structural Graph Probing of Vision-Language Models
- Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
- TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
- The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs
- The Idola Tribus of AI: Large Language Models tend to perceive order where none exists
- The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning
- The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- Vision Language Models are Biased
- Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing
- XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models
harness¶
- A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
- A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems
- A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems
- A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
- A Multimodal Conversational Agent for Tabular Data Analysis
- A Security Analysis of the OpenClaw AI Agent Framework
- AI Hiring with LLMs: A Context-Aware and Explainable Multi-Agent Framework for Resume Screening
- AI Research Agents Narrow Scientific Exploration
- AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
- ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- AVDA: Autonomous Vibe Detection Authoring for Cybersecurity
- AdsMind: A Physics-Grounded Multi-Agent System for Self-Correcting Discovery of Adsorption Configurations on Heterogeneous Catalyst Surfaces
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- Agentic Generation of AST Transformation Rules for Fixing Breaking Updates
- Agentic Hardware Design as Repository-Level Code Evolution
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- Agentic Time Machine as an Infrastructure for Future-Event Forecasting
- Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response
- Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment
- AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
- AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition
- AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
- Auditing Agent Harness Safety
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
- BabelCoder: Agentic Code Translation with Specification Alignment
- BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
- Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
- Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution
- Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
- Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding
- CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science
- CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents
- CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market
- Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
- Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents
- ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
- Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization
- CoDA: Agentic Systems for Collaborative Data Visualization
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery
- Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
- Copy-on-Write Scoring: Application-Specific Agent Evaluations
- Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
- Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects
- Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents
- Discourse Graph Guided Document Translation with Large Language Models
- Distributed Agent Reasoning Across Independent Systems With Strict Data Locality
- Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement
- Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EMULATE: A Multi-Agent Framework for Determining the Veracity of Atomic Claims by Emulating Human Actions
- EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
- Efficient Test-Time Optimization for Multi-Agent Proof Autoformalization
- Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework
- EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
- Environment-Grounded Multi-Agent Workflow for Autonomous Penetration Testing
- EpiPlanAgent: Agentic Automated Epidemic Response Planning
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
- FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
- FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering
- FirmPilot: Evidence-Guided Multi-Agent Environment Recovery for IoT Firmware Rehosting
- Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming
- From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity
- From Model Scaling to System Scaling: Scaling the Harness in Agentic AI
- From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
- From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
- Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing
- GISclaw: A Comprehensive Open-Source LLM Agent System for Realistic Multi-Step Geospatial Analysis
- Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- Governed Evolution of Agent Runtimes through Executable Operational Cognition
- Guava: An Effective and Universal Harness for Embodied Manipulation
- HARBOR: Automated Harness Optimization
- Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
- Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents
- Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
- How and Why Agents Can Identify Bug-Introducing Commits
- IPO Finance Agent: Evaluation of LLM Financial Analysts beyond Finance Agent v2, with Automated Rubric Generation -- the Case of the SpaceX (SPCX) IPO
- InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
- Investigating Multi-Agent Deliberation in Law
- Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search
- KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents
- KPI2KVI: A Multi Agent Workflow for Calculating Key Value Indicators from Service Descriptions
- Kimi-Dev: Agentless Training as Skill Prior for SWE-agents
- Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
- LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Leyline: KV Cache Directives for Agentic Inference
- LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation
- LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
- MAFA: A Multi-Agent Framework for Enterprise-Scale Annotation with Configurable Task Adaptation
- MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning
- MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
- MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
- MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection
- Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
- MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models
- MediHive: A Decentralized Agent Collective for Medical Reasoning
- MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- Mind the (Belief) Gap: Group Identity in the World of LLMs
- Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation
- MuMuTestUp: Mutation-based Multi-Agent Test Case Update
- Multi-Agent LLM-based Metamorphic Testing for REST APIs
- Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization
- Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
- Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
- MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning
- NOVA: An Agentic Framework for Automated Histopathology Analysis and Discovery
- Natural Language Access to Domain-Specific Metadata: A Reusable Framework for LLM Query Generation
- Near-Miss: Latent Policy Failure Detection in Agentic Workflows
- One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Prediction
- Open Source Planning & Control System with Language Agents for Autonomous Scientific Discovery
- OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement
- Orchard: An Open-Source Agentic Modeling Framework
- P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
- PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreements
- PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving
- PDEFlow: Autonomous Agentic PDE Pipelines for Neural Operator Learning and Solver-Free Inference
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
- PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue
- PalmClaw: A Native On-Device Agent Framework for Mobile Phones
- PersonaAgent: Bridging Memory and Action for Personalized LLM Agents
- PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts
- Poster: EdgeCitadel -- Hybrid NATS-MQTT Orchestration for Edge Multi-Agent Systems
- ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration
- Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives
- PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization
- QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
- R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization
- RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar
- RMA: an Agentic System for Research-Level Mathematical Problems
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge
- Rethinking Code Performance Benchmarks for LLMs
- Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation
- SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?
- SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery
- SciNav: A General Agent Framework for Scientific Coding Tasks
- SciNav: A General Agent Framework for Scientific Coding Tasks
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
- SentinelAI: A Multi-Agent Framework for Structuring and Linking NG9-1-1 Emergency Incident Data
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
- Spider 2.0: Evaluating Language Models on Real-World Enterprise Text-to-SQL Workflows
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- Story2Proposal: A Scaffold for Structured Scientific Paper Writing
- Structured Reasoning for Fairness: A Multi-Agent Approach to Bias Detection in Textual Data
- SwarmX: Agentic Scheduling for Low-Latency Agentic Systems
- Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks
- The Amazing Agent Race: Strong Tool Users, Weak Navigators
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
- Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows
- TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
- Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition
- Towards Agentic Investigation of Security Alerts
- Towards Context-Aware Image Anonymization with Multi-Agent Reasoning
- Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent
- Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
- Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation
- Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
- Towards an Agentic Workflow for Internet Measurement Research
- TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models
- TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning
- Trusted AI Agents in the Cloud
- TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding
- Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
- VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
- Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6
- VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
- WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
- Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing
- Workflows vs Agents for Code Translation
human-in-the-loop¶
- A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows
- Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- AdvisingWise: Supporting Academic Advising in Higher Education Settings Through a Human-in-the-Loop Multi-Agent Framework
- Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
- Agentic SABRE: An Uncertainty-Aware Neuro-Symbolic Multi-Agent Framework for Adaptive Ransomware Detection
- Agentic Synthesis against Counterexample-Supplemented Sketches
- Agents in the Wild: Where Research Meets Deployment
- Aleena: Alignment Agent for Research Software Engineering Collaborations
- An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework
- Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
- AutoCedar: An Agentic Framework for Verifier-Guided Access Control Policy Synthesis
- AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation
- Autonomous Agent-Orchestrated Digital Twins (AADT): Leveraging the OpenClaw Framework for State Synchronization in Rare Genetic Disorders
- Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops
- Building from Scratch: A Multi-Agent Framework with Human-in-the-Loop for Multilingual Legal Terminology Mapping
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding
- Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks
- DanceHA: A Multi-Agent Framework for Document-Level Aspect-Based Sentiment Analysis
- DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
- Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework
- Enabling Self-Improving Agents to Learn at Test Time With Human-In-The-Loop Guidance
- Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning
- FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean
- From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer
- GitLake: Git-for-data for the agentic lakehouse
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- Harness Engineering for LLM-Driven GPU Kernel Generation
- Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents
- HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
- Just A Rather Very Intelligent Spoken Agent
- MAFA: A Multi-Agent Framework for Enterprise-Scale Annotation with Configurable Task Adaptation
- MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
- MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
- MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research
- Measuring Agents in Production
- Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation
- Nonuniformity Principle in Human-AI Coworking
- On the Regulatory Potential of User Interfaces for AI Agent Governance
- Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
- Plover: Steering GUI Agents through Plan-Centric Interaction
- Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework
- SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human Intervention
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
- TeachMaster: Generative Teaching via Code
- The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development
- TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
- ToC: Tree-of-Claims Search with Multi-Agent Language Models
- Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance
- Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence
- Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows
interpretability¶
- A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
- A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- Abstract Counterfactuals for Language Model Agents
- AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems
- Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
- Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs
- Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models
- Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- Cross-Modal Redundancy and the Geometry of Vision–Language Embeddings
- Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
- Decomposition of Concept-Level Rules in Visual Scenes
- DiMaS: Distribution Matching for Steering Vision-Language-Action Models
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- Explaining CLIP Zero-shot Predictions Through Concepts
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- Hallucination Reduction with CASAL: Contrastive Activation Steering for Amortized Learning
- Harnessing Textual Refusal Directions for Multimodal Safety
- High-order Interactions Modeling for Interpretable Multi-Agent Q-Learning
- LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning
- LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
- Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Language Models Can Explain Visual Features via Steering
- Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
- Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
- Mixture of Cognitive Experts in Large Vision-Language Models
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders
- Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
- Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning
- Structural Graph Probing of Vision-Language Models
- Structured Reasoning for Fairness: A Multi-Agent Approach to Bias Detection in Textual Data
- The Double Contingency Problem: AI Recursion and the Limits of Interspecies Understanding
- Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
- Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs
- VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction
- ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
- Vision Foundation Models for Computed Tomography
- Vision Transformers Don't Need Trained Registers
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
iterative-refinement¶
- A Stepwise Questioning Expert-Editor Multi-Agent Framework for Long-Document Summarization
- AI-Researcher: Autonomous Scientific Innovation
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models
- AstroReview: An LLM-driven Multi-Agent Framework for Telescope Proposal Peer Review and Refinement
- AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
- AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment
- BRIDGE: Bootstrapping Text to Control Time-Series Generation via Multi-Agent Iterative Optimization and Diffusion Modeling
- BabelCoder: Agentic Code Translation with Specification Alignment
- Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization
- Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery
- Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
- DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction
- DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?
- EMPATHIA: Multi-Faceted Human-AI Collaboration for Refugee Integration
- EduAgentQG: A Multi-Agent Workflow Framework for Personalized Question Generation
- EpiPlanAgent: Agentic Automated Epidemic Response Planning
- EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- Exploring Agentic Workflows for Generating High Quality Math Visual Aids
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- FACTS: Table Summarization via Offline Template Generation with Agentic Workflows
- Generating CAD Code with Vision-Language Models for 3D Designs
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
- MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
- MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models
- MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- Mastering Olympiad-Level Physics with Artificial Intelligence
- Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research
- Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation
- One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
- OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement
- PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
- PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
- PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
- Prompt-to-Paper: Agentic AI System for Bioinformatics
- R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
- RMA: an Agentic System for Research-Level Mathematical Problems
- SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?
- SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human Intervention
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning
- ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
- Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework
- Towards Doctor-Like Reasoning: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients
- Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
- TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
- TusoAI: Agentic Optimization for Scientific Methods
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
knowledge-distillation¶
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
- ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts
- ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents
- Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
- Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
- BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge
- CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
- CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
- CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
- DOPD: Dual On-policy Distillation
- DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
- DanceHA: A Multi-Agent Framework for Document-Level Aspect-Based Sentiment Analysis
- DeCo-DETR: Decoupled Cognition DETR for efficient Open-Vocabulary Object Detection
- Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
- Deep Reprogramming Distillation for Medical Foundation Models
- Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
- Discovering Compositional Hallucinations in LVLMs
- Distilling LLM Agent into Small Models with Retrieval and Code Tools
- DynEval: Holistic Evaluations of T2I Generative Models in the Wild
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
- GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
- Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
- It Takes Two: Complementary Self-Distillation for Contextual Integrity in LLMs
- Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- Knowledge-Centric Agents for Workflow Generation
- Knowledge-Centric Agents for Workflow Generation
- LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
- LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
- Language-Instructed Vision Embeddings for Controllable and Generalizable Perception
- Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge
- Learning Spatial-Aware Manipulation Ordering
- Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction
- MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
- MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection
- Multi-Turn On-Policy Distillation with Prefix Replay
- Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT
- RADIO1D: Elastic Representations for Condensed Vision Modeling
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- SKILL-DISCO: Distilling and Compiling Agent Traces into Reusable Procedural Skills
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- SigLIP-HD by Fine-to-Coarse Supervision
- Teaching Vision-Language-Action Models What to See and Where to Look
- TurnOPD: Making On-Policy Distillation Turn-Aware for Efficient Long-Horizon Agent Training
- U-shaped Multi-granularity Learning for Vision-Language Models
- Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models
- VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
- Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
- ZooClaw-FashionSigLIP2: Distilled Fine-tuning for Robust Fashion Retrieval
knowledge-graph¶
- A Knowledge-Based Multi-Agent Framework for Security Control Recommendation
- A-Mem: Agentic Memory for LLM Agents
- AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and Large Language Models
- AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model
- Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
- Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
- Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
- Bringing Agentic Search to Earth Observation Data Discovery
- CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering
- DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects
- DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
- Domain-Partitioned Hybrid RAG for Legal Reasoning: Toward Modular and Explainable Legal AI for India
- Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation
- Enhancing LLM Planning for Robotics Manipulation through Hierarchical Procedural Knowledge Graphs
- Enhancing Small Language Models Reasoning through Knowledge Graph Grounding
- From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure
- GENIUS: An Agentic AI Framework for Autonomous Design and Execution of Simulation Protocols
- Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization
- IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response
- Intelligent Human-Machine Partnership for Manufacturing: Enhancing Warehouse Planning through Simulation-Driven Knowledge Graphs and LLM Collaboration
- K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
- KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment
- Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization
- Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA
- Natural Language Access to Domain-Specific Metadata: A Reusable Framework for LLM Query Generation
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
- Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Research
- PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning
- REMem: Reasoning with Episodic Memory in Language Agent
- ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- Structured Personalization: Modeling Constraints as Matroids for Data-Minimal LLM Agents
- Supra Cognitive Modes: A Routed Architecture for Agent Memory
- TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction
- Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework
- VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs
- VibeSearchBench: Benchmarking Long-horizon Proactive Search in the Wild
- VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
- WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
- What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations
- WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
- Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning
llm-agent¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- A Deterministic Control Plane for LLM Coding Agents
- A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training
- A Framework for Studying AI Agent Behavior: Evidence from Consumer Choice Experiments
- A Modular Reference Architecture for MCP-Servers Enabling Agentic BIM Interaction
- A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO
- A Study on the Impact of Fault localization Granularity for Repository-Scale Code Repair Tasks
- A superpersuasive autonomous policy debating system
- A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation
- A-Mem: Agentic Memory for LLM Agents
- A2ASecBench: A Protocol-Aware Security Benchmark for Agent-to-Agent Multi-Agent Systems
- ACCORD: Action-Conditioned Contextual Grounding for Language Agents
- ACE: Pluggable Adaptive Context Elasticizer across Agents
- AI Persuasive Framing in Collective Dilemmas
- AI Virtue: What is "Good" Knowledge in the Age of Artificial Intelligence?
- AI scientists produce results without reasoning scientifically
- AI translation of literary texts is "fine", but readers still prefer human translations
- AI-Researcher: Autonomous Scientific Innovation
- AI-accelerated End-to-End Framework for Rapid Professional Upskilling
- AI4Reading: Chinese Audiobook Interpretation System Based on Multi-Agent Collaboration
- AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
- AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design
- AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
- APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning
- APeB: Benchmarking Personalization Ability of Large Language Model Agents
- ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants
- ASPIRE: Agentic /Skills Discovery for Robotics
- ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents
- Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
- Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
- Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
- Adaptive Preference Arithmetic: A Personalized Agent with Adaptive Preference Arithmetic for Dynamic Preference Modeling
- AdsMind: A Physics-Grounded Multi-Agent System for Self-Correcting Discovery of Adsorption Configurations on Heterogeneous Catalyst Surfaces
- AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance
- Agent Data Injection Attacks are Realistic Threats to AI Agents
- Agent Security Meets Regulatory Reality -- A Practitioner Systematization of Autonomous-Agent Threats and Controls in Regulated Financial Systems
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
- AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking
- AgentFairBench: Do LLM Agents Discriminate When They Act?
- AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
- AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning
- AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search
- AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models
- Agentic Generation of AST Transformation Rules for Fixing Breaking Updates
- Agentic Neural Architecture Search
- Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- Agentic Reinforced Policy Optimization
- Agentic Reinforcement Learning with Implicit Step Rewards
- Agentic Routing: The Harness-Native Data Flywheel
- Agentic Synthesis against Counterexample-Supplemented Sketches
- AgenticDataBench: A Comprehensive Benchmark for Data Agents
- AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
- Agents Explore but Agents Ignore: LLMs Lack Environmental Curiosity
- Agents in the Wild: Where Research Meets Deployment
- Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization
- Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- Aleena: Alignment Agent for Research Software Engineering Collaborations
- Among Us: A Sandbox for Measuring and Detecting Agentic Deception
- An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
- Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis
- AquaSentinel: Next-Generation AI System Integrating Sensor Networks for Urban Underground Water Pipeline Anomaly Detection via Collaborative MoE-LLM Agent Architecture
- Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent
- AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
- AstroReview: An LLM-driven Multi-Agent Framework for Telescope Proposal Peer Review and Refinement
- AtomiMed: Hierarchical Atomic Fact-Checking for Universal Clinical-Aware Medical Report Evaluation
- Atomic Task Graph: A Unified Framework for Agentic Planning and Execution
- AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
- Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
- Auditing Agent Harness Safety
- AutoData: A Multi-Agent System for Open Web Data Collection
- AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
- AutoMS: Multi-Agent Evolutionary Search for Cross-Physics Inverse Microstructure Design
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
- AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- Autoformalizing Memory Specifications with Agents
- Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection
- Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates
- Automating High Energy Physics Data Analysis with LLM-Powered Agents
- Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
- Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies
- Benchmarking Agentic Workflow Generation
- Benchmarking LLM Tool-Use in the Wild
- Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
- Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution
- Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
- BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
- Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
- Boundary-Aware Context Grounding for A Low-Channel EEG Agent
- Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems
- Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents
- Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
- CARD: Towards Conditional Design of Multi-agent Topological Structures
- CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
- CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- CPAgents: Agentic Composite Phenotype Generation for Cardiac Disease Association
- CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D
- Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
- Can Language Models Discover Scaling Laws?
- Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents
- Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks
- Causal Past Logic for Runtime Verification of Distributed LLM Agent Workflows
- Causal Reinforcement Learning based Agent-Patient Interaction with Clinical Domain Knowledge
- Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
- Characterizing Large Language Model Agentic Workflows: A Study on N8n Ecosystem
- ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
- Co-Layout: LLM-driven Co-optimization for Interior Layout
- Co-Layout: LLM-driven Co-optimization for Interior Layout
- Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization
- CoDA: Agentic Systems for Collaborative Data Visualization
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoMind: Towards Community-Driven Agents for Machine Learning Engineering
- Code Aesthetics with Agentic Reward Feedback
- Collaborative Spatial Learning with Multi-LLM Agents in Networked Social Experiments
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Content-Based Smart E-Mail Dispatcher Using Large Language Models
- Context Learning for Multi-Agent Discussion
- Control Tax: The Price of Keeping AI in Check
- Controlling Tool Use with Heading-Specific Activation Steering
- Copewell: A Multi-Agent Swarm Architecture for Equitable Mental Wellness Support
- Copy-on-Write Scoring: Application-Specific Agent Evaluations
- Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
- Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Networks
- Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- Crucible: Quantifying the Potential of Control Algorithms through LLM Agents
- Cura 1T: Specialized Model for Agentic Healthcare
- CurateEvo: Data-Curation Evolving for Agentic Post-Training
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
- DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- DatawiseAgent: A Notebook-Centric LLM Agent Framework for Adaptive and Robust Data Science Automation
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS
- DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
- Democratizing Agent Deployment Safety: A Structural Monitoring Approach
- Design and Implementation of Agentic Orchestrations and Orchestration of Agents
- Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents
- DiMA: An LLM-Powered Ride-Hailing Assistant at DiDi
- Diagnosing Task Insensitivity in Language Agents
- Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
- Distributed Attacks in Persistent-State AI Control
- Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0
- Do Large Language Models Know What They Are Capable Of?
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- Doctor-R1: Mastering Clinical Inquiry with Experiential Agentic Reinforcement Learning
- Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
- Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents
- Doomed from the Start: Early Abort of LLM Agent Episodes via a Recall-Controlled Probe Cascade
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- DreamPhase: Offline Imagination and Uncertainty-Guided Planning for Large-Language-Model Agents
- DreamProver: Evolving Transferable Lemma Libraries via a Wake-Sleep Theorem-Proving Agent
- Dual-Scale World Memory for LLM Agents towards Hard-Exploration Problems
- Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
- ETAS: An Effect-Typed Language for Agent Systems
- Eigen-Agent: Adaptive Multi-Agent Scientific Reasoning with Monitor-Based RAG
- ElephantAgent: Contextual State Continuity in Agentic Systems
- Eliciting Reasoning in Language Models with Cognitive Tools
- Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority Stratification
- Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions
- Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform
- Enabling Agents to Communicate Entirely in Latent Space
- Engineering Trustworthy Agentic AI for Critical Systems
- EnvBench: A Benchmark for Automated Environment Setup
- Environment-Grounded Automated Prompt Optimization for LLM Game Agents
- Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
- Evaluating Long-Context Reasoning in LLM-Based WebAgents
- EvoAgent: An Evolvable Agent Framework with Skill Learning and Multi-Agent Delegation
- EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair
- Executable Governance for AI: Translating Policies into Rules Using LLMs
- Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
- Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
- Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- FARS: A Fully Automated Research System Deployed at Scale
- FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction
- FlowSearcher: Synthesizing Memory-Guided Agentic Workflows for Web Information Seeking
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- From Agent Failures to Text Policies: What Works and What Breaks
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents
- From Detection to Action: Using LLM Agents for Fault-Tolerant Control
- From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
- From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
- From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review
- From Self-Check to Consensus: Bayesian Strategic Decoding in Large Language Models
- From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling
- From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
- From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
- FutureX: An Advanced Live Benchmark for LLM Agents in Future Prediction
- Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing
- GBC: Gradient-Based Connections for Optimizing Multi-Agent Systems
- GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling
- GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
- Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments
- Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software
- Graph-Based Exploration for ARC-AGI-3 Interactive Reasoning Tasks
- GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
- Group-in-Group Policy Optimization for LLM Agent Training
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HARBOR: Automated Harness Optimization
- HULAT2 at MER-TRANS 2026: Governed Multi-Agent Simplification for Spanish Easy-to-Read Generation
- Harness Engineering for LLM-Driven GPU Kernel Generation
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- HeurekaBench: A Benchmarking Framework for AI Co-scientist
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism
- How and Why Agents Can Identify Bug-Introducing Commits
- Humans Disengage, Reasoning Models Persist: Separating Difficulty Registration from Deliberation Allocation
- IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation
- INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations
- Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills
- Intelligent Human-Machine Partnership for Manufacturing: Enhancing Warehouse Planning through Simulation-Driven Knowledge Graphs and LLM Collaboration
- IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning
- Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions
- It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
- Joint Learning of Experiential Rules and Policies for Large Language Model Agents
- Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs
- Knowdit: Agentic Smart Contract Vulnerability Detection with Auditing Knowledge Summarization
- Knowledge Starts with Practice: Knowledge-Aware Exercise Generative Recommendation with Adaptive Multi-Agent Cooperation
- LLM-Driven Composite Neural Architecture Search for Multi-Source RL State Encoding
- LLM-Powered Fully Automated Chaos Engineering: Towards Enabling Anyone to Build Resilient Software Systems at Low Cost
- LLMs are Greedy Agents: Effects of RL Fine-tuning on Decision-Making Abilities
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research
- Language Modeling by Language Models
- Large language model agents accelerate inverse design of metal-organic frameworks for gas separation
- Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
- Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
- LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm
- Love First, Know Later: Persona-Based Romantic Compatibility Through LLM Text World Engines
- MAD-Logic: Multi-Agent Debate Enhances Symbolic Translation and Reasoning
- MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes
- MARTI: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference
- MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
- MLE-Smith: Scaling MLE Tasks with Automated Multi-agent Pipeline
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
- MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
- Mako: A Self-Evolving Agentic Operating System (SE-AOS) for Autonomous Web Exploitation
- ManagerBench: Evaluating the Safety-Pragmatism Trade-off in Autonomous LLMs
- Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
- Measuring Agents in Production
- Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
- Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- MedDCR: Learning to Design Agentic Workflows for Medical Coding
- MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
- MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
- MemoHarness: Agent Harnesses That Learn from Experience
- Memory Injection Attacks on LLM Agents via Query-Only Interaction
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- MemoryCD: Benchmarking Long-Context User Memory of LLM Agents for Lifelong Cross-Domain Personalization
- Meta-RL Induces Exploration in Language Agents
- Meta-RL Induces Exploration in Language Agents
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaSkill-Evolve: Recursive Self-Improvement of LLM Agents via Two-Timescale Meta-Skill Evolution
- MicroAgent: Context-Augmented Multi-Agent Framework for Automatic Microservice Decomposition
- Monte Carlo Planning with Large Language Model for Text-Based Game Agents
- MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
- MuMuTestUp: Mutation-based Multi-Agent Test Case Update
- Multi-Agent Collaboration via Evolving Orchestration
- Multi-Agent Design: Optimizing Agents with Better Prompts and Topologies
- Multi-Agent LLMs Fail to Explore Each Other
- Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
- NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications
- NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents
- OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
- One Reflection Is Not Enough: Self-Correcting Autonomous Research via Multi-Hypothesis Failure Attribution
- OpenRCA 2.0: From Outcome Labels to Causal Process Supervision
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills
- OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement
- Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
- Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading
- Out of Sight: Compression-Aware Content Protection against Agentic Crawlers
- Out of Sight: Compression-Aware Content Protection against Agentic Crawlers
- PACE: A Proxy for Agentic Capability Evaluation
- PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
- PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
- PExA: Parallel Exploration Agent for Complex Text-to-SQL
- PM-Bench: Evaluating Prospective Memory in LLM Agents
- PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval
- PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- PalmClaw: A Native On-Device Agent Framework for Mobile Phones
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning
- Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems
- PersonaAgent: Bridging Memory and Action for Personalized LLM Agents
- Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
- Personalized Attacks of Social Engineering in Multi-turn Conversations: LLM Agents for Simulation and Detection
- PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
- Please Don't Kill My Vibe: Empowering Agents with Data Flow Control
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
- PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction For Continual Learning
- ProBench: Benchmarking GUI Agents with Accurate Process Information
- ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
- Pushing Test-Time Scaling Limits of Deep Search with Asymmetric Verification
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
- RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents
- Radical AI Interpretability
- ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- RecGPT-V3 Technical Report
- Recursive Harness Self-Improvement
- Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents
- ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing
- Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
- Reliable Weak-to-Strong Monitoring of LLM Agents
- Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
- Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
- Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory
- Rethinking the Evaluation of Harness Evolution for Agents
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning
- Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
- Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making
- RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems
- RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets
- SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human Intervention
- SOLID: a Framework of Synergizing Optimization and LLMs for Intelligent Decision-Making
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- SR-Scientist: Scientific Equation Discovery With Agentic AI
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
- STARK: Strategic Team of Agents for Refining Kernels
- SWE-Pruner Pro: The Coder LLM Already Knows What to Prune
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do
- Scalable LLM Agent Tool Access in the Cloud
- Scaling Agent Learning via Experience Synthesis
- Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents
- Scaling Generalist Data-Analytic Agents
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- Scoped Verification for Reliable Long-Horizon Agentic Context Evolution under Distribution Shift
- Searching for Privacy Risks in LLM Agents via Simulation
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity
- Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity
- Self-Generated In-Context Examples Improve LLM Agents for Sequential Decision-Making Tasks
- Self-Improvements in Modern Agentic Systems: A Survey
- Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
- Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
- Semantic Early-Stopping for Iterative LLM Agent Loops
- Set-shifting Behavioral Test for Harnessed Agents
- Set-shifting Behavioral Test for Harnessed Agents
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
- ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP
- ShinkaEvolve: Towards Open-Ended and Sample-Efficient Program Evolution
- Shoot First, Ask Questions Later? Building Rational Agents that Explore and Act Like People
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents
- SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories
- SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use
- SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents
- SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
- SkillFuzz: Fuzzing Skill Composition for Implicit Intents Discovery in Open Skill Marketplaces
- SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe
- SkillReducer: Optimizing LLM Agent Skills for Token Efficiency
- SkillSight: Seeing Through Shared Descriptions for Accurate Skill Retrieval
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- Social Agents: Collective Intelligence Improves LLM Predictions
- Socratic agents for autonomous scientific discovery in high-dimensional physical systems
- Software Supply Chains are Dead: Use-Case-Oriented Regeneration
- Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents
- Sophia: A Persistent Agent Framework of Artificial Life
- Spatio-Temporal Graphs Beyond Grids: Benchmark for Maritime Anomaly Detection
- Speculate with Memory: Lossless Acceleration for LLM Agents
- Speculative Actions: A Lossless Framework for Faster AI Agents
- Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations
- SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows
- Stochastic Self-Organization in Multi-Agent Systems
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters
- StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows
- Supra Cognitive Modes: A Routed Architecture for Agent Memory
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- TAI3: Testing Agent Integrity in Interpreting User Intent
- TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories
- TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
- TTHE: Test-Time Harness Evolution
- TTHE: Test-Time Harness Evolution
- TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
- TeachMaster: Generative Teaching via Code
- Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care
- Test-Time Adaptation for LLM Agents via Environment Interaction
- TestEvo-Bench: An Executable and Live Benchmark for Test and Code Co-Evolution
- The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
- The Complexity Trap: Simple Observation Masking Is as Efficient as LLM Summarization for Agent Context Management
- The Dynamic Verifiable Multi-Agent Human Agentic Loyalty Loop (DVM-HALL) Model and the Net Human-Agent Score (NHAS) in Autonomous Commerce
- The Energy Society: A Simulation Environment for Studying Agent Cooperation under Survival Pressure
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation
- The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement
- The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development
- The Story Shapes the Agent: Narrative Priors in LLM Behavior
- The Surface You Test Is Not the Surface That Breaks
- Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action
- Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-Making
- Thought Communication in Multiagent Collaboration
- ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
- Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents
- ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
- ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
- ToolRL: Reward is All Tool Learning Needs
- ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning
- ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
- Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval
- Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents
- Toward Efficient Exploration by Large Language Model Agents
- Towards Automating Scientific Review with Google's Paper Assistant Tool
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation
- Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance
- Towards an Agentic Workflow for Internet Measurement Research
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- Tree Search for LLM Agent Reinforcement Learning
- TusoAI: Agentic Optimization for Scientific Methods
- TwinMarket: A Scalable Behavioral and Social Simulation for Financial Markets
- UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
- UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction as Reasoning
- Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports
- Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- ValuePilot: A Two-Phase Framework for Value-Driven Decision-Making
- VeriAct: Beyond Verifiability -- Agentic Synthesis of Correct and Complete Formal Specifications
- Verifiable Self-Evolution for Open-Ended Dialogue Skills via Future-Feedback Prediction
- Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors
- Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents
- VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
- What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty
- When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems
- When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games
- When Agents “Misremember” Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
- When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
- When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems
- When Do Multi-Agent Systems Help? An Information Bottleneck Perspective
- When Does Continual Learning Require Learning
- When Does Muon Help Agentic Reinforcement Learning?
- When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
- When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
- When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
- When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search
- When the Tool Decides: LLM Agents Defer Blindly to Graph Neural Network Tools, and Stronger Backbones Defer More
- Where Did It Go Wrong? Capability-Oriented Failure Attribution for Vision-and-Language Navigation Agents
- Where Do CoT Training Gains Land in LLM based Agents?
- Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents
- Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems
- Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows
- Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference
- scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology
llm-evaluation¶
- AGC-Bench: Measuring Artificial General Creativity
- AI Hiring with LLMs: A Context-Aware and Explainable Multi-Agent Framework for Resume Screening
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- AgentAbstain: Do LLM Agents Know When Not to Act?
- Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
- Are Large Language Models Sensitive to the Motives Behind Communication?
- AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation
- Automated Benchmark Auditing for AI Agents and Large Language Models
- BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation via Lens of Dynamic Interactions
- BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
- Can We Trust Item Response Theory for AI Evaluation?
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
- Data Analysis in the Wild: Benchmarking Large Language Models Against Real-World Data Complexities
- Dropouts in Confidence: Moral Uncertainty in Human-LLM Alignment
- DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
- Emergent Risk Awareness in Rational Agents under Resource Constraints
- Evaluating LLMs in Open-Source Games
- Evaluating LLMs in Open-Source Games
- EvoClaw: Evaluating AI Agents on Continuous Software Evolution
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
- FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents
- From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
- Hypothesis Testing for Generalized Thurstone Models
- Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- LLM Strategic Reasoning: Agentic Study through Behavioral Game Theory
- LaoBench: A Large-Scale Multidimensional Lao Benchmark for Large Language Models
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- Multi-Agent Collaborative Framework For Math Problem Generation
- MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning
- Natural Language Access to Domain-Specific Metadata: A Reusable Framework for LLM Query Generation
- Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents
- PublicAgent: Multi-Agent Design Principles From an LLM-Based Open Data Analysis Framework
- RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- Rethinking Code Performance Benchmarks for LLMs
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
- SciNav: A General Agent Framework for Scientific Coding Tasks
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- Social Agents: Collective Intelligence Improves LLM Predictions
- SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
- Structured Output Collapses Answer Diversity Across 44 Language Models
- Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- The Matthew Effect of AI Programming Assistants: A Hidden Bias in Software Evolution
- The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
- Theory-Scale Auto-Formalization of Logics for Computer Science
- Towards Scalable Oversight via Partitioned Human Supervision
- USTBench: Benchmarking and Dissecting Spatiotemporal Reasoning Capabilities of LLMs as Urban Agents
- Vision-Language Assistant for Emotional Reactions to Risky Driving
- WOLF: Werewolf-based Observations for LLM Deception and Falsehoods
- WebDS: An End-to-End Benchmark for Web-based Data Science
- What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
llm-orchestration¶
- A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems
- A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation
- AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and Large Language Models
- AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis
- ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
- ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
- Adaptive Multi-Agent Response Refinement in Conversational Systems
- AdvisingWise: Supporting Academic Advising in Higher Education Settings Through a Human-in-the-Loop Multi-Agent Framework
- AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems
- Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases
- AgentSPEX: An Agent SPecification and EXecution Language
- AgentSUMO: An Agentic Framework for Interactive Simulation Scenario Generation in SUMO via Large Language Models
- AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization
- Agint: Agentic Graph Compilation for Software Engineering Agents
- All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models
- An Agentic AI Framework for Training General Practitioner Student Skills
- An Empirical Study of Agent Developer Practices in AI Agent Frameworks
- AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
- Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
- Automated Design Optimization via Strategic Search with Large Language Models
- Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
- BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding
- CoDA: Agentic Systems for Collaborative Data Visualization
- Collective Intelligence with Foundation Models
- ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
- Context Graphs for Proactive Enterprise Agents
- Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
- Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification
- Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
- Discourse Graph Guided Document Translation with Large Language Models
- Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning
- FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
- Factor(U,T): Controlling Untrusted AI by Monitoring their Plans
- Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives
- Flow: Modularized Agentic Workflow Automation
- From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer
- Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing
- Investigating Multi-Agent Deliberation in Law
- KPI2KVI: A Multi Agent Workflow for Calculating Key Value Indicators from Service Descriptions
- KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
- LLM-as-Code Agentic Programming for Agent Harness
- Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- Learning to Orchestrate Agents in Natural Language with the Conductor
- LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
- MAS$^2$: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems
- MediHive: A Decentralized Agent Collective for Medical Reasoning
- Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- Modeling Layered Consciousness with Multi-Agent Large Language Models
- Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization
- Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections
- Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework
- Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases
- S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
- SimMOF: AI agent for Automated MOF Simulations
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Steering Large Language Models between Code Execution and Textual Reasoning
- Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning
- Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
- Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
- TraceDev: A Traceability-Driven Multi-agent Framework for Requirement-to-Code Development
- Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization
- Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
- VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
- Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
lora¶
- A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation
- Accelerating Language Model Workflows with Prompt Choreography
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering
- CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering
- Compress & Cache: Vision token compression for efficient generation and retrieval
- Cura 1T: Specialized Model for Agentic Healthcare
- Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
- DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
- Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives
- HMVLM:Human Motion-Vision-Language Model via MoE LoRA
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
- Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
- ICaRus: Identical Cache Reuse for Efficient Multi-Model Inference
- KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
- KeepLoRA: Continual Learning with Residual Gradient Adaptation
- Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
- LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension
- LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
- LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
- Large (Vision) Language Models are Unsupervised In-Context Learners
- Learning Robust Vision-Language Models from Natural Latent Spaces
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration
- MFM-DA: Instance-Aware Adaptor and Hierarchical Alignment for Efficient Domain Adaptation in Medical Foundation Models
- Med-LEGO: Editing and Adapting toward Generalist Medical Image Diagnosis
- MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
- MedForge: Building Medical Foundation Models Like Open Source Software Development
- MemEIC: A Step Toward Continual and Compositional Knowledge Editing
- Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents
- Memory-Integrated Reconfigurable Adapters: A Unified Framework for Settings with Multiple Tasks
- MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
- Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach
- Modeling Layered Consciousness with Multi-Agent Large Language Models
- MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
- Multi-modal Rail Crossing Safety Analysis
- Omni-Mol: Multitask Molecular Model for Any-to-any Modalities
- On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
- OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
- Specializing Foundation Models via Mixture of Low-Rank Experts for Comprehensive Head CT Analysis
- StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation
- TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction
- Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies
- Towards All-in-One Medical Image Re-Identification
- Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports
- UNICON: UNIfied CONtinual Learning for Medical Foundational Models
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
- Vision Function Layer in Multimodal LLMs
mcp¶
- A Modular Reference Architecture for MCP-Servers Enabling Agentic BIM Interaction
- A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
- A Process Harness for Uplifting Legacy Workflows to Agentic BPM: Design and Realization in CUGA FLO
- AVDA: Autonomous Vibe Detection Authoring for Cybersecurity
- AgentAbstain: Do LLM Agents Know When Not to Act?
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
- Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
- Autoformalization of Agent Instructions into Policy-as-Code
- Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services
- CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?
- ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
- ContextNest: Verifiable Context Governance for Autonomous AI Agent
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents
- ElephantAgent: Contextual State Continuity in Agentic Systems
- From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer
- From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure
- Heterogeneous Scientific Foundation Model Collaboration
- HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization
- Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
- InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
- LAMP: Lean-based Agentic framework with MCP and Proof Repair
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
- MedPAO: A Protocol-Driven Agent for Structuring Medical Reports
- Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research
- MobileWorld: Benchmarking Autonomous Mobile Agents in Agent-User Interactive and MCP-Augmented Environments
- Monadic Context Engineering
- Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation
- Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games
- Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
- Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading
- PoCo: Agentic Proof-of-Concept Exploit Generation for Smart Contracts
- QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
- RocketSmith: Agentic Additive Manufacturing of High-Powered Rockets
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
- Scalable LLM Agent Tool Access in the Cloud
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP
- Speculative Actions: A Lossless Framework for Faster AI Agents
- Tactile: Giving Computer-Using Agents Hands and Feet
- The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities
- The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities
- Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases
- TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
- Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows
- ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- TrafficSimAgent: A Hierarchical Agent Framework for Autonomous Traffic Simulation with MCP Control
- Trusted AI Agents in the Cloud
- Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations
- VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
- VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
- Workflows vs Agents for Code Translation
- Workflows vs Agents for Code Translation
mechanistic-interpretability¶
- A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
- Among Us: A Sandbox for Measuring and Detecting Agentic Deception
- Controlling Tool Use with Heading-Specific Activation Steering
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit
- From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
- From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
- From ``Sure" to ``Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons
- Head Pursuit: Probing Attention Specialization in Multimodal Transformers
- How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
- Inducing Dyslexia in Vision Language Models
- Interpretability Transfer from Language to Vision via Sparse Autoencoders
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- Language Models Can Explain Visual Features via Steering
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- Localizing RL-Induced Tool Use to a Single Crosscoder Feature
- Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
- Mechanistic Attention Guidance for Agent Memory Refinement
- Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History
- Radical AI Interpretability
- Reward Valuation in Vision Language Models: Causal Mechanisms Underlying Anhedonia
- Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders
- Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
- Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs
- Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
- Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning
- Structural Graph Probing of Vision-Language Models
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- Test-Time Training for Modality Order Consistency in Vision-Language Models
- The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs
- The Horcrux: Mechanistically Interpretable Task Decomposition for Detecting and Mitigating Reward Hacking in Embodied AI Systems
- The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
- The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages
- To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- Understanding and Rectifying Safety Perception Distortion in VLMs
- Unveiling the Visual Counting Bottleneck in Vision-Language Models
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- Vision Function Layer in Multimodal LLMs
- Vision Transformers Don't Need Trained Registers
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models
- What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
- When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities
medical-imaging¶
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
- A Hierarchical Benchmark of Foundation Models for Dermatology
- A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology
- Agglomerating Large Vision Encoders via Distillation for VFSS Segmentation
- An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing
- Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
- Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- Benchmarking CXR Foundation Models With Publicly Available MIMIC-CXR and NIH-CXR14 Datasets
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
- Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
- Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies
- Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs
- Deep Reprogramming Distillation for Medical Foundation Models
- Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language
- Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty
- Diffusion-empowered AutoPrompt MedSAM
- Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- EWC-Guided Diffusion Replay for Exemplar-Free Continual Learning in Medical Imaging
- EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT
- EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
- FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging
- FMIR, a foundation model-based Image Registration Framework for Robust Image Registration
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
- Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
- Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation
- Free Lunch in Medical Image Foundation Model Pre-training via Randomized Synthesis and Disentanglement
- From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging
- From Specialist to Generalist: Unlocking SAM's Learning Potential on Unlabeled Medical Images
- Generative Artificial Intelligence in Medical Imaging: Foundations, Progress, and Clinical Translation
- HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition
- INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
- Jolia: Concept-Level Vision-Language Alignment for 3D CT Contrastive Learning
- Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis
- M-IDoL: Information Decomposition for Modality-Specific and Diverse Representation Learning in Medical Foundation Model
- MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI
- Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach
- MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation
- Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors
- Multimodal, Multi-Disease Medical Imaging Foundation Model (MerMED-FM)
- OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
- OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models
- PEFT-MedSAM: Efficient Fine-Tuning of Medical Foundation Models for Explainable Skin Lesion Segmentation
- Physically-Grounded Manifold Projection Model for Generalizable Metal Artifact Reduction in Dental CBCT
- Project Imaging-X: A Survey of 1000+ Open-Access Medical Imaging Datasets for Foundation Model Development
- Quantum Kernel Advantage over Classical Collapse in Medical Foundation Model Embeddings
- RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
- Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification
- Revisiting 2D Foundation Models for Scalable 3D Medical Image Classification
- Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology
- Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy
- Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models
- TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models
- Temporal Inversion for Learning Interval Change in Chest X-Rays
- TopoAgent: An Agentic Framework for Automated Topology Learning in Medical Imaging
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports
- Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports
- TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- UNICON: UNIfied CONtinual Learning for Medical Foundational Models
- When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?
meta-harness¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- (Over)Reliance on Test Agents in AI-Assisted Software Testing
- A Formal Hierarchical Architecture for Agentic Orchestration with Stack-Based Execution and Lazy Discovery
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- A Security Analysis of the OpenClaw AI Agent Framework
- A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols
- A Self-Evolving Framework for Efficient Terminal Agents via Observational Context Compression
- A Task-Driven and Quality-Assured Agent Framework for SAR Data Generation
- ACCORD: Action-Conditioned Contextual Grounding for Language Agents
- ACE: Pluggable Adaptive Context Elasticizer across Agents
- AFlow: Automating Agentic Workflow Generation
- AI scientists produce results without reasoning scientifically
- AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis
- AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
- ASI-Evolve: AI Accelerates AI
- ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
- ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
- AdaExplore: Failure-Driven Adaptation and Diversity-Preserving Search for Efficient Kernel Generation
- Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
- Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance
- AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems
- Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
- Agent WARPP: Workflow Adherence via Runtime Parallel Personalization
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows
- AgentSPEX: An Agent SPecification and EXecution Language
- AgentSUMO: An Agentic Framework for Interactive Simulation Scenario Generation in SUMO via Large Language Models
- AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search
- Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
- Agentic Discovery of Non-Canonical Antimicrobial Peptides with AMPGAN v3
- Agentic Hardware Design as Repository-Level Code Evolution
- Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
- AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
- Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization
- Agint: Agentic Graph Compilation for Software Engineering Agents
- AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally
- An Artifact-based Agent Framework for Adaptive and Reproducible Medical Image Processing
- AutoB2G: A Large Language Model-Driven Agentic Framework For Automated Building-Grid Co-Simulation
- AutoQual: An LLM Agent for Automated Discovery of Interpretable Features for Review Quality Assessment
- AutoRAS: Learning Robust Agentic Systems with Primitive Representations
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- Automated Benchmark Auditing for AI Agents and Large Language Models
- Automated Design Optimization via Strategic Search with Large Language Models
- Autonomous Agent-Orchestrated Digital Twins (AADT): Leveraging the OpenClaw Framework for State Synchronization in Rare Genetic Disorders
- BRIDGE: Bootstrapping Text to Control Time-Series Generation via Multi-Agent Iterative Optimization and Diffusion Modeling
- Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
- Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
- Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics
- Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations
- BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge
- Building Agent Harnesses for Scientific Curation from Multimodal Sources
- Building Persona-Based Agents On Demand: Tailoring Multi-Agent Workflows to User Needs
- CAMO: An Agentic Framework for Automated Causal Discovery from Micro Behaviors to Macro Emergence in LLM Agent Simulations
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
- CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness
- CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows
- ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
- Co-Director: Agentic Generative Video Storytelling
- Co-Evolving Agents: Learning from Failures as Hard Negatives
- Co-evolving Agent Architectures and Interpretable Reasoning for Automated Optimization
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- Code as Agent Harness
- ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification
- Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems
- CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly
- Dementia-Agents: A Multi-Modal Multi-Agent System for Dementia Staging and Phenotyping
- DemoEvolve: Overcoming Sparse Feedback in Agentic Harness Evolution with Demonstrations
- Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
- Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations
- DreamProver: Evolving Transferable Lemma Libraries via a Wake-Sleep Theorem-Proving Agent
- Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems
- ELITE: Experiential Learning and Intent-Aware Transfer for Self-improving Embodied Agents
- Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
- EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
- EnCompass: Enhancing Agent Programming with Search Over Program Execution Paths
- Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
- Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents
- Environment-Grounded Automated Prompt Optimization for LLM Game Agents
- Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
- EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
- EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution
- Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
- Experience Graphs: The Data Foundation for Self-Improving Agents
- Falsifiable Release Gates for Self-Improving Systems
- FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness
- Flow: Modularized Agentic Workflow Automation
- FlowSearcher: Synthesizing Memory-Guided Agentic Workflows for Web Information Seeking
- Formalizing Mathematics at Scale
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling
- From Task-Guided Conversational Graphs to Goal-Oriented Dialogue Runtimes
- From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GS-Agent: Creating 4D Physical Worlds With Generative Simulation
- Generative Caching for Structurally Similar Prompts and Responses
- Glite ARF: Verifier-Driven Research with Parallel LLM Coding Agents
- Governed Evolution of Agent Runtimes through Executable Operational Cognition
- GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- Harmonizing Real-Time Constraints and Long-Horizon Reasoning: An Asynchronous Agentic Framework for Dynamic Scheduling
- Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
- Heterogeneous Scientific Foundation Model Collaboration
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
- Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing
- IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai
- IPO Finance Agent: Evaluation of LLM Financial Analysts beyond Finance Agent v2, with Automated Rubric Generation -- the Case of the SpaceX (SPCX) IPO
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence
- Just A Rather Very Intelligent Spoken Agent
- KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant
- KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition
- Know Your Intent: An Autonomous Multi-Perspective LLM Agent Framework for DeFi User Transaction Intent Mining
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- Knowledge-Centric Agents for Workflow Generation
- LAMP: Lean-based Agentic framework with MCP and Proof Repair
- LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
- LLM Agents Making Agent Tools
- LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework
- Learning to Construct Practical Agentic Systems
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- Let It Flow: Agentic Crafting on Rock and Roll, Building the ROME Model within an Open Agentic Learning Ecosystem
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
- Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
- LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
- MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- MedDCR: Learning to Design Agentic Workflows for Medical Coding
- Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- MemoHarness: Agent Harnesses That Learn from Experience
- Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- MicroAgent: Context-Augmented Multi-Agent Framework for Automatic Microservice Decomposition
- Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research
- Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture
- Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
- NVAITC AI Scientist: A Governed End-to-End Research System -- A Hypertension GWAS Case Study
- NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation
- Natural-Language Agent Harnesses
- Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
- OpenSkillEval: Automatically Auditing the Open Skill Ecosystem for LLM Agents
- Orchard: An Open-Source Agentic Modeling Framework
- PAACE: A Plan-Aware Automated Agent Context Engineering Framework
- PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits
- PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis
- PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
- Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems
- PerfGuard: A Performance-Aware Agent for Visual Content Generation
- Phantom Guardrails: When Self-Improving Agent Harnesses Fix Failures That Never Happened
- PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
- PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation
- Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- Read the Paper, Write the Code: Agentic Reproduction of Social-Science Results
- Retrospex: Language Agent Meets Offline Reinforcement Learning Critic
- Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases
- SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- SEAGym: An Evaluation Environment for Self-Evolving LLM Agents
- SEVerA: Verified Synthesis of Self-Evolving Agents
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices
- SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
- Scaling Laws for Agent Harnesses via Effective Feedback Compute
- SciNav: A General Agent Framework for Scientific Coding Tasks
- SeaEvo: Advancing Algorithm Discovery with Strategy Space Evolution
- Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study
- Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
- Self-Healing Agentic Orchestrators for Reliable Tool-Augmented Large Language Model Systems
- Simple Agents Outperform Experts in Biomedical Imaging Workflow Optimization
- SkillEvolBench: Benchmarking the Evolution from Episodic Experience to Procedural Skills
- Social Agents: Collective Intelligence Improves LLM Predictions
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- Sophia: A Persistent Agent Framework of Artificial Life
- SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis
- Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
- Steering Large Language Models between Code Execution and Textual Reasoning
- Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting
- Stop Means Stop: Measuring and Repairing the Enforcement Gap in Agent-Framework Control Primitives
- Survey on Evaluation of LLM-based Agents
- TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization
- Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
- The Agent Capability Problem: Predicting Solvability Through Information-Theoretic Bounds
- Think Twice Before You Act: Enhancing Agent Behavioral Safety with Thought Correction
- TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
- TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Verified Multi-Agent Orchestration: A Plan-Execute-Verify-Replan Framework for Complex Query Resolution
- VideoAgent: All-in-One Framework for Video Understanding and Editing
- WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
- Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
- What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity
- WhatsCode: Large-Scale GenAI Deployment for Developer Efficiency at WhatsApp
- When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
- Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
mllm¶
- A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
- Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
- Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble
- Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning
- Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- FOCUS: Efficient Keyframe Selection for Long Video Understanding
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
- MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection
- Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
- NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables
- OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation
- Perception Encoder: The best visual embeddings are not at the output of the network
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
- Revealing Multimodal Causality with Large Language Models
- SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
- Scaling Synthetic Task Generation for Agents via Exploration
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
- UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
- Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
- VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- Vision Function Layer in Multimodal LLMs
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
multi-agent¶
- $A^2Flow:$ Automating Agentic Workflow Generation via Self-Adaptive Abstraction Operators
- 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation
- 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Computable Game-Theoretic Framework for Multi-Agent Theory of Mind
- A Declarative Language for Building And Orchestrating LLM-Powered Agent Workflows
- A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows
- A Formal Hierarchical Architecture for Agentic Orchestration with Stack-Based Execution and Lazy Discovery
- A Knowledge-Based Multi-Agent Framework for Security Control Recommendation
- A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems
- A Multi-Agent Framework for Mitigating Dialect Biases in Privacy Policy Question-Answering Systems
- A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
- A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
- A Near-optimal, Scalable and Parallelizable Framework for Stochastic Bandits Robust to Adversarial Corruptions and Beyond
- A Policy-Driven Runtime Layer for Agentic LLM Serving
- A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
- A Principle of Targeted Intervention for Multi-Agent Reinforcement Learning
- A Safety and Security Framework for Real-World Agentic Systems
- A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols
- A Stepwise Questioning Expert-Editor Multi-Agent Framework for Long-Document Summarization
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
- A superpersuasive autonomous policy debating system
- A superpersuasive autonomous policy debating system
- A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation
- ACC-Collab: An Actor-Critic Approach to Multi-Agent LLM Collaboration
- AFlow: Automating Agentic Workflow Generation
- AI Hiring with LLMs: A Context-Aware and Explainable Multi-Agent Framework for Resume Screening
- AI Research Agents Narrow Scientific Exploration
- AI Urban Scientist: Multi-Agent Collaborative Automation for Urban Research
- AI Virtue: What is "Good" Knowledge in the Age of Artificial Intelligence?
- AI translation of literary texts is "fine", but readers still prefer human translations
- AI-Researcher: Autonomous Scientific Innovation
- AI-Supervisor: Autonomous AI Research Supervision via a Persistent Research World Model
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- AI-for-Science Low-code Platform with Bayesian Adversarial Multi-Agent Framework
- AI4Reading: Chinese Audiobook Interpretation System Based on Multi-Agent Collaboration
- AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis
- AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
- ANet Patu-1: The Value of Connection in the Agent Network
- APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page Design
- APWA: A Distributed Architecture for Parallelizable Agentic Workflows
- ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning
- ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
- ASMR: Agentic Schema Generation for Ship Maintenance Report Writing
- ASPIRE: Agentic /Skills Discovery for Robotics
- ATHENA: Agentic Team for Hierarchical Evolutionary Numerical Algorithms
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- AUTOGATE: Automated Clock Gating via Toggling-Aware LLM-based RTL Rewriting
- Accelerating Language Model Workflows with Prompt Choreography
- AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration
- Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- Adaptive GPU Resource Allocation for Multi-Agent Collaborative Reasoning in Serverless Environments
- Adaptive Multi-Agent Response Refinement in Conversational Systems
- Adaptive Multi-Agent Response Refinement in Conversational Systems
- Adaptive Multimodal Agents-Based Framework for Automatic Workflow Execution
- Adaptively Coordinating with Novel Partners via Learned Latent Strategies
- Addressing Situated Teaching Needs: A Multi-Agent Framework for Automated Slide Adaptation
- AdsMind: A Physics-Grounded Multi-Agent System for Self-Correcting Discovery of Adsorption Configurations on Heterogeneous Catalyst Surfaces
- AdvisingWise: Supporting Academic Advising in Higher Education Settings Through a Human-in-the-Loop Multi-Agent Framework
- AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems
- Agent Name Service (ANS): A Proof-of-Concept Trust Layer for Secure AI Agent Discovery, Identity, and Governance in Kubernetes
- Agent WARPP: Workflow Adherence via Runtime Parallel Personalization
- Agent-Based Modular Learning for Multimodal Emotion Recognition in Human-Agent Systems
- Agent-Native Immune System: Architecture, Taxonomy, and Engineering
- Agent-SAMA: State-Aware Mobile Assistant
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows
- AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agents
- AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets
- AgentFairBench: Do LLM Agents Discriminate When They Act?
- AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs
- AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
- AgentODRL: A Large Language Model-based Multi-agent System for ODRL Generation
- AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning
- AgentTrace: Causal Graph Tracing for Root Cause Analysis in Deployed Multi-Agent Systems
- AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems
- Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
- Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
- Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications
- Agentic Data Environments
- Agentic Discovery of Non-Canonical Antimicrobial Peptides with AMPGAN v3
- Agentic Frameworks for Reasoning Tasks: An Empirical Study
- Agentic Neural Architecture Search
- Agentic Persona Control and Task State Tracking for Realistic User Simulation in Interactive Scenarios
- Agentic Persona Control and Task State Tracking for Realistic User Simulation in Interactive Scenarios
- Agentic SABRE: An Uncertainty-Aware Neuro-Symbolic Multi-Agent Framework for Adaptive Ransomware Detection
- Agentic Time Machine as an Infrastructure for Future-Event Forecasting
- Agentic generation of verifiable rules for deterministic, self-expanding reaction classification
- Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents
- AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
- AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization
- AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization
- AgenticTCAD: A LLM-based Multi-Agent Framework for Automated TCAD Code Generation and Device Optimization
- Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response
- Agents Robust to Distribution Shifts Learn Causal World Models Even Under Mediation
- Agents in the Wild: Where Research Meets Deployment
- Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization
- Agint: Agentic Graph Compilation for Software Engineering Agents
- Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents
- AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally
- All Explanations are Wrong, But Many Are Useful: Exploring the Rashomon Explanation Set with Large Language Models
- Among Us: A Sandbox for Measuring and Detecting Agentic Deception
- An Agentic AI Framework for Training General Practitioner Student Skills
- An Agentic AI Framework to Accelerate Scientific Discovery in Plant Phenotyping
- An Agentic Framework with LLMs for Solving Complex Vehicle Routing Problems
- An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment
- An Empirical Study of Agent Developer Practices in AI Agent Frameworks
- An Exploration of Agentic Information Fusion for Test Maintenance Prediction
- An Information Theoretic Perspective on Agentic System Design
- An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework
- AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
- AnalogAgent: Self-Improving Analog Circuit Design Automation with LLM Agents
- Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis
- Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis
- AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- Architectural Design Decisions in AI Agent Harnesses
- Articulating Assumptions in AI-Generated Scientific Analyses through Task Decomposition
- Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents
- Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- AstroReview: An LLM-driven Multi-Agent Framework for Telescope Proposal Peer Review and Refinement
- AsymPuzl: An Asymmetric Puzzle for multi-agent cooperation
- AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
- Auditing Agent Harness Safety
- Auto-TA: Towards Scalable Automated Thematic Analysis (TA) via Multi-Agent Large Language Models with Reinforcement Learning
- AutoB2G: A Large Language Model-Driven Agentic Framework For Automated Building-Grid Co-Simulation
- AutoData: A Multi-Agent System for Open Web Data Collection
- AutoFSM: A Multi-agent Framework for FSM Code Generation with IR and SystemC-Based Testing
- AutoMS: Multi-Agent Evolutionary Search for Cross-Physics Inverse Microstructure Design
- AutoPass: Evidence-Guided LLM Agents for Compiler Performance Tuning
- AutoPersonas: A Multi-Timescale Loop Engine for Open-Ended Persona Evolution
- AutoRAS: Learning Robust Agentic Systems with Primitive Representations
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage
- AutoSynthesis: An agentic system for automated meta-analysis
- Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection
- Automated Design Optimization via Strategic Search with Large Language Models
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
- Automated Multi-Agent Workflows for RTL Design
- Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates
- Automating High Energy Physics Data Analysis with LLM-Powered Agents
- Automating the Design of Embodied AgentArchitectures
- Autonomous Event-Driven Multi-Agent Orchestration for Enterprise AI at Scale
- Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance
- BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- BIMgent: Towards Autonomous Building Modeling via Computer-use Agents
- BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
- BOHM: Zero-Cost Hierarchical Attribution for Compound AI Systems
- BRIDGE: Bootstrapping Text to Control Time-Series Generation via Multi-Agent Iterative Optimization and Diffusion Modeling
- BabelCoder: Agentic Code Translation with Specification Alignment
- BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
- Bayesian Ego-graph Inference for Networked Multi-Agent Reinforcement Learning
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- Belief-Calibrated Multi-Agent Consensus Seeking for Complex NLP Tasks
- Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
- Benefits and Limitations of Communication in Multi-Agent Reasoning
- Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering
- Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
- Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
- Beyond the Library: An Agentic Framework for Autoformalizing Research Mathematics
- Bi-Level Knowledge Transfer for Multi-Task Multi-Agent Reinforcement Learning
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
- BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge
- BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding
- BrainPilot: Automating Brain Discovery with Agentic Research
- BrainPilot: Automating Brain Discovery with Agentic Research
- Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
- Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- Bridging Talk and Thought: Understanding Dialogue Dynamics Across Collaborative Problem-Solving Contexts
- Building Persona-Based Agents On Demand: Tailoring Multi-Agent Workflows to User Needs
- Building from Scratch: A Multi-Agent Framework with Human-in-the-Loop for Multilingual Legal Terminology Mapping
- CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
- CAML: Collaborative Auxiliary Modality Learning for Multi-Agent Systems
- CAMO: An Agentic Framework for Automated Causal Discovery from Micro Behaviors to Macro Emergence in LLM Agent Simulations
- CARD: Towards Conditional Design of Multi-agent Topological Structures
- CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving
- CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
- CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science
- CHORUS: An Agentic Framework for Generating Realistic Deliberation Data
- CLAIM: An Intent-Driven Multi-Agent Framework for Analyzing Manipulation in Courtroom Dialogues
- CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- CREA: A Collaborative Multi-Agent Framework for Creative Image Editing and Generation
- CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market
- CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness
- Can LLM Agents Sustain Long-Horizon Organizational Dynamics?
- Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content
- Can We Steer the Black-Box? Towards Controllability-Centric Evaluation of Recommender Systems with Collaborative Agents
- Causal Past Logic for Runtime Verification of Distributed LLM Agent Workflows
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
- ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
- Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization
- ChipCraftBrain: Validation-First RTL Generation via Multi-Agent Orchestration
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- ClawNet: Human-Symbiotic Agent Network for Cross-User Autonomous Cooperation
- ClinNoteAgents: An LLM Multi-Agent System for Predicting and Interpreting Heart Failure 30-Day Readmission from Clinical Notes
- ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- Clover: A Neural-Symbolic Agentic Harness with Stochastic Tree-of-Thoughts for Verified RTL Repair
- Co-Director: Agentic Generative Video Storytelling
- Co-Evolving Agents: Learning from Failures as Hard Negatives
- Co-Layout: LLM-driven Co-optimization for Interior Layout
- Co-Layout: LLM-driven Co-optimization for Interior Layout
- CoAct-1: Computer-using Multi-agent System with Coding Actions
- CoDA: Agentic Systems for Collaborative Data Visualization
- CoDA: Agentic Systems for Collaborative Data Visualization
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- CoMind: Towards Community-Driven Agents for Machine Learning Engineering
- Code Aesthetics with Agentic Reward Feedback
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- Code as Agent Harness
- CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
- Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation
- Coherent Multi-Agent Trajectory Forecasting in Team Sports with CausalTraj
- Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents
- Collaborative Reasoner: Self-Improving Social Agents with Synthetic Conversations
- Collaborative Spatial Learning with Multi-LLM Agents in Networked Social Experiments
- Collective Intelligence with Foundation Models
- ComaDICE: Offline Cooperative Multi-Agent Reinforcement Learning with Stationary Distribution Shift Regularization
- ComfyUI-Copilot: An Intelligent Assistant for Automated Workflow Development
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Complete Cyclic Subtask Graphs for Tool-Using LLM Agents: Flexibility, Cost, and Bottlenecks in Multi-Agent Workflows
- Composing Verifiable Conceptual Models via Building Blocks: Towards Design-Time Verification of Agentic AI Workflows
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- Conditional Diffusion Model for Multi-Agent Dynamic Task Decomposition
- Constraint-Guided Multi-Agent Decompilation for Executable Binary Recovery
- Context Learning for Multi-Agent Discussion
- Continuous Soft Actor-Critic: An Off-Policy Learning Method Robust to Time Discretization
- Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment
- Cooperative Bargaining Games Without Utilities: Mediated Solutions from Direction Oracles
- Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1
- Cost-Effective Agent Harnesses for Abstract Reasoning and Generalization on ARC-AGI-1
- Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification
- Crafter: A Multi-Agent Harness for Editable Scientific Figure Generation from Diverse Inputs
- Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing
- Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision
- Criticality-Based Guard Rail Validation for AI Agent Decisions in Autonomous Telecom Networks
- Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- Cut the Crap: An Economical Communication Pipeline for LLM-based Multi-Agent Systems
- DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
- DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction
- DDO: Dual-Decision Optimization for LLM-Based Medical Consultation via Multi-Agent Collaboration
- DanceHA: A Multi-Agent Framework for Document-Level Aspect-Based Sentiment Analysis
- Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory
- Data Leakage Prevention in Agentic Applications via Preemptive Hardening
- DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
- David vs. Goliath: Can Small Models Win Big with Agentic AI in Hardware Design?
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
- Decentralized Stochastic Subgradient-type Methods with Communication Compression for Nonsmooth Nonconvex Optimization
- DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
- Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
- DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
- Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
- Dementia-Agents: A Multi-Modal Multi-Agent System for Dementia Staging and Phenotyping
- Design and Implementation of Agentic Orchestrations and Orchestration of Agents
- Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents
- DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses
- Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition
- Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
- Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
- Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG
- DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
- Discovering Novel LLM Experts via Task-Capability Coevolution
- Distributed Agent Reasoning Across Independent Systems With Strict Data Locality
- Distributed Multi-Agent Bandits Over Erdős-Rényi Random Networks
- Diversity Empowers Intelligence: Integrating Expertise of Software Engineering Agents
- Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition
- Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
- DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents
- Dont Stop Early: Scalable Enterprise Deep Research with Controlled Information Flow and Evidence-Aware Termination
- Dr. RTL: Autonomous Agentic RTL Optimization through Tool-Grounded Self-Improvement
- Dual-Agent Framework for Cross-Model Verified Translation of Natural-Language Protocols into Robotic Laboratory Platform
- DyFlow: Dynamic Workflow Framework for Agentic Reasoning
- DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
- Dynamic Coordination Strategy Selection for Enterprise Multi-Agent Systems
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
- EMPATHIA: Multi-Faceted Human-AI Collaboration for Refugee Integration
- EMULATE: A Multi-Agent Framework for Determining the Veracity of Atomic Claims by Emulating Human Actions
- Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation
- Echoing: Identity Failures when LLM Agents Talk to Each Other
- EcoAgent: An Efficient Device-Cloud Collaborative Multi-Agent Framework for Mobile Automation
- EduAgentQG: A Multi-Agent Workflow Framework for Personalized Question Generation
- Effective Policy Learning for Multi-Agent Online Coordination Beyond Submodular Objectives
- Efficient Test-Time Optimization for Multi-Agent Proof Autoformalization
- Eigen-Agent: Adaptive Multi-Agent Scientific Reasoning with Monitor-Based RAG
- Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution
- Emergent Coordination in Multi-Agent Language Models
- Emergent Relational Order in LLM Agent Societies: From Collective Affect to Authority Stratification
- Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework
- Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning
- Empowering smart app development with SolidGPT: an edge-cloud hybrid AI agent framework
- Enabling Agents to Communicate Entirely in Latent Space
- End-to-End Automated Logging via Multi-Agent Framework
- EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
- Enhancing Automated Paper Reproduction via Prompt-Free Collaborative Agents
- Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning
- Enhancing LLM Planning for Robotics Manipulation through Hierarchical Procedural Knowledge Graphs
- Environment Scaling for Interactive Agentic Experience Collection: A Survey
- Environment-Grounded Automated Prompt Optimization for LLM Game Agents
- Environment-Grounded Multi-Agent Workflow for Autonomous Penetration Testing
- EpiPlanAgent: Agentic Automated Epidemic Response Planning
- Episodic Memory in Agentic Frameworks: Suggesting Next Tasks
- Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
- Evaluating LLMs in Open-Source Games
- Evaluating LLMs in Open-Source Games
- Evaluating Novelty in AI-Generated Research Plans Using Multi-Workflow LLM Pipelines
- Evaluating Prompting Strategies with MedGemma for Medical Order Extraction
- Evaluating Software Process Models for Multi-Agent Class-Level Code Generation
- EvoAgent: An Evolvable Agent Framework with Skill Learning and Multi-Agent Delegation
- EvoClaw: Evaluating AI Agents on Continuous Software Evolution
- EvoDRC: A Self-Evolving Agentic Framework for Automated DRC Violation Repair
- EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale
- Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
- ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling
- Explaining Decentralized Multi-Agent Reinforcement Learning Policies
- Extending NGU to Multi-Agent RL: A Preliminary Study
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FARS: A Fully Automated Research System Deployed at Scale
- Factor(U,T): Controlling Untrusted AI by Monitoring their Plans
- FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction
- FedSight AI: Multi-Agent System Architecture for Federal Funds Target Rate Prediction
- FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
- FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering
- Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives
- FirmPilot: Evidence-Guided Multi-Agent Environment Recovery for IoT Firmware Rehosting
- FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games
- Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation
- Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through Options
- Flow: Modularized Agentic Workflow Automation
- Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs
- Formalizing Mathematics at Scale
- FreeAskWorld: An Interactive and Closed-Loop Simulator for Human-Centric Embodied AI
- From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents
- From Debate to Equilibrium: Belief-Driven Multi-Agent LLM Reasoning via Bayesian Nash Equilibrium
- From Detection to Action: Using LLM Agents for Fault-Tolerant Control
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure
- From Logic Monopoly to Social Contract: Separation of Power and the Institutional Foundations for Autonomous Agent Economies
- From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity
- From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimization
- From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review
- From Self-Check to Consensus: Bayesian Strategic Decoding in Large Language Models
- From Single to Societal: Analyzing Persona-Induced Bias in Multi-Agent Interactions
- From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling
- From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning
- From Task-Guided Conversational Graphs to Goal-Oriented Dialogue Runtimes
- From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
- From Triggers to Emotions: A CPM-Grounded Appraisal Multi-Agent for Dynamic Emotional Evolution in Persona-Based Dialogue
- From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration
- From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing
- GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
- GISclaw: A Comprehensive Open-Source LLM Agent System for Realistic Multi-Step Geospatial Analysis
- GS-Agent: Creating 4D Physical Worlds With Generative Simulation
- GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling
- GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
- Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments
- Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
- GitLake: Git-for-data for the agentic lakehouse
- Governed Evolution of Agent Runtimes through Executable Operational Cognition
- Graph-of-Agents: A Graph-based Framework for Multi-Agent LLM Collaboration
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- Graphs Help Graphs: Multi-Agent Graph Socialized Learning
- Grounded autonomous research: a fault-tolerant LLM pipeline from corpus to manuscript in frontier computational physics
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HAMLET: A Hierarchical and Adaptive Multi-Agent Framework for Live Embodied Theatrics
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HCPO: Hierarchical Conductor-Based Policy Optimization in Multi-Agent Reinforcement Learning
- HMARL-CBF – Hierarchical Multi-Agent Reinforcement Learning with Control Barrier Functions for Safety-Critical Autonomous Systems
- HULAT2 at MER-TRANS 2026: Governed Multi-Agent Simplification for Spanish Easy-to-Read Generation
- HULAT2 at MER-TRANS 2026: Governed Multi-Agent Simplification for Spanish Easy-to-Read Generation
- Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
- Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents
- Heterogeneous Graph Transformers for Simultaneous Mobile Multi-Robot Task Allocation and Scheduling under Temporal Constraints
- Heterogeneous Scientific Foundation Model Collaboration
- HiLSVA: Design and Evaluation of a Human-in-the-Loop Agentic System for Scientific Visualization
- HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution
- Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
- Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring
- High-order Interactions Modeling for Interpretable Multi-Agent Q-Learning
- Hilbert: Recursively Building Formal Proofs with Informal Reasoning
- Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
- How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism
- How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval
- Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing
- IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai
- ICaRus: Identical Cache Reuse for Efficient Multi-Model Inference
- IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control
- IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- IRIS: Interactive Research Ideation System for Accelerating Scientific Discovery
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
- InfiAgent: Self-Evolving Pyramid Agent Framework for Infinite Scenarios
- Infinite Worlds with Versatile Interactions
- InfoCom: Kilobyte-Scale Communication-Efficient Collaborative Perception with Information Bottleneck
- InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning
- InstructFlow: Adaptive Symbolic Constraint-Guided Code Generation for Long-Horizon Planning
- IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration
- Internet of Agents: Weaving a Web of Heterogeneous Agents for Collaborative Intelligence
- Investigating Multi-Agent Deliberation in Law
- Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions
- KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment
- KPI2KVI: A Multi Agent Workflow for Calculating Key Value Indicators from Service Descriptions
- KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- KVComm: Enabling Efficient LLM Communication through Selective KV Sharing
- KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows
- KVFlow: Efficient Prefix Caching for Accelerating LLM-Based Multi-Agent Workflows
- KYA: A Framework-Agnostic Trust Layer for Autonomous Systems with Verifiable Provenance and Hierarchical Policy Composition
- Know Your Intent: An Autonomous Multi-Perspective LLM Agent Framework for DeFi User Transaction Intent Mining
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and Skill
- Knowledge Distillation from Large Reasoning Models to Compact Student Models: A Case Study on the John O Bryan Mathematics Competition
- Knowledge Starts with Practice: Knowledge-Aware Exercise Generative Recommendation with Adaptive Multi-Agent Cooperation
- Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
- Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking
- LAMP: Lean-based Agentic framework with MCP and Proof Repair
- LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
- LH-DECEPTION: Simulating and Understanding LLM Deceptive Behaviors in Long-Horizon Interactions
- LLM Agents Implement an NLG System from Scratch: Building Interpretable Rule-Based RDF-to-Text Generators
- LLM Strategic Reasoning: Agentic Study through Behavioral Game Theory
- LLM-PySC2: Starcraft II learning environment for Large Language Models
- LLM-as-Code Agentic Programming for Agent Harness
- LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
- LLMs as Firmware Experts: A Runtime-Grown Tree-of-Agents Framework
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior
- LOPT: Learning Optimal Pigovian Tax in Sequential Social Dilemmas
- Language Modeling by Language Models
- Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing
- Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- Learning Equilibria from Data: Provably Efficient Multi-Agent Imitation Learning
- Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
- Learning and Planning Multi-Agent Tasks via an MoE-based World Model
- Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis
- Learning to Evolve: A Self-Improving Framework for Multi-Agent Systems via Textual Parameter Graph Optimization
- Learning to Orchestrate Agents in Natural Language with the Conductor
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- Learning to Summarize by Learning to Quiz: Adversarial Agentic Collaboration for Long Document Summarization
- Learning “Partner-Aware” Collaborators in Multi-Party Collaboration
- LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching
- LegalHalluLens: Typed Hallucination Auditing and Calibrated Multi-Agent Debate for Trustworthy Legal AI
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Lessons from Penetration Tests on Large-Scale Agent Systems
- Leveraging Dual Process Theory in Language Agent Framework for Real-time Simultaneous Human-AI Collaboration
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
- LiRA: A Multi-Agent Framework for Reliable and Readable Literature Review Generation
- LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries
- LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models
- LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild
- Locally Coherent, Globally Incoherent: Bounding Compositional Incoherence in Multi-Component LLM Agents
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- LoongFlow: Directed Evolutionary Search via a Cognitive Plan-Execute-Summarize Paradigm
- Love First, Know Later: Persona-Based Romantic Compatibility Through LLM Text World Engines
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- M$^2$-Miner: Multi-Agent Enhanced MCTS for Mobile GUI Agent Data Mining
- M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
- MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
- MAD-Logic: Multi-Agent Debate Enhances Symbolic Translation and Reasoning
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- MAFA: A Multi-Agent Framework for Enterprise-Scale Annotation with Configurable Task Adaptation
- MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning
- MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MALinZero: Efficient Low-Dimensional Search for Mastering Complex Multi-Agent Planning
- MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration
- MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes
- MANGO: Automated Multi-Agent Test Oracle Generation for Vision-Language-Action Models
- MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- MARTI: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference
- MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
- MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting
- MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction
- MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning
- MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection
- MLE-Smith: Scaling MLE Tasks with Automated Multi-agent Pipeline
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent
- MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
- MOOSE-Chem: Large Language Models for Rediscovering Unseen Chemistry Scientific Hypotheses
- MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding
- MOSDT: Self-Distillation-Based Decision Transformer for Multi-Agent Offline Safe Reinforcement Learning
- MTTR-A: Measuring Cognitive Recovery Latency in Multi-Agent Systems
- MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
- Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
- Many LLMs Are More Utilitarian Than One
- Mastering Olympiad-Level Physics with Artificial Intelligence
- MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection
- MathCoPilot: An Interactive System for Human-AI Symbiotic Paradigm of Mathematical Research
- Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
- Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning
- Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
- MedLA: A Logic-Driven Multi-Agent Framework for Complex Medical Reasoning with Large Language Models
- MediHive: A Decentralized Agent Collective for Medical Reasoning
- Mem$^2$Evolve: Towards Self-Evolving Agents via Co-Evolutionary Capability Expansion and Experience Distillation
- MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
- MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
- Meta-Agent: From Task Descriptions to Verified Multi-Agent Systems
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation
- MicroAgent: Context-Augmented Multi-Agent Framework for Automatic Microservice Decomposition
- Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research
- Mind the (Belief) Gap: Group Identity in the World of LLMs
- MindForge: Empowering Embodied Agents with Theory of Mind for Lifelong Cultural Learning
- MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
- MisoDICE: Multi-Agent Imitation from Mixed-Quality Demonstrations
- Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation
- Model-Native Computing Architecture: Envisioning Future System Architecture Through the Lens of Computer Architecture
- Modeling Layered Consciousness with Multi-Agent Large Language Models
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MuMuTestUp: Mutation-based Multi-Agent Test Case Update
- Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation
- Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
- Multi-Agent Collaboration via Evolving Orchestration
- Multi-Agent Collaborative Framework For Math Problem Generation
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Debate for LLM Judges with Adaptive Stability Detection
- Multi-Agent Firewall Architecture for Privacy Protection of Sensitive Data in Interactions with Language Models
- Multi-Agent Imitation by Learning and Sampling from Factorized Soft Q-Function
- Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
- Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response
- Multi-Agent LLM-based Metamorphic Testing for REST APIs
- Multi-Agent LLMs Fail to Explore Each Other
- Multi-Agent LLMs for Adaptive Acquisition in Bayesian Optimization
- Multi-Agent Learning under Uncertainty: Recurrence vs. Concentration
- Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation
- Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA
- Multi-Agent Reinforcement Learning with Communication-Constrained Priors
- Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection
- Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
- Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows
- Multi-agent Autoformalization of Tensor Network Theory
- Multi-agent In-context Coordination via Decentralized Memory Retrieval
- Multi-agent KTO: Enhancing Strategic Interactions of Large Language Model in Language Game
- Multi-agent Markov Entanglement
- Multi-agent Self-triage System with Medical Flowcharts
- Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning
- NOMAD: A Multi-Agent LLM System for UML Class Diagram Generation from Natural Language Requirements
- NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems
- NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation
- Natural-Language Agent Harnesses
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use
- Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
- No-Human in the Loop: Agentic Evaluation at Scale for Recommendation
- Numerical Instability and Chaos: Quantifying the Unpredictability of Large Language Models
- OPHR: Mastering Volatility Trading with Multi-Agent Deep Reinforcement Learning
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
- On Feasible Rewards in Multi-Agent Inverse Reinforcement Learning
- One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Prediction
- One Sentence, One Drama: Personalized Short-Form Drama Generation via Multi-Agent Systems
- Open Source Planning & Control System with Language Agents for Autonomous Scientific Discovery
- Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- Opponent Shaping in LLM Agents
- OptiAgent: End-to-End Optimization Modeling via Multi-Agent Iterative Refinement
- Optimal Welfare in Noncooperative Network Formation under Attack
- Optimas: An Intelligent Analytics-Informed Generative AI Framework for Performance Optimization
- Optimizing Agentic Language Model Inference via Speculative Tool Calls
- OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning
- Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
- Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading
- OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios
- Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL
- OxyGent: Making Multi-Agent Systems Modular, Observable, and Evolvable via Oxy Abstraction
- P1: Mastering Physics Olympiads with Reinforcement Learning
- P2P: Automated Paper-to-Poster Generation and Fine-Grained Benchmark
- PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreements
- PARCO: Parallel AutoRegressive Models for Multi-Agent Combinatorial Optimization
- PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving
- PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI
- PExA: Parallel Exploration Agent for Complex Text-to-SQL
- PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- PM-Bench: Evaluating Prospective Memory in LLM Agents
- PRAGMA: A Profiling-Reasoned Multi-Agent Framework for Automatic Kernel Optimization
- PRISM: A Personality-Driven Multi-Agent Framework for Social Media Simulation
- PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval
- PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue
- PROTEA: Offline Evaluation and Iterative Refinement for Multi-Agent LLM Workflows
- PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning
- Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems
- Parametric Open Source Games
- PatchOptic for Shared-State LLM Workflows with Projected Views and Verified Structured Updates
- PerfGuard: A Performance-Aware Agent for Visual Content Generation
- Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Research
- Personalized Attacks of Social Engineering in Multi-turn Conversations: LLM Agents for Simulation and Detection
- Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
- PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
- Planning with Quantized Opponent Models
- Policy Gradient Methods Converge Globally in Imperfect-Information Extensive-Form Games
- Position: Agentic AI System Is a Foreseeable Pathway to AGI
- Poster: EdgeCitadel -- Hybrid NATS-MQTT Orchestration for Edge Multi-Agent Systems
- Pragmatic Heterogeneous Collaborative Perception via Generative Communication Mechanism
- Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning
- Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
- Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity
- ProACT: Towards Breakdown-Aware Proactive Agent in Multi-User Collaboration
- ProRefine: Inference-Time Prompt Refinement with Textual Feedback
- Project Prometheus: Bridging the Intent Gap in Agentic Program Repair via Reverse-Engineered Executable Specifications
- Prompt-to-Paper: Agentic AI System for Bioinformatics
- PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- Provably Optimal Learning Algorithms for Assistance Games
- PublicAgent: Multi-Agent Design Principles From an LLM-Based Open Data Analysis Framework
- QFedAgent: Quantum-Enhanced Personalized Federated Learning for Multi-Agent Activity Recognition
- QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
- R&D-Agent-Quant: A Multi-Agent Framework for Data-Centric Factors and Model Joint Optimization
- R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
- RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
- RMA: an Agentic System for Research-Level Mathematical Problems
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision
- RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
- Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning
- RecGPT-V3 Technical Report
- Recursive Harness Self-Improvement
- Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework
- Recursive Multi-Agent Systems
- Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
- Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
- Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- Responsible Agentic AI Requires Explicit Provenance
- Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge
- Rethinking Code Performance Benchmarks for LLMs
- Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation
- Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
- Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs
- Risk-Sensitive Agent Compositions
- RoadMapper: A Multi-Agent System for Roadmap Generation of Solving Complex Research Problems
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
- Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
- S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination
- SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
- SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?
- SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- SCALE: Towards Collaborative Content Analysis in Social Science with Large Language Model Agents and Human Intervention
- SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- SOLID: a Framework of Synergizing Optimization and LLMs for Intelligent Decision-Making
- SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
- SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- STARK: Strategic Team of Agents for Refining Kernels
- STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
- SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinement
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
- Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
- Scalable Neural Incentive Design with Parameterized Mean-Field Approximation
- Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- Scaling Internal-State Policy-Gradient Methods for POMDPs
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- Searching for Privacy Risks in LLM Agents via Simulation
- Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis
- Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures
- Select, Read, and Write: A Multi-Agent Framework of Full-Text-based Related Work Generation
- Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement
- Semantic Browsing: Controllable Diversity for Image Generation
- Semantic Early-Stopping for Iterative LLM Agent Loops
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art
- SentinelAI: A Multi-Agent Framework for Structuring and Linking NG9-1-1 Emergency Incident Data
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- Shapley-Coop: Credit Assignment for Emergent Cooperation in Self-Interested LLM Agents
- SimMOF: AI agent for Automated MOF Simulations
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration
- Social Agents: Collective Intelligence Improves LLM Predictions
- Social Agents: Collective Intelligence Improves LLM Predictions
- Social World Model-Augmented Mechanism Design Policy Learning
- Society of Mind Meets Real-Time Strategy: A Hierarchical Multi-Agent Framework for Strategic Reasoning
- Socratic agents for autonomous scientific discovery in high-dimensional physical systems
- Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation
- Solving Continuous Mean Field Games: Deep Reinforcement Learning for Non-Stationary Dynamics
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection
- SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- Spatio-Temporal Graphs Beyond Grids: Benchmark for Maritime Anomaly Detection
- SpecMAS: A Multi-Agent System for Self-Verifying System Generation via Formal Model Checking
- Speculative Actions: A Lossless Framework for Faster AI Agents
- Stackelberg Learning with Outcome-based Payment
- StateFuse: Deterministic Conflict-Preserving Memory for Multi-Agent Systems
- Stateful Online Monitoring Catches Distributed Agent Attacks
- Steering Large Language Models between Code Execution and Textual Reasoning
- Step-Level Preference Learning for Generative Agents in Social Simulations
- Stochastic Self-Organization in Multi-Agent Systems
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- Story2Proposal: A Scaffold for Structured Scientific Paper Writing
- Strategic Planning and Rationalizing on Trees Make LLMs Better Debaters
- Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
- Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Structured Output Collapses Answer Diversity Across 44 Language Models
- Structured Reasoning for Fairness: A Multi-Agent Approach to Bias Detection in Textual Data
- SuffixDecoding: Extreme Speculative Decoding for Emerging AI Applications
- SwarmX: Agentic Scheduling for Low-Latency Agentic Systems
- Systematic Capability Benchmarking of Frontier Large Language Models for Offensive Cyber Tasks
- TACTIC-KG: Toward Small Agent Teams for Cyber Threat Intelligence Knowledge Graph Construction
- THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
- Table-Critic: A Multi-Agent Framework for Collaborative Criticism and Refinement in Table Reasoning
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
- Tandem Reinforcement Learning with Verifiable Rewards
- TeachMaster: Generative Teaching via Code
- TeachMaster: Generative Teaching via Code
- Teaching LLMs to Recommend and Defer in Underrepresented Epilepsy Care
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents
- Testing Agentic Workflows with Structural Coverage Criteria
- Textual Equilibrium Propagation for Deep Compound AI Systems
- Textual Equilibrium Propagation for Deep Compound AI Systems
- The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
- The Capability Frontier: Benchmarks Miss 82% of Model Performance
- The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
- The Double Contingency Problem: AI Recursion and the Limits of Interspecies Understanding
- The Energy Society: A Simulation Environment for Studying Agent Cooperation under Survival Pressure
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Last Harness You'll Ever Build
- The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
- The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
- The Seeds of Scheming: Weakness of Will in the Building Blocks of Agentic Systems
- The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE
- The Shared Discovery Paradox: How a One-Answer Rule Turns Better Information into Worse Search
- The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development
- Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
- Theory-Scale Auto-Formalization of Logics for Computer Science
- Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-Making
- Thought Communication in Multiagent Collaboration
- Thucy: An LLM-based Multi-Agent System for Claim Verification across Relational Databases
- TinyScientist: An Interactive, Extensible, and Controllable Framework for Building Research Agents
- ToC: Tree-of-Claims Search with Multi-Agent Language Models
- ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
- ToFu: A White-Box, Token-Efficient Agent Harness for Researchers
- Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
- ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices
- TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization
- Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
- Toward AI VIS Co-Scientists: A General and End-to-End Agent Harness for Solving Complex Data Visualization Tasks
- Toward Autonomous Engineering Design: A Knowledge-Guided Multi-Agent Framework
- Toward Reliable Design of LLM-Enabled Agentic Workflows: Optimizing Latency-Reliability-Cost Tradeoffs
- Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition
- Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks
- Toward Virtuous Reinforcement Learning: A Critique and Roadmap
- Towards Automating Scientific Review with Google's Paper Assistant Tool
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Autonomous and Auditable Medical Imaging Model Development
- Towards Context-Aware Image Anonymization with Multi-Agent Reasoning
- Towards Doctor-Like Reasoning: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients
- Towards Ethical Multi-Agent Systems of Large Language Models: A Mechanistic Interpretability Perspective
- Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework
- Towards Principled Unsupervised Multi-Agent Reinforcement Learning
- Towards Realistic Project-Level Code Generation via Multi-Agent Collaboration and Semantic Architecture Modeling
- Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Towards Responsible and Explainable AI Agents with Consensus-Driven Reasoning
- Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications
- Towards Scalable Oversight via Partitioned Human Supervision
- Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
- Towards an Agentic Workflow for Internet Measurement Research
- Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
- Trace-Level Analysis of Information Contamination in Multi-Agent Systems
- TraceDev: A Traceability-Driven Multi-agent Framework for Requirement-to-Code Development
- Traceable Fault Diagnosis for Battery Energy Storage Systems via Retrieval-Augmented Multi-Agent O&M Assistant
- Tracing Agentic Failure from the Flow of Success
- Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading
- TrafficSimAgent: A Hierarchical Agent Framework for Autonomous Traffic Simulation with MCP Control
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
- TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
- TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models
- TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning
- Trusted AI Agents in the Cloud
- Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization
- TwinMarket: A Scalable Behavioral and Social Simulation for Financial Markets
- TwinMarket: A Scalable Behavioral and Social Simulation for Financial Markets
- TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding
- U2F: Encouraging SWE-Agent to Seize Novelty without Losing Feasibility
- UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development
- UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
- Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- VEXAIoT: Autonomous IoT Vulnerability EXploitation using AI Agents
- VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
- VeriGraphi: A Multi-Agent Framework of Hierarchical RTL Generation for Large Hardware Designs
- Verified Multi-Agent Orchestration: A Plan-Execute-Verify-Replan Framework for Complex Query Resolution
- Veritas: A Semantically Grounded Agentic Framework for Memory Corruption Vulnerability Detection in Binaries
- VideoAgent: All-in-One Framework for Video Understanding and Editing
- Virtual Community: An Open World for Humans, Robots, and Society
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WOLF: Werewolf-based Observations for LLM Deception and Falsehoods
- Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
- Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
- When AI Agents Collude Online: Financial Fraud Risks by Collaborative LLM Agents on Social Platforms
- When Agents “Misremember” Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
- When Does Combining Language Models Help? A Co-Failure Ceiling on Routing, Voting, and Mixture-of-Agents Across 67 Frontier Models
- When LLMs Over-Answer: Measuring and Mitigating Quality Issues in LLM-Based Hardware Description Language Question Answering
- When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
- Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence
- Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments
- Wonder Wins Ways: Curiosity-Driven Exploration through Multi-Agent Contextual Calibration
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
- cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
multimodal¶
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- A Multimodal Conversational Agent for Tabular Data Analysis
- AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
- AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes
- AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
- ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts
- AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
- Action Without Interaction: Probing the Physical Foundations of Video LMMs via Contact-Release Detection
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
- Agent-Based Modular Learning for Multimodal Emotion Recognition in Human-Agent Systems
- AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
- Aha! - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead
- Aloe-Vision: Robust Vision-Language Models for Healthcare
- An Exam for Active Observers
- AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
- Asynchronous Matching with Dynamic Sampling for Multimodal Dataset Distillation
- Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models
- Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
- Autonomous Scientific Discovery via Iterative Meta-Reflection
- Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
- Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- Best-of-N Jailbreaking
- Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
- Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
- BioVFM-21M: Benchmarking and Scaling Self-Supervised Vision Foundation Models for Biomedical Image Analysis
- Bisecle: Binding and Separation in Continual Learning for Video Language Understanding
- Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding
- Building Agent Harnesses for Scientific Curation from Multimodal Sources
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness
- Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- ChemLabs on ChemO: A Multi-Agent System for Multimodal Reasoning on IChO 2025
- ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning
- ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
- Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations
- ContextAgent: Context-Aware Proactive LLM Agents with Open-world Sensory Perceptions
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
- DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
- DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
- DOPD: Dual On-policy Distillation
- DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
- DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
- Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
- Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification
- Dialogue Summarization with Emotion Dynamics Using Topic- and Participant-Centric Decomposition
- Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection
- Discovering Compositional Hallucinations in LVLMs
- Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
- Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
- Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
- ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
- Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
- Embodied Navigation Foundation Model
- Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
- Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition
- Evian: Towards Explainable Visual Instruction-tuning Data Auditing
- Explaining CLIP Zero-shot Predictions Through Concepts
- FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging
- FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
- FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents
- FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
- Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
- GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection
- GenIR: Generative Visual Feedback for Mental Image Retrieval
- Generative Artificial Intelligence in Medical Imaging: Foundations, Progress, and Clinical Translation
- Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression
- GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- HMVLM:Human Motion-Vision-Language Model via MoE LoRA
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- Hallucination Reduction with CASAL: Contrastive Activation Steering for Amortized Learning
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
- How can embedding models bind concepts?
- Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation
- Inducing Dyslexia in Vision Language Models
- Interpretability Transfer from Language to Vision via Sparse Autoencoders
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
- JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
- LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
- LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models
- LaViDa: A Large Diffusion Language Model for Multimodal Understanding
- Latent Chain-of-Thought for Visual Reasoning
- Let RGB Be the Language of Vision
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
- M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation
- MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration
- MAMA-Memeia! Multi-Aspect Multi-Agent Collaboration for Depressive Symptoms Identification in Memes
- MEDFORM: A Foundation Model for Contrastive Learning of CT Imaging and Clinical Numeric Data in Multi-Cancer Analysis
- MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection
- MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein
- MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMReD: a Cross-Modal Benchmark for Dense Context Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MathAgent: Leveraging a Mixture-of-Math-Agent Framework for Real-World Multimodal Mathematical Error Detection
- MedBench v4: A Robust and Scalable Benchmark for Evaluating Chinese Medical Language Models, Multimodal Models, and Intelligent Agents
- MedInsightBench: Evaluating Medical Analytics Agents Through Multi-Step Insight Discovery in Multimodal Medical Data
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MemEIC: A Step Toward Continual and Compositional Knowledge Editing
- MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory
- Memory-Driven Self-Disclosure and Relational Turning Points: A Longitudinal Multimodal Study of Human-AI Interaction
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
- Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities
- Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
- Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach
- MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding
- Mordal: Automated Pretrained Model Selection for Vision Language Models
- Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
- Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation
- Multi-modal Rail Crossing Safety Analysis
- Multimodal Distribution Matching for Vision-Language Dataset Distillation
- Multimodal Medical Code Tokenizer
- Multimodal Policy Internalization for Conversational Agents
- Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- Multimodal, Multi-Disease Medical Imaging Foundation Model (MerMED-FM)
- Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality
- Native Active Perception as Reasoning for Omni-Modal Understanding
- OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
- OmniSVG: A Unified Scalable Vector Graphics Generation Model
- One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs
- One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization
- PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series in Typhoon Forecasting
- Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
- Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection
- Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
- Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
- Prune4Web: DOM Tree Pruning Programming for Web Agent
- QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- RADIO1D: Elastic Representations for Condensed Vision Modeling
- RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections
- RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving
- Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering
- ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog
- Revealing Multimodal Causality with Large Language Models
- Revisiting Multimodal Positional Encoding in Vision–Language Models
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
- Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs
- ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models
- SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions
- Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models
- SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
- Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
- Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models
- Semantic Robustness Certification for Vision-Language Models
- Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- Should VLMs be Pre-trained with Image Data?
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
- SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
- Spoken Conversational Agents with Large Language Models
- Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
- Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning
- Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
- Structural Graph Probing of Vision-Language Models
- TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
- TeachMaster: Generative Teaching via Code
- Teaching Human Behavior Improves Content Understanding Abilities Of VLMs
- Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- Test-Time Training for Modality Order Consistency in Vision-Language Models
- The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
- Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
- Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models
- Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Multimodal Data-Driven Scientific Discovery Powered by LLM Agents
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
- Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
- TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models
- UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction as Reasoning
- UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
- UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
- UNICON: UNIfied CONtinual Learning for Medical Foundational Models
- Understanding and Rectifying Safety Perception Distortion in VLMs
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks
- Unified Audio Intelligence Without Regressing on Text Intelligence
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
- VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
- VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
- VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
- Video = World + Event Stream
- Video Action Differencing
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification
- VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
- Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
- Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
- WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality
- What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
- Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
- Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models
- scBench-Long: Verifiable Benchmarking of Long-Horizon Single-Cell Biology
multimodal-llm¶
- A Training-Free Framework for Long Video Understanding via Video-Query-Options Similarity
- AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
- ActiveScope: Actively Seeking and Correcting Perception for MLLMs
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
- Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
- Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
- Does The Way You Plan Matter? An Empirical Study of Planning Representations for LLM Web Agents
- EIA: ENVIRONMENTAL INJECTION ATTACK ON GENERALIST WEB AGENTS FOR PRIVACY LEAKAGE
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- Empowering Long-form Omni-modal Understanding with Robust Audio Perception
- Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings
- EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
- From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration
- GRIT: Teaching MLLMs to Think with Images
- GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks
- Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector
- GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
- GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
- History-Aware Reasoning for GUI Agents
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- Learning to Instruct for Visual Instruction Tuning
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
- MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
- MR. Video: MapReduce as an Effective Principle for Long Video Understanding
- Mind the Heads: Topological Representation Alignment for Multimodal LLMs
- Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing
- MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation
- Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration
- Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- Omni-Mol: Multitask Molecular Model for Any-to-any Modalities
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
- PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
- Reasoning-Driven Multimodal LLM for Domain Generalization
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
- Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
- SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
- ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
- SigLIP-HD by Fine-to-Coarse Supervision
- SpaceServe: Spatial Multiplexing of Complementary Encoders and Decoders for Multimodal LLMs
- SpatialLM: Training Large Language Models for Structured Indoor Modeling
- Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages
- TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
- Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
- Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- ZooProbe: A Data Engine for Evaluating, Exploring, and Evolving Large-scale Training Data for Multimodal LLMs
multimodal-reasoning¶
- APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
- AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
- ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- DeepEyesV2: Toward Agentic Multimodal Model
- DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
- Detecting AI-Generated Video: A Vision-Language Dual-View Survey
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
- GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
- GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- Generative Universal Verifier as Multimodal Meta-Reasoner
- HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
- How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
- IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
- MentalThink: Shaping Thoughts in Mental SVG World
- Mixture of Cognitive Experts in Large Vision-Language Models
- More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
- Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs
- MuSLR: Multimodal Symbolic Logical Reasoning
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning
- NL-Eye: Abductive NLI For Images
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- RL Forgets! Towards Continual Policy Optimization
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- Self-Prophetic Decoding to Unlock Visual Search in LVLMs
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
- TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
- TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
- Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
- To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
- TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning
- TopoAgent: A Self-Evolving Topological Agent for Multimodal Scientific Reasoning
- Towards General Continuous Memory for Vision-Language Models
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- Unveiling the Visual Counting Bottleneck in Vision-Language Models
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding
- WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
orchestration¶
- A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows
- A Multimodal Conversational Agent for Tabular Data Analysis
- A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows
- APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page Design
- APWA: A Distributed Architecture for Parallelizable Agentic Workflows
- ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
- AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration
- Agent WARPP: Workflow Adherence via Runtime Parallel Personalization
- Agent-SAMA: State-Aware Mobile Assistant
- Agentic AI Systems in Electrical Power Systems Engineering: Current State-of-the-Art and Challenges
- Agentic Discovery of Non-Canonical Antimicrobial Peptides with AMPGAN v3
- Agentic Frameworks for Reasoning Tasks: An Empirical Study
- Agentic SABRE: An Uncertainty-Aware Neuro-Symbolic Multi-Agent Framework for Adaptive Ransomware Detection
- Agentic Time Machine as an Infrastructure for Future-Event Forecasting
- AgenticCyber: A GenAI-Powered Multi-Agent System for Multimodal Threat Detection and Adaptive Response in Cybersecurity
- Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response
- Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization
- An Agentic AI Framework to Accelerate Scientific Discovery in Plant Phenotyping
- An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework
- Architectural Design Decisions in AI Agent Harnesses
- AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
- AutoSpec: An Agentic Framework for Automatically Drafting Patent Specification
- Autonomous Event-Driven Multi-Agent Orchestration for Enterprise AI at Scale
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
- Beyond Prototyping: Autonomous, Enterprise-Grade Frontend Development from Pixel to Production via a Specialized Multi-Agent Framework
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- Building Persona-Based Agents On Demand: Tailoring Multi-Agent Workflows to User Needs
- CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science
- CHORUS: An Agentic Framework for Generating Realistic Deliberation Data
- CTM-AI: A Blueprint for General AI Inspired by a Model of Consciousness
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
- ClawNet: Human-Symbiotic Agent Network for Cross-User Autonomous Cooperation
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- Coercion and Deception in AI-to-AI Management: An Agentic Benchmark of Unprompted Escalation
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- DDIAgents: Mechanism-Conditioned Context Flow for Drug-Drug Interaction Prediction
- Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory
- DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
- DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
- Distributed Agent Reasoning Across Independent Systems With Strict Data Locality
- EChO-Agent: Evidence Chain Orchestration Agent for Audio Reasoning
- End-to-End Automated Logging via Multi-Agent Framework
- Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
- EnergyTwin: A Multi-Agent System for Simulating and Coordinating Energy Microgrids
- ExComm: Exploration-Stage Communication for Error-Resilient Agentic Test-Time Scaling
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering
- Formalizing Mathematics at Scale
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Reasoning-Driven Pedagogical Visualization
- From Logic Monopoly to Social Contract: Separation of Power and the Institutional Foundations for Autonomous Agent Economies
- From Task-Guided Conversational Graphs to Goal-Oriented Dialogue Runtimes
- FutureWeaver: Planning Test-Time Compute for Multi-Agent Systems with Modularized Collaboration
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- Harness as an Asset: Enforcing Determinism via the Convergent AI Agent Framework (CAAF)
- Heterogeneous Scientific Foundation Model Collaboration
- Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
- How Generation Architecture Shapes Code Complexity in Multi-Agent LLM Systems: A Paired Study on HumanEval
- Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery
- IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response
- Know Your Intent: An Autonomous Multi-Perspective LLM Agent Framework for DeFi User Transaction Intent Mining
- LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- MAC: A Multi-Agent Framework for Interactive User Clarification in Multi-turn Conversations
- MAM: Modular Multi-Agent Framework for Multi-Modal Medical Diagnosis via Role-Specialized Collaboration
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent
- MTTR-A: Measuring Cognitive Recovery Latency in Multi-Agent Systems
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference
- MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation
- MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
- Monadic Context Engineering
- Multi-Agent Collaboration via Evolving Orchestration
- Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology
- Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response
- One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Prediction
- Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
- Orchestration Framework for Financial Agents: From Algorithmic Trading to Agentic Trading
- PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreements
- Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework
- Parallelism Meets Adaptiveness: Scalable Documents Understanding in Multi-Agent LLM Systems
- Poster: EdgeCitadel -- Hybrid NATS-MQTT Orchestration for Edge Multi-Agent Systems
- PublicAgent: Multi-Agent Design Principles From an LLM-Based Open Data Analysis Framework
- RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery
- Re4: Scientific Computing Agent with Rewriting, Resolution, Review and Revision
- Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation
- SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch
- STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision
- Safe and Policy-Compliant Multi-Agent Orchestration for Enterprise AI
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
- The Last Harness You'll Ever Build
- The PokeAgent Challenge: Competitive and Long-Context Learning at Scale
- The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE
- Toward AI VIS Co-Scientists: A General and End-to-End Agent Harness for Solving Complex Data Visualization Tasks
- Towards Resource-Efficient Multimodal Intelligence: Learned Routing among Specialized Expert Models
- Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents
- TriFlow: A Progressive Multi-Agent Framework for Intelligent Trip Planning
- Verified Multi-Agent Orchestration: A Plan-Execute-Verify-Replan Framework for Complex Query Resolution
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction
- WebSwarm: Recursive Multi-Agent Orchestration for Deep-and-Wide Web Search
prompt-injection¶
- A Security Analysis of the OpenClaw AI Agent Framework
- Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
- Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
- Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
- Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents
- AprielGuard
- Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
- Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems
- Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks
- Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems
- ChatInject: Abusing Chat Templates for Prompt Injection in LLM Agents
- Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
- Data Leakage Prevention in Agentic Applications via Preemptive Hardening
- Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
- EIA: ENVIRONMENTAL INJECTION ATTACK ON GENERALIST WEB AGENTS FOR PRIVACY LEAKAGE
- From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
- Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions
- IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
- It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
- Lessons from Penetration Tests on Large-Scale Agent Systems
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
- PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
- Please Don't Kill My Vibe: Empowering Agents with Data Flow Control
- Prismata: Confining Cross-Site Prompt Injection in Web Agents
- Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study
- Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures
- Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
- Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
- ShareLock: A Stealthy Multi-Tool Threshold Poisoning Attack Against MCP
- The Surface You Test Is Not the Surface That Breaks
- They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface
- Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents
- Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks
- Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
- Unicode TAG-Block Concealment of Tool-Metadata Payloads in the Model Context Protocol: An Approval-View Fidelity Gap Across Three Independent Server Implementations
- Untrusted Content Masking for Web Agents with Security Guarantees
- When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
- Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems
rag¶
- A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems
- A Self-Evolving Agent for Longitudinal Personal Health Management
- A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends
- AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and Large Language Models
- AI Hiring with LLMs: A Context-Aware and Explainable Multi-Agent Framework for Resume Screening
- AI-accelerated End-to-End Framework for Rapid Professional Upskilling
- AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
- AKG kernel Agent: A Multi-Agent Framework for Cross-Platform Kernel Synthesis
- AMemGym: Interactive Memory Benchmarking for Assistants in Long-Horizon Conversations
- AVDA: Autonomous Vibe Detection Authoring for Cybersecurity
- AdvisingWise: Supporting Academic Advising in Higher Education Settings Through a Human-in-the-Loop Multi-Agent Framework
- AgentAuditor: Human-level Safety and Security Evaluation for LLM Agents
- AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
- Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
- Agentic Data Environments
- Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response
- Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents
- AgroAskAI: A Multi-Agentic AI Framework for Supporting Smallholder Farmers' Enquiries Globally
- Aligned Agents, Biased Swarm: Measuring Bias Amplification in Multi-Agent Systems
- An Agentic Retrieval Framework for Autonomous Context-Aware Data Quality Assessment
- An Exploration of Agentic Information Fusion for Test Maintenance Prediction
- An Open and Reproducible Deep Research Agent for Long-Form Question Answering
- AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation
- BIMgent: Towards Autonomous Building Modeling via Computer-use Agents
- BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
- Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning
- Beyond Protein Language Models: An Agentic LLM Framework for Mechanistic Enzyme Design
- BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery
- Boundary-Aware Context Grounding for A Low-Channel EEG Agent
- BrainPilot: Automating Brain Discovery with Agentic Research
- BrainPilot: Automating Brain Discovery with Agentic Research
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory
- CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
- CHARLIE: An On-Premise Multi-Agent Retrieval-Augmented Generation System for Evidential Reasoning in Forensic Science
- CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- ClinicalAgents: Multi-Agent Orchestration for Clinical Decision Making with Dual-Memory
- Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks
- Code Like Humans: A Multi-Agent Solution for Medical Coding
- CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
- ColPali: Efficient Document Retrieval with Vision Language Models
- Completing Missing Annotation: Multi-Agent Debate for Accurate and Scalable Relevant Assessment for IR Benchmarks
- Context Graphs for Proactive Enterprise Agents
- ContextNest: Verifiable Context Governance for Autonomous AI Agent
- ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair
- Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification
- DMV-Bench: Diagnosing Long-Horizon Multimodal Agents' Visual Memory with Incidental Cue Injection
- DataSage: Multi-agent Collaboration for Insight Discovery with External Knowledge Retrieval, Multi-role Debating, and Multi-path Reasoning
- DeepStress: Stress-Testing Deep Search Agents
- DeepTRACE: Auditing Deep Research AI Systems for Tracking Reliability Across Citations and Evidence
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents
- Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection
- Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
- Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents
- Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG
- DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
- DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- Domain-Partitioned Hybrid RAG for Legal Reasoning: Toward Modular and Explainable Legal AI for India
- Dont Stop Early: Scalable Enterprise Deep Research with Controlled Information Flow and Evidence-Aware Termination
- DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
- ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
- EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
- EduAgentQG: A Multi-Agent Workflow Framework for Personalized Question Generation
- Eigen-Agent: Adaptive Multi-Agent Scientific Reasoning with Monitor-Based RAG
- EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
- Enhancing LLM Planning for Robotics Manipulation through Hierarchical Procedural Knowledge Graphs
- Entropic Claim Resolution: Uncertainty-Driven Evidence Selection for RAG
- EpiPlanAgent: Agentic Automated Epidemic Response Planning
- Evaluating Long-Context Reasoning in LLM-Based WebAgents
- Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
- ExpertAgent: Enhancing Personalized Education through Dynamic Planning and Retrieval-Augmented Long-Chain Reasoning
- FHE-Coder: Benchmarking Secure Agentic Code Generation for Fully Homomorphic Encryption
- Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
- FinDebate: Multi-Agent Collaborative Intelligence for Financial Analysis
- FinSAgent: Corpus-Aligned Multi-Agent RAG Framework for Evidence-Grounded SEC Filing Question Answering
- FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents
- FirmPilot: Evidence-Guided Multi-Agent Environment Recovery for IoT Firmware Rehosting
- From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
- From Prompts to Contracts: Harness Engineering for Auditable Enterprise LLM Agents
- Graph Distance as Surprise: Free Energy Minimization in Knowledge Graph Reasoning
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
- HeaRT: A Hierarchical Circuit Reasoning Tree-Based Agentic Framework for AMS Design Optimization
- Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents
- Hierarchical Deep Research with Local-Web RAG: Toward Automated System-Level Materials Discovery
- Hierarchical Long-Term Semantic Memory for LinkedIn's Hiring Agent
- IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation
- IRSDA: An Agent-Orchestrated Framework for Enterprise Intrusion Response
- Identifying the Supply Chain of AI for Trustworthiness and Risk Management in Critical Applications
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- In Agents We Trust, but Who Do Agents Trust? Latent Source Preferences Steer LLM Generations
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
- Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions
- Is Progressive Disclosure All You Need for Long-Context Agents?
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- KRCA: An Efficient Root Cause Analysis System in Hyper-Scale Microservice Systems via Agentic AI
- KVCOMM: Online Cross-context KV-cache Communication for Efficient LLM-based Multi-agent Systems
- Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool use
- Knowledge Starts with Practice: Knowledge-Aware Exercise Generative Recommendation with Adaptive Multi-Agent Cooperation
- Knowledge-Centric Information Systems
- Knowledge-Informed Automatic Feature Extraction via Collaborative Large Language Model Agents
- Knowledge-augmented Agentic AI for Mental Health Medication Information Seeking
- LLMSR@XLLM25: Less is More: Enhancing Structured Multi-Agent Reasoning via Quality-Guided Distillation
- Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MEDDxAgent: A Unified Modular Agent Framework for Explainable Automatic Differential Diagnosis
- MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems
- MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
- MLZero: A Multi-Agent System for End-to-end Machine Learning Automation
- MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
- Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- Mem-PAL: Towards Memory-based Personalized Dialogue Assistants for Long-term User-Agent Interaction
- MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
- Memory Injection Attacks on LLM Agents via Query-Only Interaction
- Memory in the Loop: In-Process Retrieval as ExtendedWorking Memory for Language Agents
- MindSearch: Mimicking Human Minds Elicits Deep AI Searcher
- Mobile-Agent-RAG: Driving Smart Multi-Agent Coordination with Contextual Knowledge Empowerment for Long-Horizon Mobile Automation
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- Multi-agent Self-triage System with Medical Flowcharts
- Open Source Planning & Control System with Language Agents for Autonomous Scientific Discovery
- Out of Sight: Compression-Aware Content Protection against Agentic Crawlers
- PAKTON: A Multi-Agent Framework for Question Answering in Long Legal Agreements
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
- PHITSBench: an execution-scored benchmark for AI-assisted PHITS radiation-transport input generation using natural language
- PRISM: Prompt-Refined In-Context System Modelling for Financial Retrieval
- Perovskite-LLM: Knowledge-Enhanced Large Language Models for Perovskite Solar Cell Research
- Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity
- Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
- Prompt-to-Paper: Agentic AI System for Bioinformatics
- QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities
- R-Debater: Retrieval-Augmented Debate Generation through Argumentative Memory
- RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
- RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar
- RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- REMem: Reasoning with Episodic Memory in Language Agent
- Reflection-Driven Control for Trustworthy Code Agents
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
- Safety and accuracy follow different scaling laws in clinical large language models
- Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration
- Self-Taught Agentic Long Context Understanding
- Semantic Early-Stopping for Iterative LLM Agent Loops
- Sensorium Arc: AI Agent System for Oceanic Data Exploration and Interactive Eco-Art
- SimMOF: AI agent for Automated MOF Simulations
- SlideBot: A Multi-Agent Framework for Generating Informative, Reliable, Multi-Modal Presentations
- SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis
- Supra Cognitive Modes: A Routed Architecture for Agent Memory
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge
- Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition
- Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach
- Towards Doctor-Like Reasoning: Medical RAG Fusing Knowledge with Patient Analogy through Textual Gradients
- Towards General Continuous Memory for Vision-Language Models
- Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation
- Traceable Fault Diagnosis for Battery Energy Storage Systems via Retrieval-Augmented Multi-Agent O&M Assistant
- TransLaw: A Large-Scale Dataset and Multi-Agent Benchmark Simulating Professional Translation of Hong Kong Case Law
- Understanding Agent-Based Patching of Compiler Missed Optimizations
- Unified Interactive Multimodal Moment Retrieval via Cascaded Embedding-Reranking and Temporal-Aware Score Fusion
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- WebWeaver: Structuring Web-Scale Evidence with Dynamic Outlines for Open-Ended Deep Research
- What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations
- What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty
- WhatsCode: Large-Scale GenAI Deployment for Developer Efficiency at WhatsApp
- Workflow is All You Need: Escaping the "Statistical Smoothing Trap" via High-Entropy Information Foraging and Adversarial Pacing
- Workflows vs Agents for Code Translation
- Workflows vs Agents for Code Translation
- WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Youtu-GraphRAG: Vertically Unified Agents for Graph Retrieval-Augmented Complex Reasoning
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
- cuPilot: A Strategy-Coordinated Multi-agent Framework for CUDA Kernel Evolution
reasoning¶
- ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving
- Agentic Frameworks for Reasoning Tasks: An Empirical Study
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
- Benefits and Limitations of Communication in Multi-Agent Reasoning
- Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate
- Collective Intelligence with Foundation Models
- Context Learning for Multi-Agent Discussion
- Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- Eliciting Reasoning in Language Models with Cognitive Tools
- Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Flow-of-Options: Diversified and Improved LLM Reasoning by Thinking Through Options
- From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
- GRIT: Teaching MLLMs to Think with Images
- Hilbert: Recursively Building Formal Proofs with Informal Reasoning
- Hybrid Training for Vision-Language-Action Models
- KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling
- LILO: Learning to Reason at the Frontier of Learnability
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
- MARTI: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference
- MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- On Test-Time Scaling for Vision-Language Models
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- SYMPHONY: Synergistic Multi-agent Planning with Heterogeneous Language Model Assembly
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- SiriuS: Self-improving Multi-agent Systems via Bootstrapped Reasoning
- Spectral Rewiring for Exploration, Purification, and Model Merging
- Tandem Reinforcement Learning with Verifiable Rewards
- Theorem-of-Thought: A Multi-Agent Framework for Abductive, Deductive, and Inductive Reasoning in Language Models
- Think, Speak, Decide: Language-Augmented Multi-Agent Reinforcement Learning for Economic Decision-Making
- UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction as Reasoning
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Vision Language Models are Biased
- Weak-Link Optimization for Multi-Agent Reasoning and Collaboration
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
red-teaming¶
- A Safety and Security Framework for Real-World Agentic Systems
- A2ASecBench: A Protocol-Aware Security Benchmark for Agent-to-Agent Multi-Agent Systems
- ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
- Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
- Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
- Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
- Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
- Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- AutoRedTeamer: Autonomous Red Teaming with Lifelong Attack Integration
- Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
- Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
- Best-of-N Jailbreaking
- Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- CoP: Agentic Red-teaming for Large Language Models using Composition of Principles
- Comparing AI Agents to Cybersecurity Professionals in Real-World Penetration Testing
- Distributed Attacks in Persistent-State AI Control
- Estimating Worst-Case Frontier Risks of Open-Weight LLMs
- Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
- FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents
- Factor(U,T): Controlling Untrusted AI by Monitoring their Plans
- Goal-Aware Identification and Rectification of Misinformation in Multi-Agent Systems
- Hiding in the AI Traffic: Abusing MCP for LLM-Powered Agentic Red Teaming
- It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents
- Jailbreaking Frontier Foundation Models Through Intention Deception
- LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
- MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
- Monitoring Decomposition Attacks with Lightweight Sequential Monitors
- OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- PLAGUE: Plug-and-play Framework for Lifelong Adaptive Generation of Multi-turn Jailbreaks
- PLAGUE: Plug-and-play Framework for Lifelong Adaptive Generation of Multi-turn Jailbreaks
- PLAGUE: Plug-and-play framework for Lifelong Adaptive Generation of Multi-turn Exploits
- Reliable Weak-to-Strong Monitoring of LLM Agents
- ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
- Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
- SafeSearch: Automated Red-Teaming of LLM-Based Search Agents
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- Searching for Privacy Risks in LLM Agents via Simulation
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
- TAI3: Testing Agent Integrity in Interpreting User Intent
- The Surface You Test Is Not the Surface That Breaks
- They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface
- Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
- Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models
reinforcement-learning¶
- $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
- 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation
- 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems
- A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- A-LAMP: Agentic LLM-Based Framework for Automated MDP Modeling and Policy Generation
- ARCTraj: A Dataset and Benchmark of Human Reasoning Trajectories for Abstract Problem Solving
- ASMR: Agentic Schema Generation for Ship Maintenance Report Writing
- ASMR: Agentic Schema Generation for Ship Maintenance Report Writing
- ATOD: Annealed Turn-aware On-policy Distillation for Multi-turn Autonomous Agents
- Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
- AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration
- Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning
- Adaptive Utility driven Resource Orchestration for Resilient AI (AURORA-AI)
- Adaptively Coordinating with Novel Partners via Learned Latent Strategies
- Aegis: Automated Error Generation and Attribution for Multi-Agent Systems
- AgenTracer: Who Is Inducing Failure in the LLM Agentic Systems?
- AgentGym-RL: An Open-Source Framework to Train LLM Agents for Long-Horizon Decision Making via Multi-Turn RL
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentPO: Enhancing Multi-Agent Collaboration via Reinforcement Learning
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- Agentic Reinforced Policy Optimization
- Agentic Reinforcement Learning with Implicit Step Rewards
- AlphaAgentEvo: Evolution-Oriented Alpha Mining via Self-Evolving Agentic Reinforcement Learning
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning
- AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- Automating Potential-based Reward Shaping with Vision Language Model Guidance
- Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance
- BAMAS: Structuring Budget-Aware Multi-Agent Systems
- BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
- Beyond Fixed Tasks: Unsupervised Environment Design for Task-Level Pairs
- Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
- Beyond Supervised Clarification: Input Rewriting with LLMs for Dialogue Discourse Parsing
- Bi-Level Knowledge Transfer for Multi-Task Multi-Agent Reinforcement Learning
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- Breaking the Performance Ceiling in Reinforcement Learning requires Inference Strategies
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- Causal Reinforcement Learning based Agent-Patient Interaction with Clinical Domain Knowledge
- ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education
- Co-EPG: A Framework for Co-Evolution of Planning and Grounding in Autonomous GUI Agents
- Co-Evolving LLM Coder and Unit Tester via Reinforcement Learning
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoLLMLight: Cooperative Large Language Model Agents for Network-Wide Traffic Signal Control
- CoMAS: Co-Evolving Multi-Agent Systems via Interaction Rewards
- CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Code Aesthetics with Agentic Reward Feedback
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Concept-Guided Spatial Regularization for World Models in Atari Pong
- Contextual Integrity in LLMs via Reasoning and Reinforcement Learning
- Continuous Soft Actor-Critic: An Off-Policy Learning Method Robust to Time Discretization
- Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes
- Credit-Budgeted ICPC-Style Coding: When Agents Must Pay for Every Decision
- CurateEvo: Data-Curation Evolving for Agentic Post-Training
- DDO: Dual-Decision Optimization for LLM-Based Medical Consultation via Multi-Agent Collaboration
- DEPO: Dual-Efficiency Preference Optimization for LLM Agents
- DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents
- DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
- DSWorld: A Data Science World Model for Efficient Autonomous Agents
- DaVinci: Reinforcing Visual-Structural Syntax in MLLMs for Generalized Scientific Diagram Parsing
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- DeepEyesV2: Toward Agentic Multimodal Model
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION
- DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- Dockerless: Environment-Free Program Verifier for Coding Agents
- DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
- EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
- Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning
- Empowering LLM Tool Invocation with Tool-call Reward Model
- EvoOptiGraph: Weakness-Driven Coevolution via Graph-Based Structural Generation for Optimization Modeling
- EvoPolicyGym: Evaluating Autonomous Policy Evolution in Interactive Environments
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
- Exploratory Memory-Augmented LLM Agent via Hybrid On- and Off-Policy Optimization
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Expressive Temporal Specifications for Reward Monitoring
- Extending NGU to Multi-Agent RL: A Preliminary Study
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
- FinRpt: Dataset, Evaluation System and LLM-based Multi-agent Framework for Equity Research Report Generation
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
- From Debate to Equilibrium: Belief-Driven Multi-Agent LLM Reasoning via Bayesian Nash Equilibrium
- From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- GRASP: GRanularity-Aware Search Policy for Agentic RAG
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- GRIT: Teaching MLLMs to Think with Images
- GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Generative Universal Verifier as Multimodal Meta-Reasoner
- Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
- GoalLadder: Incremental Goal Discovery with Vision-Language Models
- Good-for-MDP State Reduction for Stochastic LTL Planning
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- GraphPlanner: Graph Memory-Augmented Agentic Routing for Multi-Agent LLMs
- Ground-Compose-Reinforce: Grounding Language in Agentic Behaviours using Limited Data
- Grounded Reinforcement Learning for Visual Reasoning
- Grounding Computer Use Agents on Human Demonstrations
- Group-in-Group Policy Optimization for LLM Agent Training
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning
- Heterogeneous Graph Transformers for Simultaneous Mobile Multi-Robot Task Allocation and Scheduling under Temporal Constraints
- HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks
- History-Aware Reasoning for GUI Agents
- HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
- How to Train Your LLM Web Agent: A Statistical Diagnosis
- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- Improving General Role-Playing Agents via Psychology-Grounded Reasoning and Role-Aware Policy Optimization
- Improving Retrieval-Augmented Generation through Multi-Agent Reinforcement Learning
- In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search
- Incentivizing Agentic Reasoning in LLM Judges via Tool-Integrated Reinforcement Learning
- Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning
- Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics
- Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
- JaxWildfire: A GPU-Accelerated Wildfire Simulator for Reinforcement Learning
- Joint Learning of Experiential Rules and Policies for Large Language Model Agents
- JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- Know your Trajectory -- Trustworthy Reinforcement Learning deployment through Importance-Based Trajectory Analysis
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
- LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning
- LILO: Learning to Reason at the Frontier of Learnability
- LLM-Driven Composite Neural Architecture Search for Multi-Source RL State Encoding
- LLM-as-a-Verifier: A General-Purpose Verification Framework
- Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense
- Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate
- Latent Chain-of-Thought for Visual Reasoning
- Learning Equilibria from Data: Provably Efficient Multi-Agent Imitation Learning
- Learning Human-Like RL Agents Through Trajectory Optimization With Action Quantization
- Learning to Orchestrate Agents in Natural Language with the Conductor
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- Look Back to Reason Forward: Revisitable Memory for Long-Context LLM Agents
- Lyapunov Exponent as Physics-Informed Dense Reward: RL Discovery of Stabilization Beyond the Kapitza Pendulum
- MACS: Multi-Agent Reinforcement Learning for Optimization of Crystal Structures
- MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models
- MALinZero: Efficient Low-Dimensional Search for Mastering Complex Multi-Agent Planning
- MAPoRL: Multi-Agent Post-Co-Training for Collaborative Large Language Models with Reinforcement Learning
- MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs
- MARTI: A Framework for Multi-Agent LLM Systems Reinforced Training and Inference
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MAT-Agent: Adaptive Multi-Agent Training Optimization
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
- Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction
- Mean-Field Sampling for Cooperative Multi-Agent Reinforcement Learning
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning
- MentalThink: Shaping Thoughts in Mental SVG World
- Meta-RL Induces Exploration in Language Agents
- Meta-RL Induces Exploration in Language Agents
- MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
- MoralReason: Generalizable Moral Decision Alignment For LLM Agents Using Reasoning-Level Reinforcement Learning
- More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe
- Multi-Agent Collaboration via Evolving Orchestration
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Reinforcement Learning with Communication-Constrained Priors
- Multi-agent In-context Coordination via Decentralized Memory Retrieval
- Multi-agent KTO: Enhancing Strategic Interactions of Large Language Model in Language Game
- Multi-agent Markov Entanglement
- Multimodal Policy Internalization for Conversational Agents
- Native Active Perception as Reasoning for Omni-Modal Understanding
- NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- OPHR: Mastering Volatility Trading with Multi-Agent Deep Reinforcement Learning
- OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
- Object-Centric World Models for Causality-Aware Reinforcement Learning
- On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Opponent Shaping in LLM Agents
- OrbitZoo: Real Orbital Systems Challenges for Reinforcement Learning
- Oryx: a Scalable Sequence Model for Many-Agent Coordination in Offline MARL
- Out-of-Distribution Generalization with a SPARC: Racing 100 Unseen Vehicles with a Single Policy
- P1: Mastering Physics Olympiads with Reinforcement Learning
- PARCO: Parallel AutoRegressive Models for Multi-Agent Combinatorial Optimization
- PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- Personalization as Inverse Planning: Learning Latent Design Intents for Agentic Slide Generation via Structural Denoising
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
- Planning without Search: Refining Frontier LLMs with Offline Goal-Conditioned RL
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Policy Gradient Methods Converge Globally in Imperfect-Information Extensive-Form Games
- PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
- Post-Training in End-to-End Autonomous Driving
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations
- ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
- Process Reward Informed Tree Rollout for Effective Multi-Turn RL
- Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
- Provable Memory Efficient Self-Play Algorithm for Model-free Reinforcement Learning
- QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
- QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management
- RAST-MoE-RL: A Regime-Aware Spatio-Temporal MoE Framework for Deep Reinforcement Learning in Ride-Hailing
- RL Forgets! Towards Continual Policy Optimization
- RLAP-CLIP: Continual Multimodal Learning with Prototype Adaptation and Difficulty-Aware Routing
- RLSLM: A Hybrid Reinforcement Learning Framework Aligning Rule-Based Social Locomotion Model with Human Social Norms
- RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents
- RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays
- Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Reachability-Aware Pretraining for Efficient Target-Oriented Path Exploration in Temporal Knowledge Graph Reasoning
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
- Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Reducing Belief Deviation in Reinforcement Learning for Active Reasoning of LLM Agents
- RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
- Regular Games -- an Automata-Based General Game Playing Language
- Reinforcement Learning-Augmented LLM Agents for Collaborative Decision Making and Performance Optimization
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning
- Reward Engineering for Spatial Epidemic Simulations: A Reinforcement Learning Platform for Individual Behavioral Learning
- Reward-Driven LLM Agent Workflows: Synthesizing POMDP Routing and Self-Correction for Autonomous Decision-Making
- Risk-Sensitive Agent Compositions
- Robostral Navigate
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning
- SEMDICE: Off-policy State Entropy Maximization via Stationary Distribution Correction Estimation
- SMP: Reusable Score-Matching Motion Priors for Physics-Based Character Control
- SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
- SPIRAL: Self-Play on Zero-Sum Games Incentivizes Reasoning via Multi-Agent Multi-Turn Reinforcement Learning
- SPRO: Improving Image Generation via Self-Play
- SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- SR-Scientist: Scientific Equation Discovery With Agentic AI
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- STAMP: Provenance-Guided Credit Assignment for Deep Search Agents
- STAPO: Selective Trajectory-Aware Policy Optimization for LLM Agent Training
- STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- Scaffolding Dexterous Manipulation with Vision-Language Models
- Scalable Neural Incentive Design with Parameterized Mean-Field Approximation
- Scaling Agent Learning via Experience Synthesis
- Scaling Behavior Foundation Model for Humanoid Robots
- Scaling Generalist Data-Analytic Agents
- Scaling Internal-State Policy-Gradient Methods for POMDPs
- Scaling RL to Long Videos
- Scaling Synthetic Task Generation for Agents via Exploration
- Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- Seek to Segment: Active Perception for Panoramic Referring Segmentation
- Selective Test-Time Debiasing for CLIP via Reward Gating
- Self-Challenging Language Model Agents
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents
- Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- Solving Continuous Mean Field Games: Deep Reinforcement Learning for Non-Stationary Dynamics
- Solvita: Enhancing Large Language Models for Competitive Programming via Agentic Evolution
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- Stackelberg Learning with Outcome-based Payment
- State Representation Matters in Deep Reinforcement Learning: Application to Energy Trading
- StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models
- Stronger-MAS: Multi-Agent Reinforcement Learning for Collaborative LLMs
- Supersede: Diagnosing and Training the Memory-Update Gap in LLM Agents
- Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- TREK: Distill to Explore, Reinforce to Refine
- Talking Points: Describing and Localizing Pixels
- Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
- TaskCraft: Automated Generation of Agentic Tasks
- Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
- The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
- The World Is Bigger! A Computationally-Embedded Perspective on the Big World Hypothesis
- Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- ToolRL: Reward is All Tool Learning Needs
- ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
- Toward Efficient Exploration by Large Language Model Agents
- Toward Training Superintelligent Software Agents through Self-Play SWE-RL
- Toward Virtuous Reinforcement Learning: A Critique and Roadmap
- Towards Principled Unsupervised Multi-Agent Reinforcement Learning
- Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
- Tree Search for LLM Agent Reinforcement Learning
- UI-Ins: Enhancing GUI Grounding with Multi-Perspective Instruction as Reasoning
- UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
- UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Understanding and Improving Hyperbolic Deep Reinforcement Learning
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Unlocking Long-Horizon Agentic Search with Large-Scale End-to-End RL
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unlocking the Power of Multi-Agent LLM for Reasoning: From Lazy Agents to Deliberation
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
- Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
- WebDancer: Towards Autonomous Information Seeking Agency
- WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
- WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- What Can RL Bring to VLA Generalization? An Empirical Study
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- When Does Continual Learning Require Learning
- When Does Muon Help Agentic Reinforcement Learning?
- When Greedy Wins: Emergent Exploitation Bias in Meta-Bandit LLM Training
- Where Do CoT Training Gains Land in LLM based Agents?
- WorkDrive: Roadwork Chain of Causation for Autonomous Driving
- World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
- Xiaomi-GUI-0 Technical Report
- Xiaomi-GUI-0 Technical Report
- Youtu-Agent: Scaling Agent Productivity with Automated Generation and Hybrid Policy Optimization
- Zero-Shot Instruction Following in RL via Structured LTL Representations
- rSIM: Incentivizing Reasoning Capabilities of LLMs via Reinforced Strategy Injection
retrieval-augmented-generation¶
- A superpersuasive autonomous policy debating system
- A superpersuasive autonomous policy debating system
- A-Mem: Agentic Memory for LLM Agents
- A-TMA: Decoupling State-Aware Memory Failures in Long-Term Agent Memory
- AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
- ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization
- Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
- Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search
- Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- CAM: A Constructivist View of Agentic Memory for LLM-Based Reading Comprehension
- CLAUSE: Agentic Neuro-Symbolic Knowledge Graph Reasoning via Dynamic Learnable Context Engineering
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- Compress & Cache: Vision token compression for efficient generation and retrieval
- ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair
- DeepStress: Stress-Testing Deep Search Agents
- Demystifying Deep Search: A Holistic Evaluation with Hint-free Multi-Hop Questions and Factorised Metrics
- DiscoVerse: Multi-Agent Pharmaceutical Co-Scientist for Traceable Drug Discovery and Reverse Translation
- DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
- Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
- EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory
- Exploratory and Assimilating Reflection: Reflective Recall Cycle for Long-term Memory
- Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models
- GRASP: GRanularity-Aware Search Policy for Agentic RAG
- HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- IPO Finance Agent: Evaluation of LLM Financial Analysts beyond Finance Agent v2, with Automated Rubric Generation -- the Case of the SpaceX (SPCX) IPO
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
- Is Grep All You Need? How Agent Harnesses Reshape Agentic Search
- Is Progressive Disclosure All You Need for Long-Context Agents?
- JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
- Lean Refactor: Multi-Objective Controllable Proof Optimization via Agentic Strategy Search
- Lessons Learned: A Multi-Agent Framework for Code LLMs to Learn and Improve
- Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory
- Log-Augmented Generation: Scaling Test-Time Reasoning with Reusable Computation
- LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making
- Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MARCH: Evaluating the Intersection of Ambiguity Interpretation and Multi-hop Inference
- MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA
- MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection
- MINDS: A Cross-cultural Dialogue Corpus for Social Norm Classification and Adherence Detection
- MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
- MOSAIC: Modular Orchestration for Structured Agentic Intelligence and Composition
- Memory Depth, Not Memory Access: Selective Parametric Consolidation for Long-Running Language Agents
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents
- Memory is Reconstructed, Not Retrieved: Graph Memory for LLM Agents
- MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MuMuTestUp: Mutation-based Multi-Agent Test Case Update
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning
- Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- ProjAgent: Procedural Similarity Retrieval for Repository-Level Code Generation
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- RadAgents: Multimodal Agentic Reasoning for Chest X-ray Interpretation with Radiologist-like Workflows
- Retro*: Optimizing LLMs for Reasoning-Intensive Document Retrieval
- Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation
- Search Self-Play: Pushing the Frontier of Agent Capability without Supervision
- Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
- StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description
- Supra Cognitive Modes: A Routed Architecture for Agent Memory
- Track, Rank, Crack: Epistemic Working Memory Scales Multi-Hop Reasoning in Language Agents
- VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation
- VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- VideoSearch-R1: Iterative Video Retrieval and Reasoning via Soft Query Refinement
- When Classic Cache Policies Fail: Learning-Augmented Replacement for Semantic Retrieval Buffers
- Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?
- WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
robot-manipulation¶
- 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Automating the Design of Embodied AgentArchitectures
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- Conditioning Matters: Training Diffusion Policies is Faster Than You Think
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
- FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
- Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
- From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- GROW$^2$: Grounding Which and Where for Robot Tool Use
- GauDP: Reinventing Multi-Agent Collaboration through Gaussian-Image Synergy in Diffusion Policies
- Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation
- Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
- Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
- RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization
- RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks
- Real-Time Execution of Action Chunking Flow Policies
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
- SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
- Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
- Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process
- VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
robustness¶
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- A Near-optimal, Scalable and Parallelizable Framework for Stochastic Bandits Robust to Adversarial Corruptions and Beyond
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- Agents in the Wild: Where Research Meets Deployment
- Aloe-Vision: Robust Vision-Language Models for Healthcare
- Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
- AutoRAS: Learning Robust Agentic Systems with Primitive Representations
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
- Bilateral Information-aware Test-time Adaptation for Vision-Language Models
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- Confidence-Aware Tool Orchestration for Robust Video Understanding
- Continuous Soft Actor-Critic: An Off-Policy Learning Method Robust to Time Discretization
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
- DeepStress: Stress-Testing Deep Search Agents
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
- Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
- ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
- Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs
- Empirical Study on Robustness and Resilience in Cooperative Multi-Agent Reinforcement Learning
- Engineering Trustworthy Agentic AI for Critical Systems
- Enhancing Robustness of Offline Reinforcement Learning Under Data Corruption via Sharpness-Aware Minimization
- Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
- Forecasting in Offline Reinforcement Learning for Non-stationary Environments
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- Goal-Aware Identification and Rectification of Misinformation in Multi-Agent Systems
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
- Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge
- MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- Measuring and Mitigating Rapport Bias of Large Language Models under Multi-Agent Social Interactions
- MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
- Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- Multi-Agent Reinforcement Learning with Communication-Constrained Priors
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
- Optimal Welfare in Noncooperative Network Formation under Attack
- Rainbow Delay Compensation: A Multi-Agent Reinforcement Learning Framework for Mitigating Observation Delays
- Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
- Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
- Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
- Stealthy World Model Manipulation via Data Poisoning
- Stop Wasting Your Tokens: Towards Efficient Runtime Multi-Agent Systems
- TAI3: Testing Agent Integrity in Interpreting User Intent
- TRAP: Targeted Redirecting of Agentic Preferences
- TRAP: Targeted Redirecting of Agentic Preferences
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models
- Test-Time Training for Modality Order Consistency in Vision-Language Models
- The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
- Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- Trace-Level Analysis of Information Contamination in Multi-Agent Systems
- When Agents “Misremember” Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
safety¶
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- A New Framework for Cybersecurity Refusals in AI Agents
- A Safety and Security Framework for Real-World Agentic Systems
- ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- AgentBreeder: Mitigating the AI Safety Risks of Multi-Agent Scaffolds via Self-Improvement
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Agentic Abstention: Do Agents Know When to Stop Instead of Act?
- Aligning Machiavellian Agents: Behavior Steering via Test-Time Policy Shaping
- AprielGuard
- Auditing Agent Harness Safety
- BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems
- Benchmarking Web Agent Safety under E-commerce Deceptive Interfaces
- Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-Codex
- Best-of-N Jailbreaking
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
- CARVE: Certified Affordable Repair of Vetoed Maneuvers via Envelopes for Interactive Driving
- CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
- CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D
- Certifying Deep Network Risks and Individual Predictions with PAC-Bayes Loss via Localized Priors
- Control Tax: The Price of Keeping AI in Check
- Counterfactual Evaluation Reveals Hidden Capability Profiles in Clinical LLMs and Agents
- Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models
- Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection
- Do Large Language Models Know What They Are Capable Of?
- EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- Embeddings to Diagnosis: Latent Fragility under Agentic Perturbations in Clinical LLMs
- Engineering Trustworthy Agentic AI for Critical Systems
- Executable Governance for AI: Translating Policies into Rules Using LLMs
- Expressive Temporal Specifications for Reward Monitoring
- Factor(U,T): Controlling Untrusted AI by Monitoring their Plans
- Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution
- Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning
- From ``Sure" to ``Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons
- GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling
- GitLake: Git-for-data for the agentic lakehouse
- GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems
- How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
- Human-Guided Harm Recovery for Computer Use Agents
- Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions
- Jailbreaking Frontier Foundation Models Through Intention Deception
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG
- Many LLMs Are More Utilitarian Than One
- Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
- Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
- Multi-modal Rail Crossing Safety Analysis
- Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- Near-Miss: Latent Policy Failure Detection in Agentic Workflows
- On the Regulatory Potential of User Interfaces for AI Agent Governance
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control
- PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
- Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
- Reliable Weak-to-Strong Monitoring of LLM Agents
- Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
- Risk-Sensitive Agent Compositions
- Risk-Sensitive Agent Compositions
- Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
- SafeMIL: Learning Offline Safe Imitation Policy from Non-Preferred Trajectories
- SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
- SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
- Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action
- Toward Safe and Human-Aligned Game Conversational Recommendation via Multi-Agent Decomposition
- Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security
- TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models
- Understanding and Rectifying Safety Perception Distortion in VLMs
- VLMs can Aggregate Scattered Training Patches
- WOLF: Werewolf-based Observations for LLM Deception and Falsehoods
- When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games
- When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems
- When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space
- Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems
- Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
security¶
- A Deterministic Control Plane for LLM Coding Agents
- A Safety and Security Framework for Real-World Agentic Systems
- A Security Analysis of the OpenClaw AI Agent Framework
- A2ASecBench: A Protocol-Aware Security Benchmark for Agent-to-Agent Multi-Agent Systems
- ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
- Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security
- Agent Data Injection Attacks are Realistic Threats to AI Agents
- AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs
- Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response
- AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents
- Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
- BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- Benchmarking Autonomous Agents against Temporal, Spatial, and Semantic Evasions
- Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems
- Breaking and Fixing Defenses Against Control Flow Hijacking in Multi-Agent Systems
- Chai: Agentic Discovery of Cryptographic Misuse Vulnerabilities
- Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems
- Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents
- Data Leakage Prevention in Agentic Applications via Preemptive Hardening
- Empirical Software Engineering TerraProbe: A Layered-Oracle Framework for Detecting Deceptive Fixes in LLM-Assisted Terraform
- FHE-Coder: Benchmarking Secure Agentic Code Generation for Fully Homomorphic Encryption
- From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
- KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents
- LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models
- Lessons from Penetration Tests on Large-Scale Agent Systems
- Malaika: Understanding Malware through Tri-Grounded Agentic Reasoning
- Memory Injection Attacks on LLM Agents via Query-Only Interaction
- PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents
- Prismata: Confining Cross-Site Prompt Injection in Web Agents
- Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents
- Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
- SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents
- Steerability via constraints: a substrate for scalable oversight of coding agents
- TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories
- Temporary Authority, Permanent Effects: Commit-Time Authorization for LLM Agents
- The Balkanization of Execution-Security Research for AI Coding Agents: Isolation, Access Control, and Time-of-Check-to-Time-of-Use Vulnerabilities
- The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
- Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs
- Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks
- Untrusted Content Masking for Web Agents with Security Guarantees
- Veritas: A Semantically Grounded Agentic Framework for Memory Corruption Vulnerability Detection in Binaries
- VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
- When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems
- When Claws Remember but Do Not Tell: Stealthy Memory Injection in Persistent Personal Agents
- Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents
- Why Trust Your Agent? Empirical Security Gains from TRiSM-Guided Agentic Workflows in Healthcare
- With Great Capabilities Come Great Responsibilities: Introducing the Agentic Risk & Capability Framework for Governing Agentic AI Systems
software-engineering¶
- 3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse
- Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
- Aleena: Alignment Agent for Research Software Engineering Collaborations
- Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering
- An Empirical Study of Agent Developer Practices in AI Agent Frameworks
- BOAD: Discovering Hierarchical Software Engineering Agents via Bandit Optimization
- BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge
- Code Graph Model (CGM): A Graph-Integrated Large Language Model for Repository-Level Software Engineering Tasks
- CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation
- Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS
- DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks
- Early Adoption of Agentic Coding Tools by GitHub Projects
- EffiSkill: Agent Skill Based Automated Code Efficiency Optimization
- End-to-End Automated Logging via Multi-Agent Framework
- EnvBench: A Benchmark for Automated Environment Setup
- EvoClaw: Evaluating AI Agents on Continuous Software Evolution
- Failure as a Process: An Anatomy of CLI Coding Agent Trajectories
- From Assistant to Independent Developer — Are GPTs Ready for Software Development?
- From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality
- Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software
- How and Why Agents Can Identify Bug-Introducing Commits
- InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
- Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills
- IntentTester: Intent-Driven Multi-agent Framework for Cross-Library Test Migration
- IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
- KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant
- Kimi-Dev: Agentless Training as Skill Prior for SWE-agents
- Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?
- MaintainCoder: Maintainable Code Generation Under Dynamic Requirements
- Measuring AI Ability to Complete Long Software Tasks
- MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair
- MicroAgent: Context-Augmented Multi-Agent Framework for Automatic Microservice Decomposition
- MuMuTestUp: Mutation-based Multi-Agent Test Case Update
- Multi-Docker-Eval: A `Shovel of the Gold Rush' Benchmark on Automatic Environment Building for Software Engineering
- NOMAD: A Multi-Agent LLM System for UML Class Diagram Generation from Natural Language Requirements
- On the risk of coding before testing: An empirical study on LLM-based test generation workflow
- Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents
- Prompt Coverage Adequacy
- RAT: RunAnyThing via Fully Automated Environment Configuration
- ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks
- SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
- SWE-INTERACT: Reimagining SWE Benchmarks as User-Driven Long-Horizon Coding Sessions
- SWE-QA: Can Language Models Answer Repository-level Code Questions?
- SWERank: Software Issue Localization with Code Ranking
- Skillware: A Software Ontology and Engineering Lifecycle for Persistent Behavioral Artifacts
- Steerability via constraints: a substrate for scalable oversight of coding agents
- TRIM: Reducing AI-Generated CodeSlop via Agent Trajectory Minimization
- The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE
- The Spec Growth Engine: Spec-Anchored, Code-Coupled, Drift-Enforced Architecture for AI-Assisted Software Development
- Toward Training Superintelligent Software Agents through Self-Play SWE-RL
- Towards Iterative End-to-End Software Development: A Feature-Driven Multi-Agent Framework
- Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution
spatial-reasoning¶
- 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
- A Deep Learning Model of Mental Rotation Informed by Interactive VR Experiments
- APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
- AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- Caption This, Reason That: VLMs Caught in the Middle
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?
- Co-Layout: LLM-driven Co-optimization for Interior Layout
- DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
- Decomposition of Concept-Level Rules in Visual Scenes
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
- Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
- GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
- Grounded 3D-Aware Spatial Vision-Language Modeling
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
- Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams
- LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- Learning Multi-View Spatial Reasoning from Cross-View Relations
- Learning Spatial-Aware Manipulation Ordering
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation
- Locality Alignment Improves Vision-Language Models
- MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Models
- MentalThink: Shaping Thoughts in Mental SVG World
- MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Pursuing Minimal Sufficiency in Spatial Reasoning
- ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- Robust Cross-modal Alignment Learning for Cross-Scene Spatial Reasoning and Grounding
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
- ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models
- SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
- Seek to Segment: Active Perception for Panoramic Referring Segmentation
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
- Sketch2Diagram: Generating Vector Diagrams from Hand-Drawn Sketches
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- SpatialLM: Training Large Language Models for Structured Indoor Modeling
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding
- Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
- Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
- Uncertainty-Aware Gaussian Map for Vision-Language Navigation
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models
- Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs
- Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models
- WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
- Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
synthetic-data¶
- Aegis: Automated Error Generation and Attribution for Multi-Agent Systems
- AgentSynth: Scalable Task Generation for Generalist Computer-Use Agents
- AprielGuard
- Building a Foundational Guardrail for General Agentic Systems via Synthetic Data
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
- Collaborative Reasoner: Self-Improving Social Agents with Synthetic Conversations
- Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost
- Dataset Distillation by Influence Matching
- Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection
- Discovering Novel LLM Experts via Task-Capability Coevolution
- Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
- Facilitating Long Context Understanding via Supervised Chain-of-Thought Reasoning
- Fathom-DeepResearch: Unlocking Long Horizon Information Retrieval and Synthesis for SLMs
- Formal Disco: Scalable Open-Ended Generation of Formally Verified Programs
- Free Lunch in Medical Image Foundation Model Pre-training via Randomized Synthesis and Disentanglement
- From Medical Records to Diagnostic Dialogues: A Clinical-Grounded Approach and Dataset for Psychiatric Comorbidity
- Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination
- Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Graphs Help Graphs: Multi-Agent Graph Socialized Learning
- HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety
- LexChronos: An Agentic Framework for Structured Event Timeline Extraction in Indian Jurisprudence
- MASTER: Enhancing Large Language Model via Multi-Agent Simulated Teaching
- Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
- MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- MoodAngels: A Retrieval-augmented Multi-agent Framework for Psychiatry Diagnosis
- Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology
- Operation Veja: Fixing Fundamental Concepts Missing from Modern Roleplaying Training Paradigms
- PAACE: A Plan-Aware Automated Agent Context Engineering Framework
- RELICT: A Replica Detection Framework for Medical Image Generation
- ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
- Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
- S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models
- SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
- Scaling Agent Learning via Experience Synthesis
- Scaling Generalist Data-Analytic Agents
- Scaling Synthetic Task Generation for Agents via Exploration
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- TaskCraft: Automated Generation of Agentic Tasks
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- Tell Me: An LLM-powered Mental Well-being Assistant with RAG, Synthetic Dialogue Generation, and Agentic Planning
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
- ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications
- Towards Self-Refinement of Vision-Language Models with Triangular Consistency
- Video Generation Models are General-Purpose Vision Learners
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
tool-use¶
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Benchmark for Deep Information Synthesis
- A Declarative Language for Building And Orchestrating LLM-Powered Agent Workflows
- A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
- A Modular Reference Architecture for MCP-Servers Enabling Agentic BIM Interaction
- A Multi-Agent LLM Framework for Multi-Domain Low-Resource In-Context NER via Knowledge Retrieval, Disambiguation and Reflective Analysis
- A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases
- A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning
- A$^{2}$utoLPBench: An Auto-Generated, Agent-Friendly LP Benchmark via Inverse-KKT Construction
- ACCORD: Action-Conditioned Contextual Grounding for Language Agents
- AI Economist Agent: An Agentic Framework for Model-Grounded Economic Analysis with RAG, Knowledge Graphs, and Large Language Models
- AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery
- AMS-IO-Bench and AMS-IO-Agent: Benchmarking and Structured Reasoning for Analog and Mixed-Signal Integrated Circuit Input/Output Design
- AOHP: An Open-Source OS-Level Agent Harness for Personalized, Efficient and Secure Interaction
- APOLLO: Automated LLM and Lean Collaboration for Advanced Formal Reasoning
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- ATLAS: Constraints-Aware Multi-Agent Collaboration for Real-World Travel Planning
- Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning
- Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- Agent Data Injection Attacks are Realistic Threats to AI Agents
- Agent Data Protocol: Unifying Datasets for Diverse, Effective Fine-tuning of LLM Agents
- Agent WARPP: Workflow Adherence via Runtime Parallel Personalization
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- AgentAbstain: Do LLM Agents Know When Not to Act?
- AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities
- AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments
- AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent
- AgentSUMO: An Agentic Framework for Interactive Simulation Scenario Generation in SUMO via Large Language Models
- AgentTrails: Towards Trust and Reuse for Agentic Tasks
- Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting
- Agentic Data Environments
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- Agentic Reinforced Policy Optimization
- Agentic-Ideation: Sample Efficient Agentic Trajectories Synthesis for Scientific Ideation Agents
- AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization
- Agents on a Tree: Pathwise Coordination for Multi-Objective Molecular Optimization
- AlphaAgentEvo: Evolution-Oriented Alpha Mining via Self-Evolving Agentic Reinforcement Learning
- An LLM-enabled Multi-Agent Autonomous Mechatronics Design Framework
- AnaFlow: Agentic LLM-based Workflow for Reasoning-Driven Explainable and Sample-Efficient Analog Circuit Sizing
- Analytica: Soft Propositional Reasoning for Robust and Scalable LLM-Driven Analysis
- AnovaX: A Local, Multi-Agent Voice Assistant with LLM Planning, Typed Executors, and Adaptive Recovery
- ArbiGraph: Arbitrarily Scalable Verifiable Task Graphs for Evaluating Context Management
- Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite
- Atomic Task Graph: A Unified Framework for Agentic Planning and Execution
- Attention as Binding: A Vector-Symbolic Perspective on Transformer Reasoning
- Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools
- AutoData: A Multi-Agent System for Open Web Data Collection
- AutoLink: Autonomous Schema Exploration and Expansion for Scalable Schema Linking in Text-to-SQL at Scale
- AutoSynthesis: An agentic system for automated meta-analysis
- AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints
- AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning
- AutoTool: Efficient Tool Selection for Large Language Model Agents
- Autoformalizing Memory Specifications with Agents
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- Automating Complex Document Workflows via Stepwise and Rollback-Enabled Operation Orchestration
- BIRD-INTERACT: Re-imagining Text-to-SQL Evaluation via Lens of Dynamic Interactions
- BOHM: Zero-Cost Hierarchical Attribution for Compound AI Systems
- Behavioral Controllability of Agentic Models for Information Extraction: From Fixed Workflows to Reflective Agents
- Benchmarking LLM Tool-Use in the Wild
- Beyond GeneGPT: A Multi-Agent Architecture with Open-Source LLMs for Enhanced Genomic Question Answering
- Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
- Beyond Static Endpoints: Tool Programs as an Interface for Flexible Agentic Web Services
- Beyond Static Evaluation: Building Simulation Environments for Scalable Agentic Reinforcement Learning
- Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
- Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents
- BiasBusters: Uncovering and Mitigating Tool Selection Bias in Large Language Models
- Bibby AI: An Editor-Native Agentic Platform for Academic Research, Writing, and Publishing
- BioSecBench-Surveillance: A Verifiable Benchmark for AI Agents in Pathogen Genomic Surveillance
- Boundary-Aware Context Grounding for A Low-Channel EEG Agent
- BrainAgent: A Large Language Model-Driven Multi-Agent Framework for Autonomous Brain Signal Understanding
- Bringing Agentic Search to Earth Observation Data Discovery
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CASCADE: Cumulative Agentic Skill Creation through Autonomous Development and Evolution
- CAVA: Canonical Action Verification and Attestation for Runtime Governance of Agentic AI Systems
- COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows
- CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications
- Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agents
- CausalSteward: An Agentic Divide-Conquer-Combine Copilot for Causal Discovery
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- CellAgent: LLM-Driven Multi-Agent Framework for Natural Language-Based Single-Cell Analysis
- CoDA: Agentic Systems for Collaborative Data Visualization
- Compile, Then Page: Executable SOP Programs and a Capability-Gated Runtime for Procedural LLM Agents
- Compiler-R1: Towards Agentic Compiler Auto-tuning with Reinforcement Learning
- Computer Agent Arena: Toward Human-Centric Evaluation and Analysis of Computer-Use Agents
- Confidence-Aware Tool Orchestration for Robust Video Understanding
- Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases
- Content-Based Smart E-Mail Dispatcher Using Large Language Models
- ContextAgent: Context-Aware Proactive LLM Agents with Open-world Sensory Perceptions
- ContextNav: Towards Agentic Multimodal In-Context Learning
- ContextNav: Towards Agentic Multimodal In-Context Learning
- Controlling Tool Use with Heading-Specific Activation Steering
- Crayotter: Traceable Multi-Agent Workflows for Long-Form Video Editing
- Crucible: Quantifying the Potential of Control Algorithms through LLM Agents
- CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
- DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents
- DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
- Data Leakage Prevention in Agentic Applications via Preemptive Hardening
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines
- Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark
- Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
- DeepEvidence: Empowering Biomedical Discovery with Deep Knowledge Graph Research
- DeepEyesV2: Toward Agentic Multimodal Model
- DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment
- DefenderBench: A Toolkit for Evaluating Language Agents in Cybersecurity Environments
- Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillation
- Distilling LLM Agent into Small Models with Retrieval and Code Tools
- Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution
- DynaMate: An Autonomous Agent for Protein-Ligand Molecular Dynamics Simulations
- EGG: An Expert-Guided Agent Framework for Kernel Generation
- Earth-Agent: Unlocking the Full Landscape of Earth Observation with Agents
- Eigen-Agent: Adaptive Multi-Agent Scientific Reasoning with Monitor-Based RAG
- Empowering LLM Tool Invocation with Tool-call Reward Model
- Energy per Successful Goal: Goal-Level Energy Accounting for Agentic AI Systems
- EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design
- Enhancing Demand-Oriented Regionalization with Agentic AI and Local Heterogeneous Data for Adaptation Planning
- Evidence-Grounded Verified Agentic Reasoning: A Path Toward Eliminating LLM Hallucination in Empirical Inference via Tool-Attested Kernel Proofs
- Expanding the Capability Frontier of LLM Agents with ZPD-Guided Data Synthesis
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FHE-Agent: Automating CKKS Configuration for Practical Encrypted Inference via an LLM-Guided Agentic Framework
- Fault-Tolerant Sandboxing for AI Coding Agents: A Transactional Approach to Safe Autonomous Execution
- Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows
- FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?
- From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents
- From Passive Retrieval to Active Memory Navigation: Learning to Use Memory as a Structured Action Space
- From What to Why: A Multi-Agent System for Evidence-based Chemical Reaction Condition Reasoning
- Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models
- GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
- GEM: A Gym for Generalist LLMs
- GLM-5V-Turbo: Toward a Native Foundation Model for Multimodal Agents
- GRASP: GRanularity-Aware Search Policy for Agentic RAG
- GROW$^2$: Grounding Which and Where for Robot Tool Use
- GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Generalizable End-to-End Tool-Use RL with Synthetic CodeGym
- Generative Caching for Structurally Similar Prompts and Responses
- GitLake: Git-for-data for the agentic lakehouse
- GuardianAgentBench: Where Agents Fail and How to Guard Them
- Guava: An Effective and Universal Harness for Embodied Manipulation
- Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows
- HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents
- HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization
- HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation
- Hilbert: Recursively Building Formal Proofs with Informal Reasoning
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing
- ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- IR-Agent: Expert-Inspired LLM Agents for Structure Elucidation from Infrared Spectra
- In-the-Flow Agentic System Optimization for Effective Planning and Tool Use
- InfoMosaic-Bench: Evaluating Multi-Source Information Seeking in Tool-Augmented Agents
- Intelligent Human-Machine Partnership for Manufacturing: Enhancing Warehouse Planning through Simulation-Driven Knowledge Graphs and LLM Collaboration
- Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval
- Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions
- Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers
- Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
- Jupiter: Enhancing LLM Data Analysis Capabilities via Notebook and Inference-Time Value-Guided Search
- KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents
- Keyword search is all you need: Achieving RAG-Level Performance without vector databases using agentic tool use
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- Large language model agents accelerate inverse design of metal-organic frameworks for gas separation
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models
- Learning to Refine: An Agentic RL Approach for Iterative SPARQL Query Construction
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- Lessons from Penetration Tests on Large-Scale Agent Systems
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- LocalSearchBench: Benchmarking Agentic Search in Real-World Local Life Services
- Localizing RL-Induced Tool Use to a Single Crosscoder Feature
- LongVideoAgent: Multi-Agent Reasoning with Long Videos
- MCP Security Bench (MSB): Benchmarking Attacks Against Model Context Protocol in LLM Agents
- MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers
- MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers
- MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers
- MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology
- MUSE-Autoskill: Self-Evolving Agents via Skill Creation, Memory, Management, and Evaluation
- Mako: A Self-Evolving Agentic Operating System (SE-AOS) for Autonomous Web Exploitation
- Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow
- MedAgentGym: A Scalable Agentic Training Environment for Code-Centric Reasoning in Biomedical Data Science
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MetaAgent: Automatically Constructing Multi-Agent Systems Based on Finite State Machines
- MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling
- Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
- Multi-Turn On-Policy Distillation with Prefix Replay
- Multimodal Policy Internalization for Conversational Agents
- NVIDIA-labs OO Agents: Native Python Object-Oriented Agents
- NeuraDock Visual Cognitive Load Agent Tutorial: A Quality-Gated Open-Source EEG Workflow for Alpha Dynamics and Real-Time Applications
- NewtonBench: Benchmarking Generalizable Scientific Law Discovery in LLM Agents
- Nex-N1: Agentic Models Trained via a Unified Ecosystem for Large-Scale Environment Construction
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios
- OpenAgentSafety: A Comprehensive Framework For Evaluating Real-World AI Agent Safety
- OpenForgeRL: Train Harness-native Agents in Any Environment
- Orchestrating Power Grid Studies with Multi-Agent AI and MCP Servers
- OrchestrationBench: LLM-Driven Agentic Planning and Tool Use in Multi-Domain Scenarios
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- PExA: Parallel Exploration Agent for Complex Text-to-SQL
- PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue
- PRInTS: Reward Modeling for Long-Horizon Information Seeking
- PalmClaw: A Native On-Device Agent Framework for Mobile Phones
- PalmClaw: A Native On-Device Agent Framework for Mobile Phones
- PhyScensis: Physics-Augmented LLM Agents for Complex Physical Scene Arrangement
- PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents
- PolySkill: Learning Generalizable Skills Through Polymorphic Abstraction For Continual Learning
- Predicting LLM Safety Before Release by Simulating Deployment
- ProMSA:Progressive Multimodal Search Agents for Knowledge-Based Visual Question Answering
- ProofCouncil: An LLM Agent for Solving Open Mathematical Problems
- PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach
- Prune4Web: DOM Tree Pruning Programming for Web Agent
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recovery
- Re-Aligning Language to Visual Objects with an Agentic Workflow
- ReCUBE: Evaluating Repository-Level Context Utilization in Code Generation
- ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- ReTool: Reinforcement Learning for Strategic Tool Use in LLMs
- Reason-Plan-ReAct: A Reasoner-Planner Supervising a ReAct Executor for Complex Enterprise Tasks
- Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
- Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study
- Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- RepoMaster: Autonomous Exploration and Understanding of GitHub Repositories for Complex Task Solving
- RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- ResiliBench: Evaluating Agentic Workflow Adaptation in Stochastic Environments
- Retro-R1: LLM-based Agentic Retrosynthesis
- RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- SAFARI: Scaling Long Horizon Agentic Fault Attribution via Active Investigation
- SAGA: Scene-Aware, Goal-Evolving Agents for Long-Horizon CivRealm Strategy Planning
- SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation
- SEARL: Joint Optimization of Policy and Tool Graph Memory for Self-Evolving Agents
- SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models
- SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- SR-Scientist: Scientific Equation Discovery With Agentic AI
- STARK: Strategic Team of Agents for Refining Kernels
- STRATUS: A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds
- Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification
- SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do
- Same Payload, Different Channel: Measuring Trust Asymmetry in Tool-Using Language Models
- Scalable LLM Agent Tool Access in the Cloud
- Scaling Agents via Continual Pre-training
- SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
- Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming
- Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- Self-Challenging Language Model Agents
- Self-Improvements in Modern Agentic Systems: A Survey
- Set-shifting Behavioral Test for Harnessed Agents
- Set-shifting Behavioral Test for Harnessed Agents
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- ShapeCraft: LLM Agents for Structured, Textured and Interactive 3D Modeling
- Shared Selective Persistent Memory for Agentic LLM Systems
- SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning
- SkillSight: Seeing Through Shared Descriptions for Accurate Skill Retrieval
- SoMe: A Realistic Benchmark for LLM-based Social Media Agents
- SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence
- Speculative Actions: A Lossless Framework for Faster AI Agents
- StatABench: Dataset and Framework for Evaluating Statistical Analysis Capabilities of LLMs
- Steering Large Language Models between Code Execution and Textual Reasoning
- StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows
- Structured Output Collapses Answer Diversity Across 44 Language Models
- Survey on Evaluation of LLM-based Agents
- TACO: Tool-Augmented Credit Optimization for Agentic Tool Use
- TAI3: Testing Agent Integrity in Interpreting User Intent
- TIM-PRM: Verifying multimodal reasoning with Tool-Integrated PRM
- TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use
- TUMIX: Multi-Agent Test-Time Scaling with Tool-Use Mixture
- TaskCraft: Automated Generation of Agentic Tasks
- The Amazing Agent Race: Strong Tool Users, Weak Navigators
- The Containment Gap: How Deployed Agentic AI Frameworks Fail Public-Facing Safety Requirements
- The Deterministic Horizon: When Extended Reasoning Fails and Tool Delegation Becomes Necessary
- The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
- The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications
- The Surface You Test Is Not the Surface That Breaks
- Think in English, Answer in Korean: Efficient Adaptation of Multilingual Tool-Using Agents
- Token Reduction Is Not Cost Reduction
- Token-Flow Firewall: Semantic Runtime Auditing for Persistent AI Agents
- Tool Attention Is All You Need: Dynamic Tool Gating and Lazy Schema Loading for Eliminating the MCP/Tools Tax in Scalable Agentic Workflows
- ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction
- ToolGrad: Efficient Tool-use Dataset Generation with Textual "Gradients"
- ToolMind Technical Report: A Large-Scale, Reasoning-Enhanced Tool-Use Dataset
- ToolPrivacyBench: Benchmarking Purpose-Bound Privacy in Tool-Using LLM Agents
- ToolRL: Reward is All Tool Learning Needs
- ToolTree: Efficient LLM Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning
- ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
- ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models
- Tools are under-documented: Simple Document Expansion Boosts Tool Retrieval
- TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- Towards Agentic Investigation of Security Alerts
- Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
- Towards Reliable Benchmarking: A Contamination Free, Controllable Evaluation Framework for Multi-step LLM Function Calling
- Traceable Fault Diagnosis for Battery Energy Storage Systems via Retrieval-Augmented Multi-Agent O&M Assistant
- Training Language Models to Use Prolog as a Tool
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- TrajAgent: An LLM-Agent Framework for Trajectory Modeling via Large-and-Small Model Collaboration
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking
- UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp
- Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports
- Unlocking Long-Horizon Agentic Search with Large-Scale End-to-End RL
- VICoT-Agent: A Vision-Interleaved Chain-of-Thought Framework for Interpretable Multimodal Reasoning and Scalable Remote Sensing Analysis
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents
- VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VitaBench: Benchmarking LLM Agents with Versatile Interactive Tasks in Real-world Applications
- Voice-Interactive Surgical Agent for Multimodal Patient Data Control
- VulnLLM-R: Specialized Reasoning LLM with Agent Scaffold for Vulnerability Detection
- WEQA: Wearable hEalth Question Answering with Query-Adaptive Agentic Reasoning
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
- WebDS: An End-to-End Benchmark for Web-based Data Science
- WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment
- WebSeer: Training Deeper Search Agents through Reinforcement Learning with Self-Reflection
- WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- When Does Tool Use Increase the Expressive Power of Finite-Precision Recurrent Models?
- When Refusals Fail: Unstable Safety Mechanisms in Long-Context LLM Agents
- WideSearch: Benchmarking Agentic Broad Info-Seeking
- WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
- Workflow as Knowledge: Semantic Persistence for LLM-Mediated Workflows
- Workflows vs Agents for Code Translation
- Workflows vs Agents for Code Translation
- Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents
- iOS as Acceleration
training-free¶
- A Training-Free Framework for Long Video Understanding via Video-Query-Options Similarity
- AMANDA: Agentic Medical Knowledge Augmentation for Data-Efficient Medical Visual Question Answering
- AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
- ActiveScope: Actively Seeking and Correcting Perception for MLLMs
- Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
- AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding
- CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations
- Closing the Feedback Loop: From Experience Extraction to Insight Governance in Verbal Reinforcement Learning
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- Conditional Representation Learning for Customized Tasks
- CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models
- Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification
- Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection
- Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding
- DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs
- Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- Each Complexity Deserves a Pruning Policy
- EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
- Enhancing Multi-Image Understanding through Delimiter Token Scaling
- FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments
- FOCUS: Efficient Keyframe Selection for Long Video Understanding
- FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
- GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt
- GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling
- GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
- Harnessing Textual Refusal Directions for Multimodal Safety
- Hierarchical Experimentalist Agents
- Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models
- Instance-Level Composed Image Retrieval
- InstructSAM: A Training-free Framework for Instruction-Oriented Remote Sensing Object Recognition
- Language-Assisted Feature Transformation for Anomaly Detection
- Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
- Med-LEGO: Editing and Adapting toward Generalist Medical Image Diagnosis
- Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
- Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement
- Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
- Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
- MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
- Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs
- No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer
- PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning
- Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
- Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
- QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
- RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation
- Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering
- SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
- SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
- Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation
- Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models
- See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs
- SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
- Seeing What’s Not There: Negation Understanding Needs More Than Training
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models
- Self-Prophetic Decoding to Unlock Visual Search in LVLMs
- SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories
- SkillSight: Seeing Through Shared Descriptions for Accurate Skill Retrieval
- Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models
- TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models
- Text to Sketch Generation with Multi-Styles
- Topology-Driven Transferability Estimation of Medical Foundation Models for Segmentation
- Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
- Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models
- Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
- Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild
- VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- Vision Transformers Don't Need Trained Registers
- Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs
- VocaDet: Sample-Driven Open-Vocabulary Object Detection and Segmentation via Visual Tokenization and Vector Database Retrieval
- WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
- WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
- Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
- ZARA: Training-Free Motion Time-Series Reasoning via Evidence-Grounded LLM Agents
video-understanding¶
- Aha! - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead
- Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction
- CaReBench: A Fine-grained Benchmark for Video Captioning and Retrieval
- ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning
- Confidence-Aware Tool Orchestration for Robust Video Understanding
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
- Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
- FOCUS: Efficient Keyframe Selection for Long Video Understanding
- Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation
- FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- GUI-Xplore: Empowering Generalizable GUI Agents with One Exploration
- Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression
- HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
- HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models
- HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios
- IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer
- IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- Is Your Video Language Model a Reliable Judge?
- JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
- MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
- MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Native Active Perception as Reasoning for Omni-Modal Understanding
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
- Perception Encoder: The best visual embeddings are not at the output of the network
- PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
- RAVEN: An Agentic Framework for Multimodal Entity Discovery from Large-Scale Video Collections
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
- Read the Room: Video Social Reasoning with Mental-Physical Causal Chains
- Revisiting Multimodal Positional Encoding in Vision–Language Models
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
- Seeing, Listening, Remembering, and Reasoning: A Multimodal Agent with Long-Term Memory
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video
- SportD: Can VLMs Physically Strategize?
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models
- Teaching Human Behavior Improves Content Understanding Abilities Of VLMs
- Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Unified Vision–Language Modeling via Concept Space Alignment
- Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
- Unleashing Vision-Language Semantics for Deepfake Video Detection
- V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
- Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
- Video = World + Event Stream
- Video Action Differencing
- Video Action Differencing
- Video Action Differencing
- VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- Vision Language Models are In-Context Value Learners
- Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
- What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
visual-grounding¶
- AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
- ActiveScope: Actively Seeking and Correcting Perception for MLLMs
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
- Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
- Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- CARE: Towards Clinical Accountability in Multi-Modal Medical Reasoning with an Evidence-Grounded Agentic Framework
- ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering
- Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
- CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models
- Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
- Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty
- Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
- From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA
- GAVEL: Grounded Caption Error Verification and Localization
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- GRIT: Teaching MLLMs to Think with Images
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- Grounded 3D-Aware Spatial Vision-Language Modeling
- Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
- Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
- HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
- How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
- Improving Vision-language Models with Perception-centric Process Reward Models
- Information-Regularized Attention for Visual-Centric Reasoning
- Interpretability Transfer from Language to Vision via Sparse Autoencoders
- K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
- LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
- Learning to Instruct for Visual Instruction Tuning
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence
- MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- Mind the Heads: Topological Representation Alignment for Multimodal LLMs
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement
- Mixture of Cognitive Experts in Large Vision-Language Models
- Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
- RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
- Revisiting Multimodal Positional Encoding in Vision–Language Models
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- Running the Gauntlet: Re-evaluating the Capabilities of Agents Beyond Familiar Environments
- SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
- Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology
- See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs
- SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
- Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- Talking Points: Describing and Localizing Pixels
- Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
- Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models
- VisCritic: Visual State Comparison as Process Reward for GUI Agents
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models
- Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
- Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding
visual-reasoning¶
- Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- An Exam for Active Observers
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
- DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION
- Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Grounded Reinforcement Learning for Visual Reasoning
- H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning
- Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
- Latent Chain-of-Thought for Visual Reasoning
- MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- No Labels, No Problem: Training Visual Reasoners with Multimodal Verifiers
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- ProxyThinker: Test-Time Guidance through Small Visual Reasoners
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
- SPyCE: Skill-Policy Co-evolution for Multimodal Agents
- Show Me Examples: Inferring Visual Concepts from Image Sets
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
- Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
- Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs
- lmgame-Bench: How Good are LLMs at Playing Games?
vla¶
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention
- Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- Advancing Omnimodal Embodied Agents from Isolated Skills to Everyday Physical Autonomy
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification
- Conditioning Matters: Training Diffusion Policies is Faster Than You Think
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- DiMaS: Distribution Matching for Steering Vision-Language-Action Models
- Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
- Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining
- Domain Arithmetic: One-Shot VLA Adaptation under Environmental Shifts
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
- Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
- Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
- EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models
- Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization
- FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
- Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs
- Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
- FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
- FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
- ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation
- Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
- FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency
- From Abstraction to Instantiation: Learning Behavioral Representation for Vision-Language-Action Model
- From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation
- HAMLET: Switch Your Vision-Language-Action Model into a History-Aware Policy
- Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation
- Human-assisted Robotic Policy Refinement via Action Preference Optimization
- Hybrid Training for Vision-Language-Action Models
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision
- Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better
- LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
- Learning Multi-View Spatial Reasoning from Cross-View Relations
- Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs
- Libra-VLA: Achieving Learning Equilibrium via Asynchronous Coarse-to-Fine Dual-System
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation
- Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models
- ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation
- Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
- On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Pelican-VLA 0.5: Attending Before Acting Benefits Generalization
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- PolicyTrim: Boosting Intrinsic Policy Efficiency of Vision-Language-Action Models
- Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History
- QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- Real-Time Execution of Action Chunking Flow Policies
- Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models
- Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- RoboTTT: Context Scaling for Robot Policies
- Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning
- Scaling up Memory for Robotic Control via Experience Retrieval
- See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
- Self-Improving Vision-Language-Action Models with Data Generation via Residual RL
- Semantic Anchoring for Robotic Action Representations
- Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
- The Moving Eye: Enhancing VLA Spatial Generalization via Hybrid Dynamic Data Collection
- Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
- Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots
- TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
- VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
- VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
- VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- VideoVLA: Video Generators Can Be Generalizable Robot Manipulators
- Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- What Can RL Bring to VLA Generalization? An Empirical Study
- WorldGym: World Model as An Environment for Policy Evaluation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories
- villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
vlm¶
- $AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning
- $\Delta \mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization
- 3D HAMSTER: Bridging Planning and Control in Hierarchical Vision Language Action Models through 3D Trajectory Guidance
- 3D Visual Illusion Depth Estimation
- 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation
- 3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism
- A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models
- A Training-Free Framework for Long Video Understanding via Video-Query-Options Similarity
- A VLM-Enhanced Framework for Comprehensive Traffic Sign Condition Assessment Integrating Daytime Visual Performance and Nighttime Retroreflectivity Evaluation
- A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory
- ABot-N1: Toward a General Visual Language Navigation Foundation Model
- AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
- AI Wizards at EXIST 2026: Hierarchical Soft-Label Learning for Multimodal Sexism Identification in Memes
- ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts
- APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts
- AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions
- ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
- ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
- ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications
- AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding
- AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
- Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation
- Actions as Language: Fine-Tuning VLMs into VLAs Without Catastrophic Forgetting
- Active Test-time Vision-Language Navigation
- ActiveScope: Actively Seeking and Correcting Perception for MLLMs
- ActiveVOO: Value of Observation Guided Active Knowledge Acquisition for Open-World Embodied Lifted Regression Planning
- AdPO: Enhancing the Adversarial Robustness of Large Vision-Language Models with Preference Optimization
- AdaBoosting Text Prompts for Vision-Language Models
- AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
- Adapting Foundation Vision-Language Models to Medical Diagnosis via Query-Driven Expert Bridging
- Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation
- Adaptive Logit Adjustment for Debiasing Multimodal Language Models
- AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
- AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials
- Agentic Jigsaw Interaction Learning for Enhancing Visual Perception and Reasoning in Vision-Language Models
- AgilePruner: An Empirical Study of Attention and Diversity for Adaptive Visual Token Pruning in Large Vision-Language Models
- Aha! - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead
- AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration
- AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models
- Align-Then-stEer: Adapting the Vision-Language Action Models through Unified Latent Guidance
- AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
- Aligning Visual Contrastive learning models via Preference Optimization
- Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow
- Aloe-Vision: Robust Vision-Language Models for Healthcare
- An Exam for Active Observers
- An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models
- An Intelligent-Cloud Edge Multimodal Interaction System for Robots
- Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
- Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
- AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
- Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation
- AnyGroundBench: A Specialized-Domain Benchmark for Video Grounding in Vision-Language Models
- Approximate Domain Unlearning for Vision-Language Models
- Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models
- Asking like Socrates: Socrates helps VLMs understand remote sensing images
- Assessing VLM Reliability for Medical Image Quality Evaluation Under Corruption and Bias
- Asynchronous Matching with Dynamic Sampling for Multimodal Dataset Distillation
- Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference
- Attention Without Grounding: Causal Evaluation of Visual Explanations in Medical VLMs
- Attention! Your Vision Language Model Could Be Maliciously Manipulated
- Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models
- Attention-Guided Saliency Maps for Interpreting Visualization Literacy in VLMs
- Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation
- Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval
- Attributes Should Come from Images, Not Class Names: Distribution-Conditioned Attribute Selection for Vision-Language Models
- Auditing Data Leakage in Whole-Slide Image Multimodal Benchmarks
- AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
- Automated Generation of Challenging Multiple-Choice Questions for Vision Language Model Evaluation
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- Automated Model Discovery via Multi-modal & Multi-step Pipeline
- Automating Potential-based Reward Shaping with Vision Language Model Guidance
- Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation
- AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation
- BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
- BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
- Be My Eyes: Extending Large Language Models to New Modalities Through Multi-Agent Collaboration
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
- Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- Best-of-N Jailbreaking
- Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging
- Beyond 3D VQAs: Injecting 3D Spatial Priors into Vision-Language Models for Enhanced Geometric Reasoning
- Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs
- Beyond Classification Accuracy: Neural-MedBench and the Need for Deeper Reasoning Benchmarks
- Beyond Greedy Exits: Improved Early Exit Decisions for Risk Control and Reliability
- Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis
- Beyond Shortcuts: Mitigating Visual Illusions in Frozen VLMs via Qualitative Reasoning
- Beyond Visual Forensics: Auditing Multimodal Robustness for Synthetic Medical Image Detection
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- Bilateral Information-aware Test-time Adaptation for Vision-Language Models
- BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning
- BioMedVR: Confusion-Aware Mixture-of-Prompt Experts for Biomedical Visual Reprogramming
- Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing
- Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models
- Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems
- Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies
- Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning
- Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning
- Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate
- Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops
- Bridging Interleaved Multi-Modal Reasoning as a Unified Decision Process
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment
- Bridging Vision and Language Concepts through Optimal Transport Semantic Flow
- Bridging the gap to real-world language-grounded visual concept learning
- Building a Precise Video Language with Human-AI Oversight
- CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
- CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows
- CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment
- CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
- CaReBench: A Fine-grained Benchmark for Video Captioning and Retrieval
- Can Experts Adapt Without Training? On Test-Time Modality Generalization in MVLMs
- Can We Talk Models Into Seeing the World Differently?
- Caption This, Reason That: VLMs Caught in the Middle
- Cat-PO: Cross-modal Adaptive Token-rewards for Preference Optimization in Truthful Multimodal LLMs
- Causal Graphical Models for Vision-Language Compositional Understanding
- Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment
- ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations
- Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems
- ChartGalaxy: A Dataset for Infographic Chart Understanding and Generation
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning
- CitySeeker: How Do VLMs Explore Embodied Urban Navigation with Implicit Human Needs?
- Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations
- CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing
- ColPali: Efficient Document Retrieval with Vision Language Models
- Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning
- Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering
- CompoDistill: Attention Distillation for Compositional Reasoning in Multimodal LLMs
- Compress & Cache: Vision token compression for efficient generation and retrieval
- Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges
- Concept-RuleNet: Grounded Multi-Agent Neurosymbolic Reasoning in Vision Language Models
- Conditional Representation Learning for Customized Tasks
- Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA
- Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics
- Contamination Detection for VLMs Using Multi‑Modal Semantic Perturbations
- ContextNav: Towards Agentic Multimodal In-Context Learning
- ContextNav: Towards Agentic Multimodal In-Context Learning
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality
- Cross-Modal Redundancy and the Geometry of Vision–Language Embeddings
- Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
- D-GARA: A Dynamic Benchmarking Framework for GUI Agent Robustness in Real-World Anomalies
- DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models
- DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding
- DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning
- DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
- DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery
- DOPD: Dual On-policy Distillation
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding
- DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
- DaVinci: Reinforcing Visual-Structural Syntax in MLLMs for Generalized Scientific Diagram Parsing
- DataComp-VLM: Improved Open Datasets for Vision-Language Models
- Dataset Distillation by Influence Matching
- Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling
- Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning
- Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
- Decomposition of Concept-Level Rules in Visual Scenes
- DeepEyes: Incentivizing "Thinking with Images" via Reinforcement Learning
- DeepEyesV2: Toward Agentic Multimodal Model
- DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction
- DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking
- Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verification
- Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views
- Detecting AI-Generated Video: A Vision-Language Dual-View Survey
- Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty
- Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification
- DiMaS: Distribution Matching for Steering Vision-Language-Action Models
- DiVE-k: DIFFERENTIAL VISUAL REASONING FOR FINE-GRAINED IMAGE RECOGNITION
- Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection
- Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG
- Discovering Compositional Hallucinations in LVLMs
- Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving
- Discrete Latent Features Ablate Adversarial Attack: A Robust Prompt Tuning Framework for VLMs
- Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding
- Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence
- Dive Into the Implicit Biases of Low-rank Vision-language Alignment
- Divergence-enhanced Knowledge-guided Context Optimization for Visual-Language Prompt Tuning
- Diversity Matters: Revisiting Test-Time Compute in Vision-Language Models
- Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition
- Do 3D Large Language Models Really Understand 3D Spatial Relationships?
- Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval
- Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions?
- Do Image Editing Models Understand Lighting?
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- Do Medical Vision Language Models Actually See? A Counterfactual Grounding Framework and Hard-Negative Contrastive Training for Visually-Reliant Medical VLMs
- Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
- Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?
- DobicVLM: Aligning Chest X-Ray Report Generation with Clinically-Grounded Programmatic Rewards via Group Relative Policy Optimization
- DocLens : A Tool-Augmented Multi-Agent Framework for Long Visual Document Understanding
- DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning
- Does It Fail to See or Fail to Know? Attributing Errors in Vision-Language Models
- Domain Adaptive Hashing Retrieval via VLM Assisted Pseudo-Labeling and Dual Space Adaptation
- Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning
- Domain Generalization via Text-Anchored Information Bottleneck
- Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
- DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking
- DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images
- DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble
- Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?
- Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model
- Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
- Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs
- DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models
- DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
- Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation
- Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models
- Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs
- Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP
- EA3D: Online Open-World 3D Object Extraction from Streaming Videos
- ELITE: Experiential Learning and Intent-Aware Transfer for Self-improving Embodied Agents
- ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models
- ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models
- ESC: Emotional Self-Correction for Reliable Vision-Language Models
- EVLP: Learning Unified Embodied Vision-Language Planner with Reinforced Supervised Fine-Tuning
- Each Complexity Deserves a Pruning Policy
- Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models
- EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography
- EchoTrail-GUI: Building Actionable Memory for GUI Agents via Critic-Guided Self-Exploration
- EditReward: A Human-Aligned Reward Model for Instruction-Guided Image Editing
- EduArt: An educational-level benchmark for evaluating art history knowledge in large language models
- Efficient PEFT Methods with Adaptive Checkpointing for Vision Models and VLMs on Resource Constrained Consumer-GPUs
- EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding
- ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- Embodied Navigation Foundation Model
- Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation
- Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots
- Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding
- Empowering Long-form Omni-modal Understanding with Robust Audio Perception
- Enhanced Continual Learning of Vision-Language Models with Model Fusion
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions
- Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting
- Enhancing Multi-Image Understanding through Delimiter Token Scaling
- Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment
- Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
- Environmental Understanding Vision-Language Model for Embodied Agent
- EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation
- Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory
- Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings
- Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition
- Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations
- Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models
- Evian: Towards Explainable Visual Instruction-tuning Data Auditing
- Evidence Triangulation for Multimodal Fact-Checking in the Wild
- EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling
- EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
- Evolution of Accuracy and Visual-Cognitive Errors in a Decade of Vision-Language AI Models
- EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution
- ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning
- ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models
- Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting
- ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
- Explaining CLIP Zero-shot Predictions Through Concepts
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere
- Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation
- Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection
- FHGS: Feature-Homogenized Gaussian Splatting
- FM$^2$: Unified Federated Foundation Models for Heterogeneous Multimodal Medical Imaging
- FOCUS: Efficient Keyframe Selection for Long Video Understanding
- FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
- FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
- Fantastic Tractor-Dogs and How Not to Find Them With Open-Vocabulary Detectors
- Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts
- Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding
- Fine-grained CLIP fine-tuning with self-annotated region alignment
- FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning
- FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications
- Flatness Guided Test-Time Adaptation for Vision-Language Models
- FlowCIR: Semantic Transport via Flow Matching for Zero-Shot Composed Image Retrieval
- FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models
- FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
- FoMoVLA: Bridging Visual Foresight and Motion Guidance for Vision-Language-Action Models
- Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding
- Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments
- Foundation Model-driven Key Anatomy Frame Selection for Blind-sweep Ultrasound Fetal Birth Weight Estimation
- FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting
- From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA
- From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP
- From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models
- From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging
- From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation
- From Weights to Concepts: Data-Free Interpretability of CLIP via Singular Vector Decomposition
- From ``Sure" to ``Sorry": Detecting Jailbreak in Large Vision Language Model via JailNeurons
- Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
- GAVEL: Grounded Caption Error Verification and Localization
- GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation
- GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- GMO-E$^2$DIT: Grounded Multi-Operation Editing for E-Commerce Images
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- GROW$^2$: Grounding Which and Where for Robot Tool Use
- GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training
- GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning
- GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents
- GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection
- Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning
- Gatekeeper: Improving Model Cascades Through Confidence Tuning
- Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding
- Gaze-VLM: Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
- GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- GenIR: Generative Visual Feedback for Mental Image Retrieval
- Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector
- Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- Generating CAD Code with Vision-Language Models for 3D Designs
- Generative Universal Verifier as Multimodal Meta-Reasoner
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
- GeoDetect: Geometric Adversarial Detection for VLPs
- GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
- GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
- Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- GhostEI-Bench: Do Mobile Agent Resilience to Environmental Injection in Dynamic On-Device Environments?
- Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression
- GoalLadder: Incremental Goal Discovery with Vision-Language Models
- Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs
- Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-Language Navigation
- Grounded 3D-Aware Spatial Vision-Language Modeling
- Grounded Reinforcement Learning for Visual Reasoning
- Grounding Computer Use Agents on Human Demonstrations
- GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models
- GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning
- Guava: An Effective and Universal Harness for Embodied Manipulation
- Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization
- H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration
- HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models
- HKVLM: Faithful Reasoning Grounding by Binding Language Queries to a Frozen Detector
- HMVLM:Human Motion-Vision-Language Model via MoE LoRA
- HPD-Parsing: Hierarchical Parallel Document Parsing
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- HTT-Net: Hierarchical Text-guided Transition Modeling for Surgical Video Phase Recognition
- Hallucination Detection and Correction in Medical VLMs via Counter-Evidence Verification
- Hallucination Reduction with CASAL: Contrastive Activation Steering for Amortized Learning
- HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
- HarmVideoBench: Benchmarking Harmful Video Understanding in Large Multimodal Models
- Harnessing Textual Refusal Directions for Multimodal Safety
- Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs
- Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
- Head Pursuit: Probing Attention Specialization in Multimodal Transformers
- Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation
- HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models
- Hierarchical Pre-Training of Vision Encoders with Large Language Models
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Hierarchically Robust Zero-shot Vision-language Models
- HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models
- HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios
- How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA
- How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
- How can embedding models bind concepts?
- Human-Centric Transferable Tactile Pre-Training for Dexterous Robotic Manipulation
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- Hy-Embodied-VLM-1.0: Efficient Physical-World Agents
- Hybrid Training for Vision-Language-Action Models
- HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model
- HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space
- IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer
- IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation
- INFORM-CT: INtegrating LLMs and VLMs FOR Incidental Findings Management in Abdominal CT
- IPR-1: Interactive Physical Reasoner
- IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
- Identifying Robust Neural Pathways: Few-Shot Adversarial Mask Tuning for Vision-Language Models
- Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
- Image as a World: Generating Interactive World from Single Image via Panoramic Video Generation
- ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
- Imitating the Truth: Attention-aware Truth-Guided Enhancement for Hallucination Mitigation in Large Vision-Language Models
- Immuno-VLM: Immunizing Large Vision-Language Models via Generative Semantic Antibodies for Open-World Trustworthiness
- Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection
- Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
- Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning
- Improving Calibration in Test-Time Prompt Tuning for Vision-Language Models via Data-Free Flatness-Aware Prompt Pretraining
- Improving Vision-language Models with Perception-centric Process Reward Models
- IndicVisionBench: Benchmarking Cultural and Multilingual Understanding in VLMs
- Inducing Dyslexia in Vision Language Models
- Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters
- Information-Regularized Attention for Visual-Centric Reasoning
- InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
- Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination
- Instance-Level Composed Image Retrieval
- InstanceControl: Controllable Complex Image Generation without Instance Labeling
- InstructSAM: A Training-free Framework for Instruction-Oriented Remote Sensing Object Recognition
- Interleave-VLA: Enhancing Robot Manipulation with Image-Text Interleaved Instructions
- Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment
- InternSpatial: A Comprehensive Dataset for Spatial Reasoning in Vision-Language Models
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- Interpretability Transfer from Language to Vision via Sparse Autoencoders
- Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats
- Invoice Haystack: Benchmarking Document Retrieval and Visual Question Answering Under Strong Visual Homogeneity
- Is Your Video Language Model a Reliable Judge?
- Is the Geometry Doing the Work? An Operating-Point Audit of Hierarchy in Hyperbolic Vision-Language Models
- Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning
- JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications
- JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
- Jailbreaking Frontier Foundation Models Through Intention Deception
- JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
- JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
- K-Sort Eval: Efficient Preference Evaluation for Visual Generation via Corrected VLM-as-a-Judge
- K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation
- Keep It in Mind: User Centric Continual Spatial Intelligence Reasoning in Egocentric Video Streams
- KeepLoRA: Continual Learning with Residual Gradient Adaptation
- Knowing You at First Glance: Inferring Apparent Personality from Faces
- Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs
- Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering
- LASER: A Corrective Lens for LVLMs via Visual Attention Preservation and Sink Suppression
- LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition
- LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning
- LIME: Learning Intent-aware Camera Motion from Egocentric Video
- LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension
- LLaRA: Supercharging Robot Learning Data for Vision-Language Policy
- LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
- LMFusion: Adapting Pretrained Language Models for Multimodal Generation
- LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models
- LVLM-Driven Attribute-Aware Modeling for Visible-Infrared Person Re-Identification
- LaGuadia: Language-Guided Adaptive Distillation from Pathology Foundation Models
- LaViDa: A Large Diffusion Language Model for Multimodal Understanding
- LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control
- Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation
- Language Models Can Explain Visual Features via Steering
- Language-Assisted Feature Transformation for Anomaly Detection
- Language-Assisted Super-Resolution from Real-World Low-Resolution Patches
- Language-Instructed Vision Embeddings for Controllable and Generalizable Perception
- Large (Vision) Language Models are Unsupervised In-Context Learners
- Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge
- Latent Chain-of-Thought for Visual Reasoning
- LayoutAgent: A Vision-Language Agent Guided Compositional Diffusion for Spatial Layout Planning
- LeVLJEPA: End-to-End Vision-Language Pretraining Without Negatives
- LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
- LearnPruner: Rethinking Attention-based Token Pruning in Vision Language Models
- Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge
- Learning Directional Semantic Transitions for Longitudinal Chest X-ray Analysis
- Learning Multi-View Spatial Reasoning from Cross-View Relations
- Learning Robust Vision-Language Models from Natural Latent Spaces
- Learning Spatial-Aware Manipulation Ordering
- Learning a Cross-Modal Schrödinger Bridge for Visual Domain Generalization
- Learning from Fine-Grained Visual Discrepancies: Mitigating Multimodal Hallucinations via In-Context Visual Contrastive Optimization
- Learning to Instruct for Visual Instruction Tuning
- Learning to Steer: Input-dependent Steering for Multimodal LLMs
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- LensWalk: Agentic Video Understanding by Planning How You See in Videos
- Let RGB Be the Language of Vision
- Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification
- Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation
- Lightweight Neural App Control
- LiveWeb-IE: A Benchmark For Online Web Information Extraction
- Locality Alignment Improves Vision-Language Models
- LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
- LongVQUBench: Benchmarking Long-Term Video Quality Understanding of Vision-Language Models
- Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
- Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs
- Lost at the End: Primacy Bias in Multimodal Retrieval-Augmented Question Answering
- Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction
- MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification
- MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
- MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration
- MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence
- MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation
- MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs
- MIBE: Multi-subject Interaction Benchmark and Evaluator for Personalized Image Generation
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
- MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein
- MM-EMBED: UNIVERSAL MULTIMODAL RETRIEVAL WITH MULTIMODAL LLMS
- MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models
- MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation
- MMReD: a Cross-Modal Benchmark for Dense Context Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning
- MODE-RAG: Manifold Outlier Diagnosis and Energy-based Retrieval-Augmented Generation Evaluation
- MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models
- MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning
- MR. Video: MapReduce as an Effective Principle for Long Video Understanding
- MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models
- MRI2Rep: Autoregressive Structured Report Generation for 3D Liver MRI
- MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
- MVPruner: Dynamic Token Pruning for Accelerating Multi-view Vision-Language Models in Autonomous Driving
- Machine Unlearning via Task Simplex Arithmetic
- Map the Flow: Revealing Hidden Pathways of Information in VideoLLMs
- MaskInversion: Localized Embeddings via Optimization of Explainability Maps
- Matched Data, Better Models: Target Aligned Data Filtering with Sparse Autoencoders
- Measuring And Improving Engagement of Text-to-Image Generation Models
- Measuring and Improving Complex-Atomic Answer Consistency in Endoscopic VQA
- MedFM-Robust: Benchmarking Robustness of Medical Foundation Models
- MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
- MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning
- MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings
- MemEIC: A Step Toward Continual and Compositional Knowledge Editing
- MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory
- Memento: Toward an All-Day Proactive Assistant for Ultra-Long Streaming Video
- Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
- Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation
- MentalThink: Shaping Thoughts in Mental SVG World
- MetaSpatial: Reinforcing 3D Spatial Reasoning in VLMs for the Metaverse
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- Mind the Heads: Topological Representation Alignment for Multimodal LLMs
- MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO
- MindPower: Enabling Theory-of-Mind Reasoning in VLM-based Embodied Agents
- Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
- Misaligned Roles, Misplaced Images: Structural Input Perturbations Expose Multimodal Alignment Blind Spots
- Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities
- MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts
- Mitigating Hallucination in Vision-Language Model with Depth and Spatial-aware Key-Value Refinement
- Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation
- Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
- Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification
- Mixture of Cognitive Experts in Large Vision-Language Models
- Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models
- Mixture of Probes: Learning from Privileged Modalities in Multimodal LLMs Through Probing
- MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models
- MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition
- MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning
- Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
- Modality-Specialized Synergizers for Interleaved Vision-Language Generalists
- Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach
- MolSight: A Graph-Aware Vision-Language Model for Unified Chemical Image Understanding
- MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
- MonoIR-RS: Infrared Remote Sensing Vision-Language Learning with CLIP and VLM Adaptation
- MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation
- Mordal: Automated Pretrained Model Selection for Vision Language Models
- More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage
- More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe
- Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs
- MuSLR: Multimodal Symbolic Logical Reasoning
- MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding
- Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection
- Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making
- Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology
- Multi-Modal Interactive Agent Layer for Few-Shot Universal Cross-Domain Retrieval and Beyond
- Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning
- Multi-modal Rail Crossing Safety Analysis
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs
- Multimodal Causal Reasoning for UAV Object Detection
- Multimodal Distribution Matching for Vision-Language Dataset Distillation
- Multimodal Fusion for Fine-Grained Classification of Breast Fibroadenoma and Phyllodes Tumors
- Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing
- Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks
- NL-Eye: Abductive NLI For Images
- Naming to Learn: Class Incremental Learning for Vision-Language Model with Unlabeled Data
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
- NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
- Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
- No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- Noisy Test-Time Adaptation in Vision-Language Models
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data
- Now You See the Hate: Adaptive View Retrieval for Hidden Hateful Illusions
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning
- OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory
- OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
- OOD-Barrier: Build a Middle-Barrier for Open-Set Single-Image Test Time Adaptation via Vision Language Models
- OPD-IAD: From Language Judgment to Industrial Anomaly Detection via On-Policy Self-Distillation
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
- Object-Centric Refinement for Enhanced Zero-Shot Segmentation
- Object-centric binding in Contrastive Language-Image Pretraining
- OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
- OmniSVG: A Unified Scalable Vector Graphics Generation Model
- OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models
- On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
- On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
- On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
- On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs
- One Modality to Forget Them All: Enhancing Cross-Modal Unlearning in Vision-Language Models
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- One Video, One World: Turning Monocular Video into Physical 4D Scenes
- One-for-All Few-Shot Anomaly Detection via Instance-Induced Prompt Learning
- OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
- Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- OpenCUA: Open Foundations for Computer-Use Agents
- OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models
- OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-time Emotional Speech Synthesis
- OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
- OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts
- P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization
- PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series in Typhoon Forecasting
- PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- PRiSM: Prototype Regularization for Few-Shot VLMs
- Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
- Panoramic Scene Analysis: A Survey from Distortion-Aware Engineering to Sphere-Native Foundation Modeling
- PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image
- Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning
- Perception Encoder: The best visual embeddings are not at the output of the network
- PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
- PersonaVLM: Long-Term Personalized Multimodal LLMs
- Personalized Object Identification and Localization via In-Context Inference with Vision-Language Models
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation
- PhysMRV: Physical Memory Retrieval and Verification for Physics Plausibility Reasoning
- PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
- PhysX-3D: Physical-Grounded 3D Asset Generation
- Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
- Pi-CCA: Prompt-Invariant CCA Certificates for Replay-Free Continual Multimodal Learning
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving
- PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model
- PlanarGS: High-Fidelity Indoor 3D Gaussian Splatting Guided by Vision-Language Planar Priors
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Playing ZendoWorld: Challenging AI Agents on Active Visual Concept Induction
- Pluralis v0.1: Towards a Multicultural, Multimodal, Multilingual Benchmark for AI Risk and Reliability
- PoSh: Using Scene Graphs to Guide LLMs-as-a-Judge for Detailed Image Descriptions
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image Guardrails
- Post-Training in End-to-End Autonomous Driving
- Post-hoc Probabilistic Vision-Language Models
- PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models
- Prefill-Time Intervention for Mitigating Hallucination in Large Vision-Language Models
- PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation
- Present but Not Remembered: Auditing How Frozen VLAs Encode, Deploy, and Steer Visual History
- Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
- Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models
- ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection
- PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization
- Prototype-Anchored Generalized Manifold Regression for Unknown-Domain Object Detection
- Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
- ProxyThinker: Test-Time Guidance through Small Visual Reasoners
- Prune Redundancy, Preserve Essence: Vision Token Compression in VLMs via Synergistic Importance-Diversity
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Pursuing Minimal Sufficiency in Spatial Reasoning
- Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning
- QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding
- QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization
- QuARI: Query Adaptive Retrieval Improvement
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- Quantifying Cross-Modality Memorization in Vision-Language Models
- RADIO1D: Elastic Representations for Condensed Vision Modeling
- RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding
- RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks
- RL Forgets! Towards Continual Policy Optimization
- ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
- RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning
- RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
- Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
- Rank-Then-Act: Reward-Free Control from Frame-Order Progress
- Re-Aligning Language to Visual Objects with an Agentic Workflow
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents
- ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning
- ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
- Read the Room: Video Social Reasoning with Mental-Physical Causal Chains
- Real-Time Procedural Learning From Experience for AI Agents
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Reasoning-Driven Multimodal LLM for Domain Generalization
- Reasoning-aware Speculative Decoding for Efficient Vision-Language-Action Models in Autonomous Driving
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering
- Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks
- ReferTrack: Referring Then Tracking for Embodied Visual Tracking
- Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
- Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA
- ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning
- Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
- Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification
- RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models
- Rethinking Causal Mask Attention for Vision-Language Inference
- Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning
- Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment
- Revealing Multimodal Causality with Large Language Models
- Reversible Primitive–Composition Alignment for Continual Vision–Language Learning
- Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models
- Revisiting Confidence Calibration for Misclassification Detection in VLMs
- Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
- Revisiting Multimodal Positional Encoding in Vision–Language Models
- Reward Valuation in Vision Language Models: Causal Mechanisms Underlying Anhedonia
- RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics
- RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
- RoboTTT: Context Scaling for Robot Policies
- Robostral Navigate
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- Robust Fine-tuning of Vision-Language-Action Robot Policies via Parameter Merging
- Robust Multimodal Safety via Conditional Decoding
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- Robustifying Vision-Language Models via Test-Time Prompt Adaptation
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
- S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models
- SAB-LVLM: Significance-Aware Binarization for Large Vision-Language Models
- SAFE: Multitask Failure Detection for Vision-Language-Action Models
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs
- SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs
- SCUBA: Salesforce Computer Use Benchmark
- SD-MAR: Multi-image Analytical Reasoning via Synthetic Data and Reinforcement Learning
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SEE: Structure-aware Exploring \& Exploiting for Long-horizon GUI Agent Trajectory Synthesis
- SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models
- SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models
- SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence
- SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SMAN-Bench: A Cross-System Benchmark for Mobile Agents under Single- and Multi-path, Ambiguous, and Noisy Tasks
- SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs
- SPACENUM: Revisiting Spatial Numerical Understanding in VLMs
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start
- SPRO: Improving Image Generation via Self-Play
- SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning
- STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning
- SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding
- SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning
- Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models
- SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
- SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents
- Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning
- Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders
- Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs
- ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models
- Scaffolding Dexterous Manipulation with Vision-Language Models
- Scalable Training of Spatially Grounded 2D Vision-Language Models for Radiology
- Scaling RL to Long Videos
- Scaling up Memory for Robotic Control via Experience Retrieval
- ScanFocus: A Coarse-to-Fine Framework for Spatio-Temporal Video Grounding
- SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency
- SciDiagramEdit: Learning to Edit Scientific Diagrams from Paper Revisions
- SeLIP: Similarity Enhanced Contrastive Language Image Pretraining for Multi-modal Head MRI
- Search-based Testing of Vision Language Models for In-Car Scene Understanding
- Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models
- See It from My Perspective: How Language Affects Cultural Bias in Image Understanding
- See Only When Needed: Context-Aware Attention Intervention for Mitigating Hallucinations in LVLMs
- See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
- SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
- SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments
- Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue
- Seeing What’s Not There: Negation Understanding Needs More Than Training
- Seeing What’s Wrong: A Trajectory-Guided Approach to Caption Error Detection
- Seeing but Not Believing: Probing the Disconnect Between Visual Attention and Answer Correctness in VLMs
- Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference
- Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark
- Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?
- Seek to Segment: Active Perception for Panoramic Referring Segmentation
- Selective Test-Time Debiasing for CLIP via Reward Gating
- Self-Aug: Query and Entropy Adaptive Decoding for Large Vision-Language Models
- Self-Evolving Vision-Language Models for Image Quality Assessment via Voting and Ranking
- Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models
- Self-Prophetic Decoding to Unlock Visual Search in LVLMs
- Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- Semantic Anchoring for Robotic Action Representations
- Semantic Browsing: Controllable Diversity for Image Generation
- Semantic Robustness Certification for Vision-Language Models
- Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning
- Semantic Visual Anomaly Detection and Reasoning in AI-Generated Images
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
- SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- Should VLMs be Pre-trained with Image Data?
- Show Me Examples: Inferring Visual Concepts from Image Sets
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text
- SigLIP-HD by Fine-to-Coarse Supervision
- Sim2Real VLA: Zero-Shot Generalization of Synthesized Skills to Realistic Manipulation
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration
- SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds
- Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs
- SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
- Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
- Sketch2Diagram: Generating Vector Diagrams from Hand-Drawn Sketches
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- SlideTailor: Personalized Presentation Slide Generation for Scientific Papers
- Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?
- Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model
- SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video
- SpaceServe: Spatial Multiplexing of Complementary Encoders and Decoders for Multimodal LLMs
- Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
- Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning
- SpatiaLab: Can Vision–Language Models Perform Spatial Reasoning in the Wild?
- Spatial Reasoning with Vision-Language Models in Ego-Centric Multi-View Scenes
- Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
- Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models
- SpatialLM: Training Large Language Models for Structured Indoor Modeling
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning
- SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion
- Spectral Heat Flow for Conservative Token Condensation in Vision-Language Models
- SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs
- SportD: Can VLMs Physically Strategize?
- Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation
- Spotlight on Token Perception for Multimodal Reinforcement Learning
- Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation
- Statistics Caching Test-Time Adaptation for Vision-Language Models
- Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding
- StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning
- Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning
- Stop Guessing When to Stop Testing: Efficient Model Evaluation with Just Enough Data
- StoryTeller: Training-Free Narrative Grounding for Long-Form Audio Description
- StructAgent: Harness Long-horizon Digital Agents with Unified Causal Structure
- Structural Graph Probing of Vision-Language Models
- Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition
- StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation
- Super-Generalist: Towards Comprehensive and Accurate Medical Image Understanding via Generalist-Specialist Synergy
- SuperCLIP: CLIP with Simple Classification Supervision
- Symbal: Detecting Systematic Misalignments in Model-Generated Captions
- SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
- Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
- TABLET: A Large-Scale Dataset for Robust Visual Table Understanding
- TCLA: Training-Free Class-wise Logit Adaptation for Medical Vision-Language Models
- TIGER: Text-Conditioned Visual Gated Routing with Acceptance Alignment for Multimodal Speculative Decoding
- TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring
- TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models
- TRAP: Targeted Redirecting of Agentic Preferences
- TRAP: Targeted Redirecting of Agentic Preferences
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models
- TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
- TULIP: Token-length Upgraded CLIP
- Talking Points: Describing and Localizing Pixels
- Teaching Human Behavior Improves Content Understanding Abilities Of VLMs
- Teaching Vision-Language-Action Models What to See and Where to Look
- Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning
- Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
- Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
- Test-Time Adaptive Object Detection with Foundation Model
- Test-Time Matching: Unlocking Compositional Reasoning in Multimodal Models
- Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models
- Test-Time Scaling for Small VLMs on Multilingual Visual MCQ
- Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
- Test-Time Training for Modality Order Consistency in Vision-Language Models
- Text to Sketch Generation with Multi-Styles
- Text2Sign: A Single-GPU Diffusion Baseline for Text-to-Sign Language Video Generation
- The Count Is There, but Misaligned: Understanding and Correcting Counting Failures in VLMs
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning
- The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning
- The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric
- The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
- The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy
- The Sound of Absence: Audio-Language Embedding Models Struggle with Negation
- The Truth Stays in the Family: Enhancing Contextual Grounding via Inherited Truthful Heads in Model Lineages
- Think Less, Act Early: Reinforced Latent Reasoning with Early Exit in Vision-Language-Action Models
- Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies
- Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
- ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning
- ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning
- ThinkMorph: Emergent Properties in Multimodal Interleaved Chain-of-Thought Reasoning
- ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing
- Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
- Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
- To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
- ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts
- Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning
- Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
- Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts
- Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- Towards Developing a Multimodal Chat Assistant for University Stakeholders: RAG-based Approach
- Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding
- Towards General Continuous Memory for Vision-Language Models
- Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study
- Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports
- Towards Robustness against Typographic Attack with Training-free Concept Localization
- Towards Self-Refinement of Vision-Language Models with Triangular Consistency
- Towards Text-Mask Consistency in Medical Image Segmentation
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
- Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
- Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images
- Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation
- Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context
- Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning
- Training Vision-Language-Action Models with Dense Embodied Chain-of-Thought Supervision
- Training-Free Acceleration for Vision-Language-Action Models with Action Caching and Refinement
- Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark
- Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models
- Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation
- Transductive Visual Programming: Evolving Tool Libraries from Experience for Spatial Reasoning
- Transferable and Stealthy Adversarial Attacks on Large Vision-Language Models
- Transition-Aware best-of-N sampling for Longitudinal Chest X-ray Reports
- TrustGen: A Platform of Dynamic Benchmarking on the Trustworthiness of Generative Foundation Models
- TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis
- Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation
- TwinVLA: Data-Efficient Bimanual Manipulation with Twin Single-Arm Vision-Language-Action Models
- U-shaped Multi-granularity Learning for Vision-Language Models
- UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making
- UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
- UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation
- UMind-VL: A Generalist Ultrasound Vision-Language Model for Unified Grounded Perception and Comprehensive Interpretation
- UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma
- USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning
- Uncertainty-Aware Gaussian Map for Vision-Language Navigation
- Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models
- Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding
- Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
- Understanding and Rectifying Safety Perception Distortion in VLMs
- UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image
- Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition
- Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
- UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens
- UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denosing Diffusion Process
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Unified Vision–Language Modeling via Concept Space Alignment
- Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
- Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
- Unleashing Perception-Time Scaling to Multimodal Reasoning Models
- Unleashing Vision-Language Semantics for Deepfake Video Detection
- Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
- Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- Unveiling the Visual Counting Bottleneck in Vision-Language Models
- V-CECE: Visual Counterfactual Explanations via Conceptual Edits
- V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction
- VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning
- VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation
- VEGAS: Human-Aligned Video Caption Evaluation via Gaze
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
- VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions
- VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
- VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
- VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration
- VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching
- VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment
- VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation
- VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation
- VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
- VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture
- VLMaterial: Procedural Material Generation with Large Vision-Language Models
- VLMgineer: Vision-Language Models as Robotic Toolsmiths
- VLMs can Aggregate Scattered Training Patches
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- VTM-Nav: Hierarchical Visual-Topological Memory for Cross-Episode Object-Goal Navigation
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use
- VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
- VaseMuseum: Digital Intelligent Museum for Ancient Greek Pottery
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- Verifier-free Test-Time Sampling for Vision-Language-Action Models
- Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Models
- ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models
- ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
- Video = World + Event Stream
- Video Action Differencing
- Video Action Differencing
- Video Action Differencing
- Video Generation Models are General-Purpose Vision Learners
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- VideoAgent: All-in-One Framework for Video Understanding and Editing
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
- VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?
- VideoSearcher: Empowering Video Deep Research with Multi-Tool Agentic Reasoning via Reinforcement Learning
- VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression
- VisCodex: Unified Multimodal Code Generation via Merging Vision and Coding Models
- VisCritic: Visual State Comparison as Process Reward for GUI Agents
- VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context
- Vision Function Layer in Multimodal LLMs
- Vision Language Action (VLA) Models for Unmanned Aerial Robotics and Bimanual Manipulation: A Review
- Vision Language Models are Biased
- Vision Language Models are In-Context Value Learners
- Vision Transformers Don't Need Trained Registers
- Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
- Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models
- Vision-Language Assistant for Emotional Reactions to Risky Driving
- Vision-SR1: Self-Rewarding Vision-Language Model via Reasoning Decomposition and Multi-Reward Policy Optimization
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision-Zero: Scalable VLM Self-Evolution via Multi-Agent Self-Play
- Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow
- Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- Visual symbolic mechanisms: Emergent symbol processing in Vision Language Models
- VisualPredicator: Learning Abstract World Models with Neuro-Symbolic Predicates for Robot Planning
- Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Visuals Lie, Consistency Speaks: Disentangling Spatial Attention from Reliability in Vision-Language Models
- Vocabulary-Guided Gait Recognition
- Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction
- WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WIMFRIS: WIndow Mamba Fusion and Parameter Efficient Tuning for Referring Image Segmentation
- WRING Out The Bias: A Rotation-Based Alternative To Projection Debiasing
- WSVD: Weighted Low-Rank Approximation for Fast and Efficient Execution of Low-Precision Vision-Language Models
- Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs
- Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception
- Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM
- WeaveEarth: Structured Evidence Construction and Reasoning for Training-Free UHR Remote Sensing Understanding
- WebVIA: A Web-based Vision-Language Agentic Framework for Interactive and Verifiable UI-to-Code Generation
- WebWatcher: Breaking New Frontiers of Vision-Language Deep Research Agent
- Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation
- What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
- What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
- What Images Cannot Say: Language-Guided Olfactory Representation Learning
- What's Hidden Matters: Identifying Planning-Critical Occluded Agents using Vision-Language Models
- When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning
- When Negation Is a Geometry Problem in Vision-Language Models
- When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs
- When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities
- When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models
- Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
- Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding
- Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models
- Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering
- WorkDrive: Roadwork Chain of Causation for Autonomous Driving
- World-aware Planning Narratives Enhance Large Vision-Language Model Planner
- WorldGym: World Model as An Environment for Policy Evaluation
- Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- XAI-Grounded Explanation Generation for Speech Deepfake Detection with Training-Free Multimodal Large Language Models
- Xiaomi-GUI-0 Technical Report
- Xiaomi-GUI-0 Technical Report
- Yo'City: Personalized and Boundless 3D Realistic City Scene Generation via Self-Critic Expansion
- Zebra-CoT: A Dataset for Interleaved Vision-Language Reasoning
- Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
- ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
- ZooProbe: A Data Engine for Evaluating, Exploring, and Evolving Large-scale Training Data for Multimodal LLMs
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
- lmgame-Bench: How Good are LLMs at Playing Games?
- pFedMMA: Personalized Federated Fine-Tuning with Multi-Modal Adapter for Vision-Language Models
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP
- villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
world-model¶
- ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU
- Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
- Agents Robust to Distribution Shifts Learn Causal World Models Even Under Mediation
- Concept-Guided Spatial Regularization for World Models in Atari Pong
- Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
- DSWorld: A Data Science World Model for Efficient Autonomous Agents
- Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?
- DreamPhase: Offline Imagination and Uncertainty-Guided Planning for Large-Language-Model Agents
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- DynaVieW: Schema-Guided World Modeling for Understanding Hierarchical Visual Dynamics
- GATS: Graph-Augmented Tree Search with Layered World Models for Efficient Agent Planning
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- Goal-Driven Reward by Video Diffusion Models for Reinforcement Learning
- IPR-1: Interactive Physical Reasoner
- Image as a World: Generating Interactive World from Single Image via Panoramic Video Generation
- Infinite Worlds with Versatile Interactions
- InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning
- Intrinsic Goals for Autonomous Agents: Model-Based Exploration in Virtual Zebrafish Predicts Ethological Behavior and Whole-Brain Dynamics
- LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition
- Language-conditioned world model improves policy generalization by reading environmental descriptions
- Learning and Planning Multi-Agent Tasks via an MoE-based World Model
- Long-Horizon Model-Based Offline Reinforcement Learning Without Explicit Conservatism
- Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL
- Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- Object-Centric World Models for Causality-Aware Reinforcement Learning
- Repair the Amplifier, Not the Symptom: Stable World-Model Correction for Agent Rollouts
- Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
- RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination
- Scaling Agent Learning via Experience Synthesis
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction
- Social World Model-Augmented Mechanism Design Policy Learning
- Stealthy World Model Manipulation via Data Poisoning
- Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
- Test-Time Adaptation for LLM Agents via Environment Interaction
- Uni-World VLA: Interleaved World Modeling and Planning for Autonomous Driving
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
- Video = World + Event Stream
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations
- VisualPredicator: Learning Abstract World Models with Neuro-Symbolic Predicates for Robot Planning
- WALL-E: World Alignment by NeuroSymbolic Learning improves World Model-based LLM Agents
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving
- WMPO: World Model-based Policy Optimization for Vision-Language-Action Models
- WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
- What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?
- World Models in Pieces: Structural Certification for General Agents
- World-R1: Reinforcing 3D Constraints for Text-to-Video Generation
- WorldGym: World Model as An Environment for Policy Evaluation
- Write-Protected Discrete Bottlenecks for Language-Grounded World Models: A Structural Limitation and Sufficient Fix
zero-shot¶
- $\Delta \mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization
- A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
- A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology
- A-TPT: Angular Diversity Calibration Properties for Test-Time Prompt Tuning of Vision-Language Models
- AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
- Agentic RL Scaling Law: Spontaneous Code Execution for Mathematical Problem Solving
- An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models
- Are Video Models Emerging as Zero-Shot Learners and Reasoners in Medical Imaging?
- Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs
- CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?
- Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations
- ClinNoteAgents: An LLM Multi-Agent System for Predicting and Interpreting Heart Failure 30-Day Readmission from Clinical Notes
- Content-Based Smart E-Mail Dispatcher Using Large Language Models
- Content-Based Smart E-Mail Dispatcher Using Large Language Models
- DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- Disease-Centric Vision-Language Pretraining with Hybrid Visual Encoding for 3D Computed Tomography
- Divide, Deliberate, Decide: A Multi-Agent Framework for Fine-Grained Egocentric Action Recognition
- Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning
- DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models
- Enhanced Continual Learning of Vision-Language Models with Model Fusion
- Evaluating Vision-Language Models as a Zero-Shot Learning Alternative to You Only Look Once and Optical Character Recognition for Nigerian License Plate Recognition
- Explaining CLIP Zero-shot Predictions Through Concepts
- Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- Extracting Events Like Code: A Multi-Agent Programming Framework for Zero-Shot Event Extraction
- Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining
- GHR-VLM: Making Zero-Shot Transit Video Analytics Realizable with Grounded Hybrid Reasoning
- GROW$^2$: Grounding Which and Where for Robot Tool Use
- GenAU: Language-Grounded Industrial Anomaly Understanding with Vision-Language Models
- Generalist Vision-Language Models for Fast Radio Burst detection: a zero-shot benchmark against a specialized detector
- IDEA: Insensitive to Dynamics Mismatch via Effect Alignment for Sim-to-Real Transfer in Multi-Agent Control
- Instance-Level Composed Image Retrieval
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE
- LINK: Learning Instance-level Knowledge from Vision-Language Models for Human-Object Interaction Detection
- Label-Free Mitigation of Spurious Correlations in VLMs using Sparse Autoencoders
- Language-Assisted Feature Transformation for Anomaly Detection
- Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge
- Let RGB Be the Language of Vision
- MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction
- MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection
- MaskInversion: Localized Embeddings via Optimization of Explainability Maps
- Memory-Free Continual Learning with Null Space Adaptation for Zero-Shot Vision-Language Models
- Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions
- Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval
- NavBench: Probing Multimodal Large Language Models for Embodied Navigation
- NePTune: A Neuro-Pythonic Framework for Tunable Compositional Reasoning on Vision-Language
- No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models
- Noisy Test-Time Adaptation in Vision-Language Models
- Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives
- RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
- Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation
- Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- Robustifying Vision-Language Models via Test-Time Prompt Adaptation
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- Scaling Equitable Reflection Assessment in Education via Large Language Models and Role-Based Feedback Agents
- Security Is Relative: Training-Free Vulnerability Detection via Multi-Agent Behavioral Contract Synthesis
- Seeing What’s Not There: Negation Understanding Needs More Than Training
- Selective Test-Time Debiasing for CLIP via Reward Gating
- SuperCLIP: CLIP with Simple Classification Supervision
- TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models
- Teaching Human Behavior Improves Content Understanding Abilities Of VLMs
- The Emerging Paradigm of Geospatial Foundation Models: From Pre-Training to Agentic Reasoning
- USE: A Unified Self-Ensembling Framework for Test-Time Prompt Tuning
- Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
- Uncovering Modality Discrepancy and Generalization Illusion for General-Purpose 3D Medical Segmentation
- UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image
- Unified Vision–Language Modeling via Concept Space Alignment
- Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
- Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding
- VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision–Language Models
- Value-Aligned Prompt Moderation via Zero-Shot Agentic Rewriting for Safe Image Generation
- VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- Von Mises-Fisher Mixture Model with Dynamic Shrinkage for Realistic Test-Time Transduction
- When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?
- Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization
- Zero-shot HOI Detection with MLLM-based Detector-agnostic Interaction Recognition
- ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning
- iMAD: Intelligent Multi-Agent Debate for Efficient and Accurate LLM Inference