| 2025-01-01 |
GoalLadder: Incremental Goal Discovery with Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect |
NeurIPS 2025 |
— |
| 2025-01-01 |
World-aware Planning Narratives Enhance Large Vision-Language Model Planner |
NeurIPS 2025 |
— |
| 2025-01-01 |
OpenCUA: Open Foundations for Computer-Use Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics |
NeurIPS 2025 |
— |
| 2025-01-01 |
Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining |
NeurIPS 2025 |
— |
| 2025-01-01 |
Learning Robust Vision-Language Models from Natural Latent Spaces |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards General Continuous Memory for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination |
NeurIPS 2025 |
— |
| 2025-01-01 |
MemEIC: A Step Toward Continual and Compositional Knowledge Editing |
NeurIPS 2025 |
— |
| 2025-01-01 |
Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better |
NeurIPS 2025 |
— |
| 2025-01-01 |
Scaffolding Dexterous Manipulation with Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Real-Time Execution of Action Chunking Flow Policies |
NeurIPS 2025 |
— |
| 2025-01-01 |
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution |
NeurIPS 2025 |
— |
| 2025-01-01 |
Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model |
NeurIPS 2025 |
— |
| 2025-01-01 |
OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts |
NeurIPS 2025 |
— |
| 2025-01-01 |
TRAP: Targeted Redirecting of Agentic Preferences |
NeurIPS 2025 |
— |
| 2025-01-01 |
Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
LMFusion: Adapting Pretrained Language Models for Multimodal Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
ActiveVOO: Value of Observation Guided Active Knowledge Acquisition for Open-World Embodied Lifted Regression Planning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents |
NeurIPS 2025 |
— |
| 2025-01-01 |
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Self-Refinement of Vision-Language Models with Triangular Consistency |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It |
NeurIPS 2025 |
— |
| 2025-01-01 |
SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes |
NeurIPS 2025 |
— |
| 2025-01-01 |
One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments |
NeurIPS 2025 |
— |
| 2025-01-01 |
Head Pursuit: Probing Attention Specialization in Multimodal Transformers |
NeurIPS 2025 |
— |
| 2025-01-01 |
Beyond Greedy Exits: Improved Early Exit Decisions for Risk Control and Reliability |
NeurIPS 2025 |
— |
| 2025-01-01 |
TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Quantifying Cross-Modality Memorization in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
GRIT: Teaching MLLMs to Think with Images |
NeurIPS 2025 |
— |
| 2025-01-01 |
Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition |
NeurIPS 2025 |
— |
| 2025-01-01 |
The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts |
NeurIPS 2025 |
— |
| 2025-01-01 |
Revisiting Logit Distributions for Reliable Out-of-Distribution Detection |
NeurIPS 2025 |
— |
| 2025-01-01 |
un\(^2\)CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP |
NeurIPS 2025 |
— |
| 2025-01-01 |
Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought |
NeurIPS 2025 |
— |
| 2025-01-01 |
Instance-Level Composed Image Retrieval |
NeurIPS 2025 |
— |
| 2025-01-01 |
Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval |
NeurIPS 2025 |
— |
| 2025-01-01 |
Automated Model Discovery via Multi-modal & Multi-step Pipeline |
NeurIPS 2025 |
— |
| 2025-01-01 |
SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches |
NeurIPS 2025 |
— |
| 2025-01-01 |
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling |
NeurIPS 2025 |
— |
| 2025-01-01 |
SPRO: Improving Image Generation via Self-Play |
NeurIPS 2025 |
— |
| 2025-01-01 |
BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
V-CECE: Visual Counterfactual Explanations via Conceptual Edits |
NeurIPS 2025 |
— |
| 2025-01-01 |
Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing |
NeurIPS 2025 |
— |
| 2025-01-01 |
Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments |
NeurIPS 2025 |
— |
| 2025-01-01 |
PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
QuARI: Query Adaptive Retrieval Improvement |
NeurIPS 2025 |
— |
| 2025-01-01 |
PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation |
NeurIPS 2025 |
— |
| 2025-01-01 |
UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning |
NeurIPS 2025 |
— |
| 2025-01-01 |
GenIR: Generative Visual Feedback for Mental Image Retrieval |
NeurIPS 2025 |
— |
| 2025-01-01 |
Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions |
NeurIPS 2025 |
— |
| 2025-01-01 |
Statistics Caching Test-Time Adaptation for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
Aha! - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead |
NeurIPS 2025 |
— |
| 2025-01-01 |
SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds |
NeurIPS 2025 |
— |
| 2025-01-01 |
SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration |
NeurIPS 2025 |
— |
| 2025-01-01 |
From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit |
NeurIPS 2025 |
— |
| 2025-01-01 |
4KAgent: Agentic Any Image to 4K Super-Resolution |
NeurIPS 2025 |
— |
| 2025-01-01 |
Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging |
NeurIPS 2025 |
— |
| 2025-01-01 |
QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Caption This, Reason That: VLMs Caught in the Middle |
NeurIPS 2025 |
— |
| 2025-01-01 |
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks |
NeurIPS 2025 |
— |
| 2025-01-01 |
Bridging the gap to real-world language-grounded visual concept learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
InstructSAM: A Training-free Framework for Instruction-Oriented Remote Sensing Object Recognition |
NeurIPS 2025 |
— |
| 2025-01-01 |
FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency |
NeurIPS 2025 |
— |
| 2025-01-01 |
AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining |
NeurIPS 2025 |
— |
| 2025-01-01 |
BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Revealing Multimodal Causality with Large Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Conditional Representation Learning for Customized Tasks |
NeurIPS 2025 |
— |
| 2025-01-01 |
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training |
NeurIPS 2025 |
— |
| 2025-01-01 |
Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree |
NeurIPS 2025 |
— |
| 2025-01-01 |
A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1 |
NeurIPS 2025 |
— |
| 2025-01-01 |
3D Visual Illusion Depth Estimation |
NeurIPS 2025 |
— |
| 2025-01-01 |
From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging |
NeurIPS 2025 |
— |
| 2025-01-01 |
ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration |
NeurIPS 2025 |
— |
| 2025-01-01 |
Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency |
NeurIPS 2025 |
— |
| 2025-01-01 |
Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search |
NeurIPS 2025 |
— |
| 2025-01-01 |
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder |
NeurIPS 2025 |
— |
| 2025-01-01 |
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability |
NeurIPS 2025 |
— |
| 2025-01-01 |
Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vocabulary-Guided Gait Recognition |
NeurIPS 2025 |
— |
| 2025-01-01 |
Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding |
NeurIPS 2025 |
— |
| 2025-01-01 |
UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface |
NeurIPS 2025 |
— |
| 2025-01-01 |
DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation |
NeurIPS 2025 |
— |
| 2025-01-01 |
OOD-Barrier: Build a Middle-Barrier for Open-Set Single-Image Test Time Adaptation via Vision Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation |
NeurIPS 2025 |
— |
| 2025-01-01 |
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement |
NeurIPS 2025 |
— |
| 2025-01-01 |
Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards |
NeurIPS 2025 |
— |
| 2025-01-01 |
DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer |
NeurIPS 2025 |
— |
| 2025-01-01 |
MR. Video: MapReduce as an Effective Principle for Long Video Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling |
NeurIPS 2025 |
— |
| 2025-01-01 |
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Compress & Cache: Vision token compression for efficient generation and retrieval |
NeurIPS 2025 |
— |
| 2025-01-01 |
Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames |
NeurIPS 2025 |
— |
| 2025-01-01 |
Best-of-N Jailbreaking |
NeurIPS 2025 |
— |
| 2025-01-01 |
DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing |
NeurIPS 2025 |
— |
| 2025-01-01 |
MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO |
NeurIPS 2025 |
— |
| 2025-01-01 |
VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR |
NeurIPS 2025 |
— |
| 2025-01-01 |
NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation |
NeurIPS 2025 |
— |
| 2025-01-01 |
FHGS: Feature-Homogenized Gaussian Splatting |
NeurIPS 2025 |
— |
| 2025-01-01 |
GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Test-Time Adaptive Object Detection with Foundation Model |
NeurIPS 2025 |
— |
| 2025-01-01 |
Robustness in Both Domains: CLIP Needs a Robust Text Encoder |
NeurIPS 2025 |
— |
| 2025-01-01 |
Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection |
NeurIPS 2025 |
— |
| 2025-01-01 |
VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions |
NeurIPS 2025 |
— |
| 2025-01-01 |
Conditioning Matters: Training Diffusion Policies is Faster Than You Think |
NeurIPS 2025 |
— |
| 2025-01-01 |
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Understanding and Rectifying Safety Perception Distortion in VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Synergistic Tensor and Pipeline Parallelism |
NeurIPS 2025 |
— |
| 2025-01-01 |
What Can RL Bring to VLA Generalization? An Empirical Study |
NeurIPS 2025 |
— |
| 2025-01-01 |
SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
SpaceServe: Spatial Multiplexing of Complementary Encoders and Decoders for Multimodal LLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
SpatialLM: Training Large Language Models for Structured Indoor Modeling |
NeurIPS 2025 |
— |
| 2025-01-01 |
MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification |
NeurIPS 2025 |
— |
| 2025-01-01 |
SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Attention! Your Vision Language Model Could Be Maliciously Manipulated |
NeurIPS 2025 |
— |
| 2025-01-01 |
Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression |
NeurIPS 2025 |
— |
| 2025-01-01 |
\(\Delta \mathrm{Energy}\): Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization |
NeurIPS 2025 |
— |
| 2025-01-01 |
One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head |
NeurIPS 2025 |
— |
| 2025-01-01 |
Unified Reinforcement and Imitation Learning for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
SAFE: Multitask Failure Detection for Vision-Language-Action Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Latent Chain-of-Thought for Visual Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism |
NeurIPS 2025 |
— |
| 2025-01-01 |
MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection |
NeurIPS 2025 |
— |
| 2025-01-01 |
Human-assisted Robotic Policy Refinement via Action Preference Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
Multimodal Causal Reasoning for UAV Object Detection |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere |
NeurIPS 2025 |
— |
| 2025-01-01 |
BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture |
NeurIPS 2025 |
— |
| 2025-01-01 |
GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model |
NeurIPS 2025 |
— |
| 2025-01-01 |
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Object-centric binding in Contrastive Language-Image Pretraining |
NeurIPS 2025 |
— |
| 2025-01-01 |
Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment |
NeurIPS 2025 |
— |
| 2025-01-01 |
VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Enhancing CLIP Robustness via Cross-Modality Alignment |
NeurIPS 2025 |
— |
| 2025-01-01 |
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism |
NeurIPS 2025 |
— |
| 2025-01-01 |
Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing |
NeurIPS 2025 |
— |
| 2025-01-01 |
Text to Sketch Generation with Multi-Styles |
NeurIPS 2025 |
— |
| 2025-01-01 |
Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Bisecle: Binding and Separation in Continual Learning for Video Language Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-time Emotional Speech Synthesis |
NeurIPS 2025 |
— |
| 2025-01-01 |
NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables |
NeurIPS 2025 |
— |
| 2025-01-01 |
ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning |
NeurIPS 2025 |
— |
| 2025-01-01 |
GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization |
NeurIPS 2025 |
— |
| 2025-01-01 |
CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Scaling RL to Long Videos |
NeurIPS 2025 |
— |
| 2025-01-01 |
Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLMs can Aggregate Scattered Training Patches |
NeurIPS 2025 |
— |
| 2025-01-01 |
CoFFT: Chain of Foresight-Focus Thought for Visual Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Gaze-VLM: Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Domain Adaptive Hashing Retrieval via VLM Assisted Pseudo-Labeling and Dual Space Adaptation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought |
NeurIPS 2025 |
— |
| 2025-01-01 |
Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency |
NeurIPS 2025 |
— |
| 2025-01-01 |
VideoVLA: Video Generators Can Be Generalizable Robot Manipulators |
NeurIPS 2025 |
— |
| 2025-01-01 |
Learning to Instruct for Visual Instruction Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering |
NeurIPS 2025 |
— |
| 2025-01-01 |
RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks |
NeurIPS 2025 |
— |
| 2025-01-01 |
Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Gatekeeper: Improving Model Cascades Through Confidence Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Learning to Steer: Input-dependent Steering for Multimodal LLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Learning a Cross-Modal Schrödinger Bridge for Visual Domain Generalization |
NeurIPS 2025 |
— |
| 2025-01-01 |
VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats |
NeurIPS 2025 |
— |
| 2025-01-01 |
Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Rendering-Aware Reinforcement Learning for Vector Graphics Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding |
NeurIPS 2025 |
— |
| 2025-01-01 |
GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity |
NeurIPS 2025 |
— |
| 2025-01-01 |
Discovering Compositional Hallucinations in LVLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
PlanarGS: High-Fidelity Indoor 3D Gaussian Splatting Guided by Vision-Language Planar Priors |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vision Transformers Don't Need Trained Registers |
NeurIPS 2025 |
— |
| 2025-01-01 |
LaViDa: A Large Diffusion Language Model for Multimodal Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Active Test-time Vision-Language Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens |
NeurIPS 2025 |
— |
| 2025-01-01 |
DOTA: Distributional Test-time Adaptation of Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching |
NeurIPS 2025 |
— |
| 2025-01-01 |
EA3D: Online Open-World 3D Object Extraction from Streaming Videos |
NeurIPS 2025 |
— |
| 2025-01-01 |
Noise Matters: Optimizing Matching Noise for Diffusion Classifiers |
NeurIPS 2025 |
— |
| 2025-01-01 |
NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions |
NeurIPS 2025 |
— |
| 2025-01-01 |
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis |
NeurIPS 2025 |
— |
| 2025-01-01 |
LVLM-Driven Attribute-Aware Modeling for Visible-Infrared Person Re-Identification |
NeurIPS 2025 |
— |
| 2025-01-01 |
VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
SuperCLIP: CLIP with Simple Classification Supervision |
NeurIPS 2025 |
— |
| 2025-01-01 |
Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration |
NeurIPS 2025 |
— |
| 2025-01-01 |
SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens |
NeurIPS 2025 |
— |
| 2025-01-01 |
Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios |
NeurIPS 2025 |
— |
| 2025-01-01 |
Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Spatial Understanding from Videos: Structured Prompts Meet Simulation Data |
NeurIPS 2025 |
— |
| 2025-01-01 |
CF-VLM:CounterFactual Vision-Language Fine-tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback |
NeurIPS 2025 |
— |
| 2025-01-01 |
ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
MuSLR: Multimodal Symbolic Logical Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Learning Spatial-Aware Manipulation Ordering |
NeurIPS 2025 |
— |
| 2025-01-01 |
GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains |
NeurIPS 2025 |
— |
| 2025-01-01 |
Image as a World: Generating Interactive World from Single Image via Panoramic Video Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions |
NeurIPS 2025 |
— |
| 2025-01-01 |
SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vision Function Layer in Multimodal LLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations |
NeurIPS 2025 |
— |
| 2025-01-01 |
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
HMVLM:Human Motion-Vision-Language Model via MoE LoRA |
NeurIPS 2025 |
— |
| 2025-01-01 |
Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing |
NeurIPS 2025 |
— |
| 2025-01-01 |
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities |
NeurIPS 2025 |
— |
| 2025-01-01 |
MindJourney: Test-Time Scaling with World Models for Spatial Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration |
NeurIPS 2025 |
— |
| 2025-01-01 |
Grounded Reinforcement Learning for Visual Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM |
NeurIPS 2025 |
— |
| 2025-01-01 |
PhysX-3D: Physical-Grounded 3D Asset Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Each Complexity Deserves a Pruning Policy |
NeurIPS 2025 |
— |
| 2025-01-01 |
CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification |
NeurIPS 2025 |
— |
| 2025-01-01 |
RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills |
NeurIPS 2025 |
— |
| 2025-01-01 |
Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study |
NeurIPS 2025 |
— |
| 2025-01-01 |
LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
OmniSVG: A Unified Scalable Vector Graphics Generation Model |
NeurIPS 2025 |
— |
| 2025-01-01 |
Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Multi-Modal Interactive Agent Layer for Few-Shot Universal Cross-Domain Retrieval and Beyond |
NeurIPS 2025 |
— |
| 2025-01-01 |
Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation |
NeurIPS 2025 |
— |
| 2025-01-01 |
PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series in Typhoon Forecasting |
NeurIPS 2025 |
— |
| 2025-01-01 |
VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set |
NeurIPS 2025 |
— |
| 2025-01-01 |
PathVQ: Reforming Computational Pathology Foundation Model for Whole Slide Image Analysis via Vector Quantization |
NeurIPS 2025 |
— |
| 2025-01-01 |
iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Perception Encoder: The best visual embeddings are not at the output of the network |
NeurIPS 2025 |
— |
| 2025-01-01 |
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection |
NeurIPS 2025 |
— |
| 2025-01-01 |
Omni-Mol: Multitask Molecular Model for Any-to-any Modalities |
NeurIPS 2025 |
— |
| 2025-01-01 |
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation |
NeurIPS 2025 |
— |
| 2025-01-01 |
FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns |
NeurIPS 2025 |
— |
| 2025-01-01 |
NavBench: Probing Multimodal Large Language Models for Embodied Navigation |
NeurIPS 2025 |
— |
| 2025-01-01 |
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs |
NeurIPS 2025 |
— |
| 2025-01-01 |
SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension |
NeurIPS 2025 |
— |
| 2025-01-01 |
Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents |
NeurIPS 2025 |
— |
| 2025-01-01 |
Sherlock: Self-Correcting Reasoning in Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling |
NeurIPS 2025 |
— |
| 2025-01-01 |
Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization |
NeurIPS 2025 |
— |
| 2025-01-01 |
Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization |
NeurIPS 2025 |
— |
| 2025-01-01 |
PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding |
NeurIPS 2025 |
— |
| 2025-01-01 |
Systematic Reward Gap Optimization for Mitigating VLM Hallucinations |
NeurIPS 2025 |
— |
| 2025-01-01 |
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge |
NeurIPS 2025 |
— |
| 2025-01-01 |
Approximate Domain Unlearning for Vision-Language Models |
NeurIPS 2025 |
— |
| 2025-01-01 |
Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering |
NeurIPS 2025 |
— |
| 2025-01-01 |
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning |
NeurIPS 2025 |
— |
| 2025-01-01 |
GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning |
NeurIPS 2025 |
— |
| 2025-01-01 |
Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation |
NeurIPS 2025 |
— |
| 2025-01-01 |
EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution |
NeurIPS 2025 |
— |
| 2025-01-01 |
RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics |
NeurIPS 2025 |
— |
| 2025-01-01 |
Machine Unlearning via Task Simplex Arithmetic |
NeurIPS 2025 |
— |
| 2025-01-01 |
One-for-All Few-Shot Anomaly Detection via Instance-Induced Prompt Learning |
ICLR 2025 |
— |
| 2025-01-01 |
Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs |
ICLR 2025 |
— |
| 2025-01-01 |
Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images |
ICLR 2025 |
— |
| 2025-01-01 |
Should VLMs be Pre-trained with Image Data? |
ICLR 2025 |
— |
| 2025-01-01 |
DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning |
ICLR 2025 |
— |
| 2025-01-01 |
Generating CAD Code with Vision-Language Models for 3D Designs |
ICLR 2025 |
— |
| 2025-01-01 |
Locality Alignment Improves Vision-Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
Modality-Specialized Synergizers for Interleaved Vision-Language Generalists |
ICLR 2025 |
— |
| 2025-01-01 |
Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering |
ICLR 2025 |
— |
| 2025-01-01 |
Large (Vision) Language Models are Unsupervised In-Context Learners |
ICLR 2025 |
— |
| 2025-01-01 |
Vision Language Models are In-Context Value Learners |
ICLR 2025 |
— |
| 2025-01-01 |
Is Your Video Language Model a Reliable Judge? |
ICLR 2025 |
— |
| 2025-01-01 |
See It from My Perspective: How Language Affects Cultural Bias in Image Understanding |
ICLR 2025 |
— |
| 2025-01-01 |
Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset |
ICLR 2025 |
— |
| 2025-01-01 |
Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning |
ICLR 2025 |
— |
| 2025-01-01 |
MM-EMBED: UNIVERSAL MULTIMODAL RETRIEVAL WITH MULTIMODAL LLMS |
ICLR 2025 |
— |
| 2025-01-01 |
TULIP: Token-length Upgraded CLIP |
ICLR 2025 |
— |
| 2025-01-01 |
DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate |
ICLR 2025 |
— |
| 2025-01-01 |
LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning |
ICLR 2025 |
— |
| 2025-01-01 |
ColPali: Efficient Document Retrieval with Vision Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
ZooProbe: A Data Engine for Evaluating, Exploring, and Evolving Large-scale Training Data for Multimodal LLMs |
ICLR 2025 |
— |
| 2025-01-01 |
Causal Graphical Models for Vision-Language Compositional Understanding |
ICLR 2025 |
— |
| 2025-01-01 |
VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration |
ICLR 2025 |
— |
| 2025-01-01 |
Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning |
ICLR 2025 |
— |
| 2025-01-01 |
GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation |
ICLR 2025 |
— |
| 2025-01-01 |
Aligning Visual Contrastive learning models via Preference Optimization |
ICLR 2025 |
— |
| 2025-01-01 |
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages |
ICLR 2025 |
— |
| 2025-01-01 |
Sketch2Diagram: Generating Vector Diagrams from Hand-Drawn Sketches |
ICLR 2025 |
— |
| 2025-01-01 |
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models? |
ICLR 2025 |
— |
| 2025-01-01 |
NL-Eye: Abductive NLI For Images |
ICLR 2025 |
— |
| 2025-01-01 |
Divergence-enhanced Knowledge-guided Context Optimization for Visual-Language Prompt Tuning |
ICLR 2025 |
— |
| 2025-01-01 |
Measuring And Improving Engagement of Text-to-Image Generation Models |
ICLR 2025 |
— |
| 2025-01-01 |
VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation |
ICLR 2025 |
— |
| 2025-01-01 |
Teaching Human Behavior Improves Content Understanding Abilities Of VLMs |
ICLR 2025 |
— |
| 2025-01-01 |
Lightweight Neural App Control |
ICLR 2025 |
— |
| 2025-01-01 |
Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model |
ICLR 2025 |
— |
| 2025-01-01 |
Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision |
ICLR 2025 |
— |
| 2025-01-01 |
MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning |
ICLR 2025 |
— |
| 2025-01-01 |
MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models |
ICLR 2025 |
— |
| 2025-01-01 |
ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts |
ICLR 2025 |
— |
| 2025-01-01 |
VLMaterial: Procedural Material Generation with Large Vision-Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs |
ICLR 2025 |
— |
| 2025-01-01 |
MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation |
ICLR 2025 |
— |
| 2025-01-01 |
Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions? |
ICLR 2025 |
— |
| 2025-01-01 |
Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation |
ICLR 2025 |
— |
| 2025-01-01 |
Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models |
ICLR 2025 |
— |
| 2025-01-01 |
Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation |
ICLR 2025 |
— |
| 2025-01-01 |
VisualPredicator: Learning Abstract World Models with Neuro-Symbolic Predicates for Robot Planning |
ICLR 2025 |
— |
| 2025-01-01 |
Can We Talk Models Into Seeing the World Differently? |
ICLR 2025 |
— |
| 2025-01-01 |
Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters |
ICLR 2025 |
— |
| 2025-01-01 |
LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension |
ICLR 2025 |
— |
| 2025-01-01 |
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine |
ICLR 2025 |
— |
| 2025-01-01 |
LLaRA: Supercharging Robot Learning Data for Vision-Language Policy |
ICLR 2025 |
— |
| 2025-01-01 |
AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials |
ICLR 2025 |
— |
| 2025-01-01 |
MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding |
ICLR 2025 |
— |
| 2025-01-01 |
MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs |
ICLR 2025 |
— |
| 2025-01-01 |
Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models |
ICLR 2025 |
— |
| 2025-01-01 |
Language-Assisted Feature Transformation for Anomaly Detection |
ICLR 2025 |
— |
| 2025-01-01 |
SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding |
ICLR 2025 |
— |
| 2025-01-01 |
Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations |
ICLR 2025 |
— |
| 2025-01-01 |
Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment |
ICLR 2025 |
— |
| 2025-01-01 |
CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs |
ICLR 2025 |
— |
| 2025-01-01 |
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? |
ICLR 2025 |
— |
| 2025-01-01 |
Noisy Test-Time Adaptation in Vision-Language Models |
ICLR 2025 |
— |