Skip to content

Vision-Language Models — 2025 · Paper list (400)

January 2025 (400)

Date Paper Venue Why selected
2025-01-01 GoalLadder: Incremental Goal Discovery with Vision-Language Models NeurIPS 2025
2025-01-01 Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect NeurIPS 2025
2025-01-01 World-aware Planning Narratives Enhance Large Vision-Language Model Planner NeurIPS 2025
2025-01-01 OpenCUA: Open Foundations for Computer-Use Agents NeurIPS 2025
2025-01-01 Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models NeurIPS 2025
2025-01-01 CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation NeurIPS 2025
2025-01-01 Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics NeurIPS 2025
2025-01-01 Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs NeurIPS 2025
2025-01-01 Filter Like You Test: Data-Driven Data Filtering for CLIP Pretraining NeurIPS 2025
2025-01-01 Learning Robust Vision-Language Models from Natural Latent Spaces NeurIPS 2025
2025-01-01 Towards General Continuous Memory for Vision-Language Models NeurIPS 2025
2025-01-01 Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination NeurIPS 2025
2025-01-01 MemEIC: A Step Toward Continual and Compositional Knowledge Editing NeurIPS 2025
2025-01-01 Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better NeurIPS 2025
2025-01-01 Scaffolding Dexterous Manipulation with Vision-Language Models NeurIPS 2025
2025-01-01 Real-Time Execution of Action Chunking Flow Policies NeurIPS 2025
2025-01-01 GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution NeurIPS 2025
2025-01-01 Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model NeurIPS 2025
2025-01-01 OpenWorldSAM: Extending SAM2 for Universal Image Segmentation with Language Prompts NeurIPS 2025
2025-01-01 TRAP: Targeted Redirecting of Agentic Preferences NeurIPS 2025
2025-01-01 Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models NeurIPS 2025
2025-01-01 Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models NeurIPS 2025
2025-01-01 LMFusion: Adapting Pretrained Language Models for Multimodal Generation NeurIPS 2025
2025-01-01 ActiveVOO: Value of Observation Guided Active Knowledge Acquisition for Open-World Embodied Lifted Regression Planning NeurIPS 2025
2025-01-01 Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents NeurIPS 2025
2025-01-01 OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles NeurIPS 2025
2025-01-01 Towards Self-Refinement of Vision-Language Models with Triangular Consistency NeurIPS 2025
2025-01-01 Vision-and-Language Training Helps Deploy Taxonomic Knowledge but Does Not Fundamentally Alter It NeurIPS 2025
2025-01-01 SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes NeurIPS 2025
2025-01-01 One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding NeurIPS 2025
2025-01-01 ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models NeurIPS 2025
2025-01-01 PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments NeurIPS 2025
2025-01-01 Head Pursuit: Probing Attention Specialization in Multimodal Transformers NeurIPS 2025
2025-01-01 Beyond Greedy Exits: Improved Early Exit Decisions for Risk Control and Reliability NeurIPS 2025
2025-01-01 TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models NeurIPS 2025
2025-01-01 Quantifying Cross-Modality Memorization in Vision-Language Models NeurIPS 2025
2025-01-01 GRIT: Teaching MLLMs to Think with Images NeurIPS 2025
2025-01-01 Uni-MuMER: Unified Multi-Task Fine-Tuning of Vision-Language Model for Handwritten Mathematical Expression Recognition NeurIPS 2025
2025-01-01 The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models NeurIPS 2025
2025-01-01 Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models NeurIPS 2025
2025-01-01 FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts NeurIPS 2025
2025-01-01 Revisiting Logit Distributions for Reliable Out-of-Distribution Detection NeurIPS 2025
2025-01-01 un\(^2\)CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP NeurIPS 2025
2025-01-01 Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought NeurIPS 2025
2025-01-01 Instance-Level Composed Image Retrieval NeurIPS 2025
2025-01-01 Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval NeurIPS 2025
2025-01-01 Automated Model Discovery via Multi-modal & Multi-step Pipeline NeurIPS 2025
2025-01-01 SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches NeurIPS 2025
2025-01-01 MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling NeurIPS 2025
2025-01-01 SPRO: Improving Image Generation via Self-Play NeurIPS 2025
2025-01-01 BEAST: Efficient Tokenization of B-Splines Encoded Action Sequences for Imitation Learning NeurIPS 2025
2025-01-01 V-CECE: Visual Counterfactual Explanations via Conceptual Edits NeurIPS 2025
2025-01-01 Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning NeurIPS 2025
2025-01-01 Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing NeurIPS 2025
2025-01-01 Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models NeurIPS 2025
2025-01-01 HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models NeurIPS 2025
2025-01-01 HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning NeurIPS 2025
2025-01-01 Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models NeurIPS 2025
2025-01-01 VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents NeurIPS 2025
2025-01-01 DualCnst: Enhancing Zero-Shot Out-of-Distribution Detection via Text-Image Consistency in Vision-Language Models NeurIPS 2025
2025-01-01 SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning NeurIPS 2025
2025-01-01 Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding NeurIPS 2025
2025-01-01 Focus-Then-Reuse: Fast Adaptation in Visual Perturbation Environments NeurIPS 2025
2025-01-01 PrefixKV: Adaptive Prefix KV Cache is What Vision Instruction-Following Models Need for Efficient Generation NeurIPS 2025
2025-01-01 QuARI: Query Adaptive Retrieval Improvement NeurIPS 2025
2025-01-01 PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models NeurIPS 2025
2025-01-01 Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models NeurIPS 2025
2025-01-01 ForceVLA: Enhancing VLA Models with a Force-aware MoE for Contact-rich Manipulation NeurIPS 2025
2025-01-01 UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning NeurIPS 2025
2025-01-01 GenIR: Generative Visual Feedback for Mental Image Retrieval NeurIPS 2025
2025-01-01 Mint: A Simple Test-Time Adaptation of Vision-Language Models against Common Corruptions NeurIPS 2025
2025-01-01 Statistics Caching Test-Time Adaptation for Vision-Language Models NeurIPS 2025
2025-01-01 Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization NeurIPS 2025
2025-01-01 Aha! - Predicting What Matters Next: Online Highlight Detection Without Looking Ahead NeurIPS 2025
2025-01-01 SimWorld: An Open-ended Simulator for Agents in Physical and Social Worlds NeurIPS 2025
2025-01-01 SimWorld-Robotics: Synthesizing Photorealistic and Dynamic Urban Environments for Multimodal Robot Navigation and Collaboration NeurIPS 2025
2025-01-01 From Flat to Hierarchical: Extracting Sparse Representations with Matching Pursuit NeurIPS 2025
2025-01-01 4KAgent: Agentic Any Image to 4K Super-Resolution NeurIPS 2025
2025-01-01 Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models NeurIPS 2025
2025-01-01 ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs NeurIPS 2025
2025-01-01 Better Tokens for Better 3D: Advancing Vision-Language Modeling in 3D Medical Imaging NeurIPS 2025
2025-01-01 QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models NeurIPS 2025
2025-01-01 Caption This, Reason That: VLMs Caught in the Middle NeurIPS 2025
2025-01-01 AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning NeurIPS 2025
2025-01-01 ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks NeurIPS 2025
2025-01-01 Bridging the gap to real-world language-grounded visual concept learning NeurIPS 2025
2025-01-01 GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents NeurIPS 2025
2025-01-01 InstructSAM: A Training-free Framework for Instruction-Oriented Remote Sensing Object Recognition NeurIPS 2025
2025-01-01 FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency NeurIPS 2025
2025-01-01 AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents NeurIPS 2025
2025-01-01 AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining NeurIPS 2025
2025-01-01 BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models NeurIPS 2025
2025-01-01 Revealing Multimodal Causality with Large Language Models NeurIPS 2025
2025-01-01 SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation NeurIPS 2025
2025-01-01 Conditional Representation Learning for Customized Tasks NeurIPS 2025
2025-01-01 AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding NeurIPS 2025
2025-01-01 Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models NeurIPS 2025
2025-01-01 ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training NeurIPS 2025
2025-01-01 Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning NeurIPS 2025
2025-01-01 JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models NeurIPS 2025
2025-01-01 VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree NeurIPS 2025
2025-01-01 A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1 NeurIPS 2025
2025-01-01 3D Visual Illusion Depth Estimation NeurIPS 2025
2025-01-01 From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging NeurIPS 2025
2025-01-01 ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints NeurIPS 2025
2025-01-01 VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking NeurIPS 2025
2025-01-01 Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding NeurIPS 2025
2025-01-01 Towards Minimizing Feature Drift in Model Merging: Layer-wise Task Vector Fusion for Adaptive Knowledge Integration NeurIPS 2025
2025-01-01 Iterative Tool Usage Exploration for Multimodal Agents via Step-wise Preference Tuning NeurIPS 2025
2025-01-01 SceneDecorator: Towards Scene-Oriented Story Generation with Scene Planning and Scene Consistency NeurIPS 2025
2025-01-01 Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search NeurIPS 2025
2025-01-01 Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models NeurIPS 2025
2025-01-01 PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning NeurIPS 2025
2025-01-01 CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder NeurIPS 2025
2025-01-01 RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability NeurIPS 2025
2025-01-01 Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning NeurIPS 2025
2025-01-01 Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation NeurIPS 2025
2025-01-01 Vocabulary-Guided Gait Recognition NeurIPS 2025
2025-01-01 Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding NeurIPS 2025
2025-01-01 UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface NeurIPS 2025
2025-01-01 DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models NeurIPS 2025
2025-01-01 Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning NeurIPS 2025
2025-01-01 KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation NeurIPS 2025
2025-01-01 OOD-Barrier: Build a Middle-Barrier for Open-Set Single-Image Test Time Adaptation via Vision Language Models NeurIPS 2025
2025-01-01 Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation NeurIPS 2025
2025-01-01 SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement NeurIPS 2025
2025-01-01 Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards NeurIPS 2025
2025-01-01 DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs NeurIPS 2025
2025-01-01 Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer NeurIPS 2025
2025-01-01 MR. Video: MapReduce as an Effective Principle for Long Video Understanding NeurIPS 2025
2025-01-01 Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling NeurIPS 2025
2025-01-01 Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models NeurIPS 2025
2025-01-01 Compress & Cache: Vision token compression for efficient generation and retrieval NeurIPS 2025
2025-01-01 Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames NeurIPS 2025
2025-01-01 Best-of-N Jailbreaking NeurIPS 2025
2025-01-01 DREAM: Drafting with Refined Target Features and Entropy-Adaptive Cross-Attention Fusion for Multimodal Speculative Decoding NeurIPS 2025
2025-01-01 Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing NeurIPS 2025
2025-01-01 MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO NeurIPS 2025
2025-01-01 VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR NeurIPS 2025
2025-01-01 NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation NeurIPS 2025
2025-01-01 FHGS: Feature-Homogenized Gaussian Splatting NeurIPS 2025
2025-01-01 GuardReasoner-VL: Safeguarding VLMs via Reinforced Reasoning NeurIPS 2025
2025-01-01 BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation NeurIPS 2025
2025-01-01 Test-Time Adaptive Object Detection with Foundation Model NeurIPS 2025
2025-01-01 Robustness in Both Domains: CLIP Needs a Robust Text Encoder NeurIPS 2025
2025-01-01 Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection NeurIPS 2025
2025-01-01 VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions NeurIPS 2025
2025-01-01 Conditioning Matters: Training Diffusion Policies is Faster Than You Think NeurIPS 2025
2025-01-01 Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding NeurIPS 2025
2025-01-01 Understanding and Rectifying Safety Perception Distortion in VLMs NeurIPS 2025
2025-01-01 Synergistic Tensor and Pipeline Parallelism NeurIPS 2025
2025-01-01 What Can RL Bring to VLA Generalization? An Empirical Study NeurIPS 2025
2025-01-01 SRPO: Enhancing Multimodal LLM Reasoning via Reflection-Aware Reinforcement Learning NeurIPS 2025
2025-01-01 SpaceServe: Spatial Multiplexing of Complementary Encoders and Decoders for Multimodal LLMs NeurIPS 2025
2025-01-01 SpatialLM: Training Large Language Models for Structured Indoor Modeling NeurIPS 2025
2025-01-01 MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification NeurIPS 2025
2025-01-01 SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models NeurIPS 2025
2025-01-01 ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding NeurIPS 2025
2025-01-01 Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning NeurIPS 2025
2025-01-01 Attention! Your Vision Language Model Could Be Maliciously Manipulated NeurIPS 2025
2025-01-01 Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression NeurIPS 2025
2025-01-01 \(\Delta \mathrm{Energy}\): Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization NeurIPS 2025
2025-01-01 One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head NeurIPS 2025
2025-01-01 Unified Reinforcement and Imitation Learning for Vision-Language Models NeurIPS 2025
2025-01-01 SAFE: Multitask Failure Detection for Vision-Language-Action Models NeurIPS 2025
2025-01-01 ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding NeurIPS 2025
2025-01-01 Latent Chain-of-Thought for Visual Reasoning NeurIPS 2025
2025-01-01 Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs NeurIPS 2025
2025-01-01 ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal Parallelism NeurIPS 2025
2025-01-01 MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection NeurIPS 2025
2025-01-01 Human-assisted Robotic Policy Refinement via Action Preference Optimization NeurIPS 2025
2025-01-01 Multimodal Causal Reasoning for UAV Object Detection NeurIPS 2025
2025-01-01 VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models NeurIPS 2025
2025-01-01 Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding NeurIPS 2025
2025-01-01 Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere NeurIPS 2025
2025-01-01 BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization NeurIPS 2025
2025-01-01 VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning NeurIPS 2025
2025-01-01 VLMLight: Safety-Critical Traffic Signal Control via Vision-Language Meta-Control and Dual-Branch Reasoning Architecture NeurIPS 2025
2025-01-01 GUI Exploration Lab: Enhancing Screen Navigation in Agents via Multi-Turn Reinforcement Learning NeurIPS 2025
2025-01-01 ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding NeurIPS 2025
2025-01-01 CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning NeurIPS 2025
2025-01-01 CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model NeurIPS 2025
2025-01-01 AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding NeurIPS 2025
2025-01-01 An Information-theoretical Framework for Understanding Out-of-distribution Detection with Pretrained Vision-Language Models NeurIPS 2025
2025-01-01 Object-centric binding in Contrastive Language-Image Pretraining NeurIPS 2025
2025-01-01 Chain-of-Zoom: Extreme Super-Resolution via Scale Autoregression and Preference Alignment NeurIPS 2025
2025-01-01 VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning NeurIPS 2025
2025-01-01 ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation NeurIPS 2025
2025-01-01 Enhancing CLIP Robustness via Cross-Modality Alignment NeurIPS 2025
2025-01-01 SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism NeurIPS 2025
2025-01-01 Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing NeurIPS 2025
2025-01-01 Text to Sketch Generation with Multi-Styles NeurIPS 2025
2025-01-01 Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning NeurIPS 2025
2025-01-01 MEgoHand: Multimodal Egocentric Hand-Object Interaction Motion Generation NeurIPS 2025
2025-01-01 Bisecle: Binding and Separation in Continual Learning for Video Language Understanding NeurIPS 2025
2025-01-01 OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-time Emotional Speech Synthesis NeurIPS 2025
2025-01-01 NeedleInATable: Exploring Long-Context Capability of Large Language Models towards Long-Structured Tables NeurIPS 2025
2025-01-01 ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning NeurIPS 2025
2025-01-01 GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization NeurIPS 2025
2025-01-01 CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation NeurIPS 2025
2025-01-01 Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs NeurIPS 2025
2025-01-01 MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents NeurIPS 2025
2025-01-01 Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models NeurIPS 2025
2025-01-01 Scaling RL to Long Videos NeurIPS 2025
2025-01-01 Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning NeurIPS 2025
2025-01-01 VLMs can Aggregate Scattered Training Patches NeurIPS 2025
2025-01-01 CoFFT: Chain of Foresight-Focus Thought for Visual Language Models NeurIPS 2025
2025-01-01 Gaze-VLM: Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding NeurIPS 2025
2025-01-01 Domain Adaptive Hashing Retrieval via VLM Assisted Pseudo-Labeling and Dual Space Adaptation NeurIPS 2025
2025-01-01 Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models NeurIPS 2025
2025-01-01 VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought NeurIPS 2025
2025-01-01 Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency NeurIPS 2025
2025-01-01 VideoVLA: Video Generators Can Be Generalizable Robot Manipulators NeurIPS 2025
2025-01-01 Learning to Instruct for Visual Instruction Tuning NeurIPS 2025
2025-01-01 Knowledge-based Visual Question Answer with Multimodal Processing, Retrieval and Filtering NeurIPS 2025
2025-01-01 RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks NeurIPS 2025
2025-01-01 Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation NeurIPS 2025
2025-01-01 Gatekeeper: Improving Model Cascades Through Confidence Tuning NeurIPS 2025
2025-01-01 Learning to Steer: Input-dependent Steering for Multimodal LLMs NeurIPS 2025
2025-01-01 Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization NeurIPS 2025
2025-01-01 HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models NeurIPS 2025
2025-01-01 Learning a Cross-Modal Schrödinger Bridge for Visual Domain Generalization NeurIPS 2025
2025-01-01 VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding NeurIPS 2025
2025-01-01 Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats NeurIPS 2025
2025-01-01 Aux-Think: Exploring Reasoning Strategies for Data-Efficient Vision-Language Navigation NeurIPS 2025
2025-01-01 Rendering-Aware Reinforcement Learning for Vector Graphics Generation NeurIPS 2025
2025-01-01 Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization NeurIPS 2025
2025-01-01 VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models NeurIPS 2025
2025-01-01 SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding NeurIPS 2025
2025-01-01 GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity NeurIPS 2025
2025-01-01 Discovering Compositional Hallucinations in LVLMs NeurIPS 2025
2025-01-01 PlanarGS: High-Fidelity Indoor 3D Gaussian Splatting Guided by Vision-Language Planar Priors NeurIPS 2025
2025-01-01 Vision Transformers Don't Need Trained Registers NeurIPS 2025
2025-01-01 LaViDa: A Large Diffusion Language Model for Multimodal Understanding NeurIPS 2025
2025-01-01 On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models NeurIPS 2025
2025-01-01 Active Test-time Vision-Language Navigation NeurIPS 2025
2025-01-01 UniCTokens: Boosting Personalized Understanding and Generation via Unified Concept Tokens NeurIPS 2025
2025-01-01 DOTA: Distributional Test-time Adaptation of Vision-Language Models NeurIPS 2025
2025-01-01 VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction NeurIPS 2025
2025-01-01 VLA-Cache: Efficient Vision-Language-Action Manipulation via Adaptive Token Caching NeurIPS 2025
2025-01-01 EA3D: Online Open-World 3D Object Extraction from Streaming Videos NeurIPS 2025
2025-01-01 Noise Matters: Optimizing Matching Noise for Diffusion Classifiers NeurIPS 2025
2025-01-01 NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data NeurIPS 2025
2025-01-01 Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs NeurIPS 2025
2025-01-01 VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs NeurIPS 2025
2025-01-01 Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions NeurIPS 2025
2025-01-01 OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis NeurIPS 2025
2025-01-01 LVLM-Driven Attribute-Aware Modeling for Visible-Infrared Person Re-Identification NeurIPS 2025
2025-01-01 VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning NeurIPS 2025
2025-01-01 ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning NeurIPS 2025
2025-01-01 SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning NeurIPS 2025
2025-01-01 SuperCLIP: CLIP with Simple Classification Supervision NeurIPS 2025
2025-01-01 Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration NeurIPS 2025
2025-01-01 SCOPE: Saliency-Coverage Oriented Token Pruning for Efficient Multimodel LLMs NeurIPS 2025
2025-01-01 Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens NeurIPS 2025
2025-01-01 Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning NeurIPS 2025
2025-01-01 HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios NeurIPS 2025
2025-01-01 Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding NeurIPS 2025
2025-01-01 Spatial Understanding from Videos: Structured Prompts Meet Simulation Data NeurIPS 2025
2025-01-01 CF-VLM:CounterFactual Vision-Language Fine-tuning NeurIPS 2025
2025-01-01 UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback NeurIPS 2025
2025-01-01 ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models NeurIPS 2025
2025-01-01 JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation NeurIPS 2025
2025-01-01 MuSLR: Multimodal Symbolic Logical Reasoning NeurIPS 2025
2025-01-01 Learning Spatial-Aware Manipulation Ordering NeurIPS 2025
2025-01-01 GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains NeurIPS 2025
2025-01-01 Image as a World: Generating Interactive World from Single Image via Panoramic Video Generation NeurIPS 2025
2025-01-01 Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions NeurIPS 2025
2025-01-01 SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning NeurIPS 2025
2025-01-01 FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation NeurIPS 2025
2025-01-01 Vision Function Layer in Multimodal LLMs NeurIPS 2025
2025-01-01 Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations NeurIPS 2025
2025-01-01 Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs NeurIPS 2025
2025-01-01 HMVLM:Human Motion-Vision-Language Model via MoE LoRA NeurIPS 2025
2025-01-01 Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models NeurIPS 2025
2025-01-01 ThinkSound: Chain-of-Thought Reasoning in Multimodal LLMs for Audio Generation and Editing NeurIPS 2025
2025-01-01 MiCo: Multi-image Contrast for Reinforcement Visual Reasoning NeurIPS 2025
2025-01-01 Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities NeurIPS 2025
2025-01-01 MindJourney: Test-Time Scaling with World Models for Spatial Reasoning NeurIPS 2025
2025-01-01 EfficientVLA: Training-Free Acceleration and Compression for Vision-Language-Action Models NeurIPS 2025
2025-01-01 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration NeurIPS 2025
2025-01-01 Grounded Reinforcement Learning for Visual Reasoning NeurIPS 2025
2025-01-01 Unleashing the Potential of Multimodal LLMs for Zero-Shot Spatio-Temporal Video Grounding NeurIPS 2025
2025-01-01 Watch and Listen: Understanding Audio-Visual-Speech Moments with Multimodal LLM NeurIPS 2025
2025-01-01 PhysX-3D: Physical-Grounded 3D Asset Generation NeurIPS 2025
2025-01-01 Each Complexity Deserves a Pruning Policy NeurIPS 2025
2025-01-01 CogVLA: Cognition-Aligned Vision-Language-Action Models via Instruction-Driven Routing & Sparsification NeurIPS 2025
2025-01-01 RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills NeurIPS 2025
2025-01-01 Towards Physics-informed Spatial Intelligence with Human Priors: An Autonomous Driving Pilot Study NeurIPS 2025
2025-01-01 LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models NeurIPS 2025
2025-01-01 OmniSVG: A Unified Scalable Vector Graphics Generation Model NeurIPS 2025
2025-01-01 Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation NeurIPS 2025
2025-01-01 Multi-Modal Interactive Agent Layer for Few-Shot Universal Cross-Domain Retrieval and Beyond NeurIPS 2025
2025-01-01 Stable Cinemetrics : Structured Taxonomy and Evaluation for Professional Video Generation NeurIPS 2025
2025-01-01 PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series in Typhoon Forecasting NeurIPS 2025
2025-01-01 VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set NeurIPS 2025
2025-01-01 PathVQ: Reforming Computational Pathology Foundation Model for Whole Slide Image Analysis via Vector Quantization NeurIPS 2025
2025-01-01 iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning NeurIPS 2025
2025-01-01 Perception Encoder: The best visual embeddings are not at the output of the network NeurIPS 2025
2025-01-01 Universal Video Temporal Grounding with Generative Multi-modal Large Language Models NeurIPS 2025
2025-01-01 Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs NeurIPS 2025
2025-01-01 GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection NeurIPS 2025
2025-01-01 Omni-Mol: Multitask Molecular Model for Any-to-any Modalities NeurIPS 2025
2025-01-01 Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs NeurIPS 2025
2025-01-01 3D-Agent: A Tri-Modal Multi-Agent Responsive Framework for Comprehensive 3D Object Annotation NeurIPS 2025
2025-01-01 FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning NeurIPS 2025
2025-01-01 VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning NeurIPS 2025
2025-01-01 Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns NeurIPS 2025
2025-01-01 NavBench: Probing Multimodal Large Language Models for Embodied Navigation NeurIPS 2025
2025-01-01 Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models NeurIPS 2025
2025-01-01 FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models NeurIPS 2025
2025-01-01 Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs NeurIPS 2025
2025-01-01 SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding NeurIPS 2025
2025-01-01 Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension NeurIPS 2025
2025-01-01 Where Does It Exist from the Low-Altitude: Spatial Aerial Video Grounding NeurIPS 2025
2025-01-01 Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents NeurIPS 2025
2025-01-01 Sherlock: Self-Correcting Reasoning in Vision-Language Models NeurIPS 2025
2025-01-01 Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling NeurIPS 2025
2025-01-01 Exploring the Limits of Vision-Language-Action Manipulation in Cross-task Generalization NeurIPS 2025
2025-01-01 Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization NeurIPS 2025
2025-01-01 PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding NeurIPS 2025
2025-01-01 Systematic Reward Gap Optimization for Mitigating VLM Hallucinations NeurIPS 2025
2025-01-01 Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning NeurIPS 2025
2025-01-01 DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge NeurIPS 2025
2025-01-01 Approximate Domain Unlearning for Vision-Language Models NeurIPS 2025
2025-01-01 Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering NeurIPS 2025
2025-01-01 Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning NeurIPS 2025
2025-01-01 BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning NeurIPS 2025
2025-01-01 GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning NeurIPS 2025
2025-01-01 Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation NeurIPS 2025
2025-01-01 EvolvedGRPO: Unlocking Reasoning in LVLMs via Progressive Instruction Evolution NeurIPS 2025
2025-01-01 RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics NeurIPS 2025
2025-01-01 Machine Unlearning via Task Simplex Arithmetic NeurIPS 2025
2025-01-01 One-for-All Few-Shot Anomaly Detection via Instance-Induced Prompt Learning ICLR 2025
2025-01-01 Have the VLMs Lost Confidence? A Study of Sycophancy in VLMs ICLR 2025
2025-01-01 Tracking the Copyright of Large Vision-Language Models through Parameter Learning Adversarial Images ICLR 2025
2025-01-01 Should VLMs be Pre-trained with Image Data? ICLR 2025
2025-01-01 DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models ICLR 2025
2025-01-01 ExACT: Teaching AI Agents to Explore with Reflective-MCTS and Exploratory Learning ICLR 2025
2025-01-01 Generating CAD Code with Vision-Language Models for 3D Designs ICLR 2025
2025-01-01 Locality Alignment Improves Vision-Language Models ICLR 2025
2025-01-01 Modality-Specialized Synergizers for Interleaved Vision-Language Generalists ICLR 2025
2025-01-01 Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models ICLR 2025
2025-01-01 Reducing Hallucinations in Large Vision-Language Models via Latent Space Steering ICLR 2025
2025-01-01 Large (Vision) Language Models are Unsupervised In-Context Learners ICLR 2025
2025-01-01 Vision Language Models are In-Context Value Learners ICLR 2025
2025-01-01 Is Your Video Language Model a Reliable Judge? ICLR 2025
2025-01-01 See It from My Perspective: How Language Affects Cultural Bias in Image Understanding ICLR 2025
2025-01-01 Benchmarking Vision Language Model Unlearning via Fictitious Facial Identity Dataset ICLR 2025
2025-01-01 Q-SFT: Q-Learning for Language Models via Supervised Fine-Tuning ICLR 2025
2025-01-01 MM-EMBED: UNIVERSAL MULTIMODAL RETRIEVAL WITH MULTIMODAL LLMS ICLR 2025
2025-01-01 TULIP: Token-length Upgraded CLIP ICLR 2025
2025-01-01 DAMO: Decoding by Accumulating Activations Momentum for Mitigating Hallucinations in Vision-Language Models ICLR 2025
2025-01-01 Breaking Mental Set to Improve Reasoning through Diverse Multi-Agent Debate ICLR 2025
2025-01-01 LICORICE: Label-Efficient Concept-Based Interpretable Reinforcement Learning ICLR 2025
2025-01-01 ColPali: Efficient Document Retrieval with Vision Language Models ICLR 2025
2025-01-01 ZooProbe: A Data Engine for Evaluating, Exploring, and Evolving Large-scale Training Data for Multimodal LLMs ICLR 2025
2025-01-01 Causal Graphical Models for Vision-Language Compositional Understanding ICLR 2025
2025-01-01 VL-Cache: Sparsity and Modality-Aware KV Cache Compression for Vision-Language Model Inference Acceleration ICLR 2025
2025-01-01 Semantic Temporal Abstraction via Vision-Language Model Guidance for Efficient Reinforcement Learning ICLR 2025
2025-01-01 GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation ICLR 2025
2025-01-01 Aligning Visual Contrastive learning models via Preference Optimization ICLR 2025
2025-01-01 Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages ICLR 2025
2025-01-01 Sketch2Diagram: Generating Vector Diagrams from Hand-Drawn Sketches ICLR 2025
2025-01-01 How Does Vision-Language Adaptation Impact the Safety of Vision Language Models? ICLR 2025
2025-01-01 NL-Eye: Abductive NLI For Images ICLR 2025
2025-01-01 Divergence-enhanced Knowledge-guided Context Optimization for Visual-Language Prompt Tuning ICLR 2025
2025-01-01 Measuring And Improving Engagement of Text-to-Image Generation Models ICLR 2025
2025-01-01 VLAS: Vision-Language-Action Model with Speech Instructions for Customized Robot Manipulation ICLR 2025
2025-01-01 Teaching Human Behavior Improves Content Understanding Abilities Of VLMs ICLR 2025
2025-01-01 Lightweight Neural App Control ICLR 2025
2025-01-01 Solving Token Gradient Conflict in Mixture-of-Experts for Large Vision-Language Model ICLR 2025
2025-01-01 Iterative Label Refinement Matters More than Preference Optimization under Weak Supervision ICLR 2025
2025-01-01 MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning ICLR 2025
2025-01-01 MRAG-Bench: Vision-Centric Evaluation for Retrieval-Augmented Multimodal Models ICLR 2025
2025-01-01 ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts ICLR 2025
2025-01-01 VLMaterial: Procedural Material Generation with Large Vision-Language Models ICLR 2025
2025-01-01 Dysca: A Dynamic and Scalable Benchmark for Evaluating Perception Ability of LVLMs ICLR 2025
2025-01-01 MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation ICLR 2025
2025-01-01 Do Egocentric Video-Language Models Truly Understand Hand-Object Interactions? ICLR 2025
2025-01-01 Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation ICLR 2025
2025-01-01 Revisit Large-Scale Image-Caption Data in Pre-training Multimodal Foundation Models ICLR 2025
2025-01-01 Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation ICLR 2025
2025-01-01 VisualPredicator: Learning Abstract World Models with Neuro-Symbolic Predicates for Robot Planning ICLR 2025
2025-01-01 Can We Talk Models Into Seeing the World Differently? ICLR 2025
2025-01-01 Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters ICLR 2025
2025-01-01 LLM-wrapper: Black-Box Semantic-Aware Adaptation of Vision-Language Models for Referring Expression Comprehension ICLR 2025
2025-01-01 MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine ICLR 2025
2025-01-01 LLaRA: Supercharging Robot Learning Data for Vision-Language Policy ICLR 2025
2025-01-01 AgentTrek: Agent Trajectory Synthesis via Guiding Replay with Web Tutorials ICLR 2025
2025-01-01 MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding ICLR 2025
2025-01-01 MIA-Bench: Towards Better Instruction Following Evaluation of Multimodal LLMs ICLR 2025
2025-01-01 Mixture of Experts Made Personalized: Federated Prompt Learning for Vision-Language Models ICLR 2025
2025-01-01 Language-Assisted Feature Transformation for Anomaly Detection ICLR 2025
2025-01-01 SVBench: A Benchmark with Temporal Multi-Turn Dialogues for Streaming Video Understanding ICLR 2025
2025-01-01 Class Distribution-induced Attention Map for Open-vocabulary Semantic Segmentations ICLR 2025
2025-01-01 Interleaved Scene Graphs for Interleaved Text-and-Image Generation Assessment ICLR 2025
2025-01-01 CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs ICLR 2025
2025-01-01 DSBench: How Far Are Data Science Agents from Becoming Data Science Experts? ICLR 2025
2025-01-01 Noisy Test-Time Adaptation in Vision-Language Models ICLR 2025