Enregistré dans:
| Auteurs principaux: | Liu, Ming, Zhang, Wensheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2503.05977 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility
par: Motamed, Saman, et autres
Publié: (2025)
par: Motamed, Saman, et autres
Publié: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
par: Wen, Zichen, et autres
Publié: (2026)
par: Wen, Zichen, et autres
Publié: (2026)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
par: Chen, Dongping, et autres
Publié: (2024)
par: Chen, Dongping, et autres
Publié: (2024)
WorldModelBench: Judging Video Generation Models As World Models
par: Li, Dacheng, et autres
Publié: (2025)
par: Li, Dacheng, et autres
Publié: (2025)
PRIME: Protect Your Videos From Malicious Editing
par: Li, Guanlin, et autres
Publié: (2024)
par: Li, Guanlin, et autres
Publié: (2024)
Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models
par: Lu, Tianyi, et autres
Publié: (2023)
par: Lu, Tianyi, et autres
Publié: (2023)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
par: Wang, Haibo, et autres
Publié: (2025)
par: Wang, Haibo, et autres
Publié: (2025)
Temporal Regularization Makes Your Video Generator Stronger
par: Chen, Harold Haodong, et autres
Publié: (2025)
par: Chen, Harold Haodong, et autres
Publié: (2025)
AdaptGCD: Multi-Expert Adapter Tuning for Generalized Category Discovery
par: Qu, Yuxun, et autres
Publié: (2024)
par: Qu, Yuxun, et autres
Publié: (2024)
DeVAn: Dense Video Annotation for Video-Language Models
par: Liu, Tingkai, et autres
Publié: (2023)
par: Liu, Tingkai, et autres
Publié: (2023)
Pack and Force Your Memory: Long-form and Consistent Video Generation
par: Wu, Xiaofei, et autres
Publié: (2025)
par: Wu, Xiaofei, et autres
Publié: (2025)
LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models
par: Jiang, Zhiyuan, et autres
Publié: (2026)
par: Jiang, Zhiyuan, et autres
Publié: (2026)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
par: Kondratyuk, Dan, et autres
Publié: (2023)
par: Kondratyuk, Dan, et autres
Publié: (2023)
Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
par: Xing, Wenbin, et autres
Publié: (2026)
par: Xing, Wenbin, et autres
Publié: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
Your One-Stop Solution for AI-Generated Video Detection
par: Ma, Long, et autres
Publié: (2026)
par: Ma, Long, et autres
Publié: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
par: Ding, Meidan, et autres
Publié: (2025)
par: Ding, Meidan, et autres
Publié: (2025)
GameVerse: Can Vision-Language Models Learn from Video-based Reflection?
par: Zhang, Kuan, et autres
Publié: (2026)
par: Zhang, Kuan, et autres
Publié: (2026)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
par: Dong, Hao, et autres
Publié: (2025)
par: Dong, Hao, et autres
Publié: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
par: Wang, Zhepeng, et autres
Publié: (2025)
par: Wang, Zhepeng, et autres
Publié: (2025)
Can Vision Language Models Judge Action Quality? An Empirical Evaluation
par: Freitas, Miguel Monte e, et autres
Publié: (2026)
par: Freitas, Miguel Monte e, et autres
Publié: (2026)
Don't Judge by the Look: Towards Motion Coherent Video Representation
par: Zhang, Yitian, et autres
Publié: (2024)
par: Zhang, Yitian, et autres
Publié: (2024)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
par: Guo, Xuyang, et autres
Publié: (2025)
par: Guo, Xuyang, et autres
Publié: (2025)
When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning
par: Wu, Zhengxian, et autres
Publié: (2026)
par: Wu, Zhengxian, et autres
Publié: (2026)
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
par: Yang, Yinuo, et autres
Publié: (2026)
par: Yang, Yinuo, et autres
Publié: (2026)
SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models
par: Su, Yuhang, et autres
Publié: (2026)
par: Su, Yuhang, et autres
Publié: (2026)
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
par: Ortiz, Jorge
Publié: (2025)
par: Ortiz, Jorge
Publié: (2025)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
par: Gu, Xin, et autres
Publié: (2025)
par: Gu, Xin, et autres
Publié: (2025)
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
par: Park, Jungin, et autres
Publié: (2025)
par: Park, Jungin, et autres
Publié: (2025)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
par: Wang, Guankun, et autres
Publié: (2025)
par: Wang, Guankun, et autres
Publié: (2025)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
par: Li, Chenglin, et autres
Publié: (2024)
par: Li, Chenglin, et autres
Publié: (2024)
CopyJudge: Automated Copyright Infringement Identification and Mitigation in Text-to-Image Diffusion Models
par: Liu, Shunchang, et autres
Publié: (2025)
par: Liu, Shunchang, et autres
Publié: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
par: Li, Shicheng, et autres
Publié: (2025)
par: Li, Shicheng, et autres
Publié: (2025)
MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval
par: Elallaf, Ahmad, et autres
Publié: (2026)
par: Elallaf, Ahmad, et autres
Publié: (2026)
TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models
par: Chen, Ruidong, et autres
Publié: (2025)
par: Chen, Ruidong, et autres
Publié: (2025)
COLT: Enhancing Video Large Language Models with Continual Tool Usage
par: Liu, Yuyang, et autres
Publié: (2025)
par: Liu, Yuyang, et autres
Publié: (2025)
AD-EE: Early Exiting for Fast and Reliable Vision-Language Models in Autonomous Driving
par: Huang, Lianming, et autres
Publié: (2025)
par: Huang, Lianming, et autres
Publié: (2025)
From Evaluation to Defense: Advancing Safety in Video Large Language Models
par: Sun, Yiwei, et autres
Publié: (2025)
par: Sun, Yiwei, et autres
Publié: (2025)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
par: Ai, Jiaxin, et autres
Publié: (2025)
par: Ai, Jiaxin, et autres
Publié: (2025)
Documents similaires
-
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
par: Liu, Ming, et autres
Publié: (2025) -
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility
par: Motamed, Saman, et autres
Publié: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
par: Wen, Zichen, et autres
Publié: (2026) -
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
par: Chen, Dongping, et autres
Publié: (2024) -
WorldModelBench: Judging Video Generation Models As World Models
par: Li, Dacheng, et autres
Publié: (2025)