Salvato in:
| Autori principali: | Liu, Ming, Zhang, Wensheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2503.05977 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility
di: Motamed, Saman, et al.
Pubblicazione: (2025)
di: Motamed, Saman, et al.
Pubblicazione: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
di: Wen, Zichen, et al.
Pubblicazione: (2026)
di: Wen, Zichen, et al.
Pubblicazione: (2026)
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
WorldModelBench: Judging Video Generation Models As World Models
di: Li, Dacheng, et al.
Pubblicazione: (2025)
di: Li, Dacheng, et al.
Pubblicazione: (2025)
PRIME: Protect Your Videos From Malicious Editing
di: Li, Guanlin, et al.
Pubblicazione: (2024)
di: Li, Guanlin, et al.
Pubblicazione: (2024)
Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models
di: Lu, Tianyi, et al.
Pubblicazione: (2023)
di: Lu, Tianyi, et al.
Pubblicazione: (2023)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
di: Wang, Haibo, et al.
Pubblicazione: (2025)
di: Wang, Haibo, et al.
Pubblicazione: (2025)
Temporal Regularization Makes Your Video Generator Stronger
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
di: Chen, Harold Haodong, et al.
Pubblicazione: (2025)
AdaptGCD: Multi-Expert Adapter Tuning for Generalized Category Discovery
di: Qu, Yuxun, et al.
Pubblicazione: (2024)
di: Qu, Yuxun, et al.
Pubblicazione: (2024)
DeVAn: Dense Video Annotation for Video-Language Models
di: Liu, Tingkai, et al.
Pubblicazione: (2023)
di: Liu, Tingkai, et al.
Pubblicazione: (2023)
Pack and Force Your Memory: Long-form and Consistent Video Generation
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
di: Wu, Xiaofei, et al.
Pubblicazione: (2025)
LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2026)
di: Jiang, Zhiyuan, et al.
Pubblicazione: (2026)
VideoPoet: A Large Language Model for Zero-Shot Video Generation
di: Kondratyuk, Dan, et al.
Pubblicazione: (2023)
di: Kondratyuk, Dan, et al.
Pubblicazione: (2023)
Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models
di: Xing, Wenbin, et al.
Pubblicazione: (2026)
di: Xing, Wenbin, et al.
Pubblicazione: (2026)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
di: Li, Yifei, et al.
Pubblicazione: (2025)
di: Li, Yifei, et al.
Pubblicazione: (2025)
Your One-Stop Solution for AI-Generated Video Detection
di: Ma, Long, et al.
Pubblicazione: (2026)
di: Ma, Long, et al.
Pubblicazione: (2026)
Med-RewardBench: Benchmarking Reward Models and Judges for Medical Multimodal Large Language Models
di: Ding, Meidan, et al.
Pubblicazione: (2025)
di: Ding, Meidan, et al.
Pubblicazione: (2025)
GameVerse: Can Vision-Language Models Learn from Video-based Reflection?
di: Zhang, Kuan, et al.
Pubblicazione: (2026)
di: Zhang, Kuan, et al.
Pubblicazione: (2026)
To Trust Or Not To Trust Your Vision-Language Model's Prediction
di: Dong, Hao, et al.
Pubblicazione: (2025)
di: Dong, Hao, et al.
Pubblicazione: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
di: Wang, Zhepeng, et al.
Pubblicazione: (2025)
Can Vision Language Models Judge Action Quality? An Empirical Evaluation
di: Freitas, Miguel Monte e, et al.
Pubblicazione: (2026)
di: Freitas, Miguel Monte e, et al.
Pubblicazione: (2026)
Don't Judge by the Look: Towards Motion Coherent Video Representation
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
di: Guo, Xuyang, et al.
Pubblicazione: (2025)
When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning
di: Wu, Zhengxian, et al.
Pubblicazione: (2026)
di: Wu, Zhengxian, et al.
Pubblicazione: (2026)
You Only Judge Once: Multi-response Reward Modeling in a Single Forward Pass
di: Yang, Yinuo, et al.
Pubblicazione: (2026)
di: Yang, Yinuo, et al.
Pubblicazione: (2026)
SketchJudge: A Diagnostic Benchmark for Grading Hand-drawn Diagrams with Multimodal Large Language Models
di: Su, Yuhang, et al.
Pubblicazione: (2026)
di: Su, Yuhang, et al.
Pubblicazione: (2026)
Explicit Abstention Knobs for Predictable Reliability in Video Question Answering
di: Ortiz, Jorge
Pubblicazione: (2025)
di: Ortiz, Jorge
Pubblicazione: (2025)
Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
Bootstrap Your Own Views: Masked Ego-Exo Modeling for Fine-grained View-invariant Video Representations
di: Park, Jungin, et al.
Pubblicazione: (2025)
di: Park, Jungin, et al.
Pubblicazione: (2025)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
di: Wang, Guankun, et al.
Pubblicazione: (2025)
di: Wang, Guankun, et al.
Pubblicazione: (2025)
VideoCogQA: A Controllable Benchmark for Evaluating Cognitive Abilities in Video-Language Models
di: Li, Chenglin, et al.
Pubblicazione: (2024)
di: Li, Chenglin, et al.
Pubblicazione: (2024)
CopyJudge: Automated Copyright Infringement Identification and Mitigation in Text-to-Image Diffusion Models
di: Liu, Shunchang, et al.
Pubblicazione: (2025)
di: Liu, Shunchang, et al.
Pubblicazione: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
di: Li, Shicheng, et al.
Pubblicazione: (2025)
di: Li, Shicheng, et al.
Pubblicazione: (2025)
MedProbCLIP: Probabilistic Adaptation of Vision-Language Foundation Model for Reliable Radiograph-Report Retrieval
di: Elallaf, Ahmad, et al.
Pubblicazione: (2026)
di: Elallaf, Ahmad, et al.
Pubblicazione: (2026)
TRCE: Towards Reliable Malicious Concept Erasure in Text-to-Image Diffusion Models
di: Chen, Ruidong, et al.
Pubblicazione: (2025)
di: Chen, Ruidong, et al.
Pubblicazione: (2025)
COLT: Enhancing Video Large Language Models with Continual Tool Usage
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
di: Liu, Yuyang, et al.
Pubblicazione: (2025)
AD-EE: Early Exiting for Fast and Reliable Vision-Language Models in Autonomous Driving
di: Huang, Lianming, et al.
Pubblicazione: (2025)
di: Huang, Lianming, et al.
Pubblicazione: (2025)
From Evaluation to Defense: Advancing Safety in Video Large Language Models
di: Sun, Yiwei, et al.
Pubblicazione: (2025)
di: Sun, Yiwei, et al.
Pubblicazione: (2025)
ProJudge: A Multi-Modal Multi-Discipline Benchmark and Instruction-Tuning Dataset for MLLM-based Process Judges
di: Ai, Jiaxin, et al.
Pubblicazione: (2025)
di: Ai, Jiaxin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Natural Reflection Backdoor Attack on Vision Language Model for Autonomous Driving
di: Liu, Ming, et al.
Pubblicazione: (2025) -
TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility
di: Motamed, Saman, et al.
Pubblicazione: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
di: Wen, Zichen, et al.
Pubblicazione: (2026) -
MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark
di: Chen, Dongping, et al.
Pubblicazione: (2024) -
WorldModelBench: Judging Video Generation Models As World Models
di: Li, Dacheng, et al.
Pubblicazione: (2025)