How Confident are Video Models? Empowering Video Models to Express their Uncertainty
Fuente:
arXiv
Guardado en:
| Autores principales: | Mei, Zhiting, Shorinwa, Ola, Majumdar, Anirudha |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
Geometry Meets Vision: Revisiting Pretrained Semantics in Distilled Fields
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions
por: Shorinwa, Ola, et al.
Publicado: (2024)
por: Shorinwa, Ola, et al.
Publicado: (2024)
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
por: Mei, Zhiting, et al.
Publicado: (2025)
por: Mei, Zhiting, et al.
Publicado: (2025)
WoMAP: World Models For Embodied Open-Vocabulary Object Localization
por: Yin, Tenny, et al.
Publicado: (2025)
por: Yin, Tenny, et al.
Publicado: (2025)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
por: Li, Huiqiong, et al.
Publicado: (2026)
por: Li, Huiqiong, et al.
Publicado: (2026)
SIREN: Semantic, Initialization-Free Registration of Multi-Robot Gaussian Splatting Maps
por: Shorinwa, Ola, et al.
Publicado: (2025)
por: Shorinwa, Ola, et al.
Publicado: (2025)
Pandora: Towards General World Model with Natural Language Actions and Video States
por: Xiang, Jiannan, et al.
Publicado: (2024)
por: Xiang, Jiannan, et al.
Publicado: (2024)
Thinking in Frames: How Visual Context and Test-Time Scaling Empower Video Reasoning
por: Li, Chengzu, et al.
Publicado: (2026)
por: Li, Chengzu, et al.
Publicado: (2026)
LLM-grounded Video Diffusion Models
por: Lian, Long, et al.
Publicado: (2023)
por: Lian, Long, et al.
Publicado: (2023)
CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling
por: Sarkar, Sayan Deb, et al.
Publicado: (2026)
por: Sarkar, Sayan Deb, et al.
Publicado: (2026)
VERDI: VLM-Embedded Reasoning for Autonomous Driving
por: Feng, Bowen, et al.
Publicado: (2025)
por: Feng, Bowen, et al.
Publicado: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
por: Zhang, Yongheng, et al.
Publicado: (2025)
por: Zhang, Yongheng, et al.
Publicado: (2025)
VideoNorms: Benchmarking Cultural Awareness of Video Language Models
por: Varimalla, Nikhil Reddy, et al.
Publicado: (2025)
por: Varimalla, Nikhil Reddy, et al.
Publicado: (2025)
VideoExplorer: Think With Videos For Agentic Long-Video Understanding
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Can Video Large Multimodal Models Think Like Doubters-or Double-Down: A Study on Defeasible Video Entailment
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
ICSVR: Investigating Compositional and Syntactic Understanding in Video Retrieval Models
por: Madasu, Avinash, et al.
Publicado: (2023)
por: Madasu, Avinash, et al.
Publicado: (2023)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
por: Shi, Yang, et al.
Publicado: (2025)
por: Shi, Yang, et al.
Publicado: (2025)
VideoTree: Adaptive Tree-based Video Representation for LLM Reasoning on Long Videos
por: Wang, Ziyang, et al.
Publicado: (2024)
por: Wang, Ziyang, et al.
Publicado: (2024)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models
por: Poppi, Tobia, et al.
Publicado: (2026)
por: Poppi, Tobia, et al.
Publicado: (2026)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
por: He, Xuehai, et al.
Publicado: (2024)
por: He, Xuehai, et al.
Publicado: (2024)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
por: Li, Shicheng, et al.
Publicado: (2023)
por: Li, Shicheng, et al.
Publicado: (2023)
Moment Sampling in Video LLMs for Long-Form Video QA
por: Chasmai, Mustafa, et al.
Publicado: (2025)
por: Chasmai, Mustafa, et al.
Publicado: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Factorized Learning for Temporally Grounded Video-Language Models
por: Zeng, Wenzheng, et al.
Publicado: (2025)
por: Zeng, Wenzheng, et al.
Publicado: (2025)
VideoGameBench: Can Vision-Language Models complete popular video games?
por: Zhang, Alex L., et al.
Publicado: (2025)
por: Zhang, Alex L., et al.
Publicado: (2025)
Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering
por: Wang, Haibo, et al.
Publicado: (2024)
por: Wang, Haibo, et al.
Publicado: (2024)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
por: Suglia, Alessandro, et al.
Publicado: (2024)
por: Suglia, Alessandro, et al.
Publicado: (2024)
Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos
por: Reichman, Benjamin, et al.
Publicado: (2025)
por: Reichman, Benjamin, et al.
Publicado: (2025)
VC4VG: Optimizing Video Captions for Text-to-Video Generation
por: Du, Yang, et al.
Publicado: (2025)
por: Du, Yang, et al.
Publicado: (2025)
VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking
por: Lin, Jingyang, et al.
Publicado: (2026)
por: Lin, Jingyang, et al.
Publicado: (2026)
VLN-Video: Utilizing Driving Videos for Outdoor Vision-and-Language Navigation
por: Li, Jialu, et al.
Publicado: (2024)
por: Li, Jialu, et al.
Publicado: (2024)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
por: Wang, Yueqian, et al.
Publicado: (2024)
por: Wang, Yueqian, et al.
Publicado: (2024)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
por: Luo, Ziyang, et al.
Publicado: (2024)
por: Luo, Ziyang, et al.
Publicado: (2024)
VL-Calibration: Decoupled Confidence Calibration for Large Vision-Language Models Reasoning
por: Xiao, Wenyi, et al.
Publicado: (2026)
por: Xiao, Wenyi, et al.
Publicado: (2026)
VideoAgent: Long-form Video Understanding with Large Language Model as Agent
por: Wang, Xiaohan, et al.
Publicado: (2024)
por: Wang, Xiaohan, et al.
Publicado: (2024)
Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding
por: Wang, Ziyang, et al.
Publicado: (2025)
por: Wang, Ziyang, et al.
Publicado: (2025)
VideoScore2: Think before You Score in Generative Video Evaluation
por: He, Xuan, et al.
Publicado: (2025)
por: He, Xuan, et al.
Publicado: (2025)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
por: Feng, Weixi, et al.
Publicado: (2024)
por: Feng, Weixi, et al.
Publicado: (2024)
Ejemplares similares
-
World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty
por: Mei, Zhiting, et al.
Publicado: (2025) -
Geometry Meets Vision: Revisiting Pretrained Semantics in Distilled Fields
por: Mei, Zhiting, et al.
Publicado: (2025) -
A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions
por: Shorinwa, Ola, et al.
Publicado: (2024) -
Reasoning about Uncertainty: Do Reasoning Models Know When They Don't Know?
por: Mei, Zhiting, et al.
Publicado: (2025) -
WoMAP: World Models For Embodied Open-Vocabulary Object Localization
por: Yin, Tenny, et al.
Publicado: (2025)