Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Liping, Wang, Jiawei, Sun, Haomiao, Zhang, Yuchen, Lin, Yuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Tarsier: Recipes for Training and Evaluating Large Video Description Models
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
Boximator: Generating Rich and Controllable Motions for Video Synthesis
por: Wang, Jiawei, et al.
Publicado: (2024)
por: Wang, Jiawei, et al.
Publicado: (2024)
StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification
por: He, Yichen, et al.
Publicado: (2024)
por: He, Yichen, et al.
Publicado: (2024)
From Evaluation to Defense: Advancing Safety in Video Large Language Models
por: Sun, Yiwei, et al.
Publicado: (2025)
por: Sun, Yiwei, et al.
Publicado: (2025)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning
por: Dang, Jisheng, et al.
Publicado: (2025)
por: Dang, Jisheng, et al.
Publicado: (2025)
OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation
por: Yuan, Shenghai, et al.
Publicado: (2025)
por: Yuan, Shenghai, et al.
Publicado: (2025)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
por: Zhang, Zhihong, et al.
Publicado: (2025)
por: Zhang, Zhihong, et al.
Publicado: (2025)
Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
por: Clark, Christopher, et al.
Publicado: (2026)
por: Clark, Christopher, et al.
Publicado: (2026)
Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge
por: Xiong, Haomiao, et al.
Publicado: (2025)
por: Xiong, Haomiao, et al.
Publicado: (2025)
Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models
por: Huang, Zitong, et al.
Publicado: (2026)
por: Huang, Zitong, et al.
Publicado: (2026)
VLBiasBench: A Comprehensive Benchmark for Evaluating Bias in Large Vision-Language Model
por: Wang, Sibo, et al.
Publicado: (2024)
por: Wang, Sibo, et al.
Publicado: (2024)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024)
por: Yuan, Yuqian, et al.
Publicado: (2024)
SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model
por: Wang, Guankun, et al.
Publicado: (2025)
por: Wang, Guankun, et al.
Publicado: (2025)
LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models
por: Ge, Qihang, et al.
Publicado: (2024)
por: Ge, Qihang, et al.
Publicado: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
VEU-Bench: Towards Comprehensive Understanding of Video Editing
por: Li, Bozheng, et al.
Publicado: (2025)
por: Li, Bozheng, et al.
Publicado: (2025)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
por: Chen, Shimin, et al.
Publicado: (2024)
por: Chen, Shimin, et al.
Publicado: (2024)
One-Step Diffusion for Detail-Rich and Temporally Consistent Video Super-Resolution
por: Sun, Yujing, et al.
Publicado: (2025)
por: Sun, Yujing, et al.
Publicado: (2025)
ReWatch-R1: Boosting Complex Video Reasoning in Large Vision-Language Models through Agentic Data Synthesis
por: Zhang, Congzhi, et al.
Publicado: (2025)
por: Zhang, Congzhi, et al.
Publicado: (2025)
VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding
por: He, Zhihao, et al.
Publicado: (2026)
por: He, Zhihao, et al.
Publicado: (2026)
TimeSearch: Hierarchical Video Search with Spotlight and Reflection for Human-like Long Video Understanding
por: Pan, Junwen, et al.
Publicado: (2025)
por: Pan, Junwen, et al.
Publicado: (2025)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
por: Li, Shicheng, et al.
Publicado: (2025)
por: Li, Shicheng, et al.
Publicado: (2025)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
por: Liang, Baoyu, et al.
Publicado: (2025)
por: Liang, Baoyu, et al.
Publicado: (2025)
Medical Large Vision Language Models with Multi-Image Visual Ability
por: Yang, Xikai, et al.
Publicado: (2025)
por: Yang, Xikai, et al.
Publicado: (2025)
Agentic Video Intelligence: A Flexible Framework for Advanced Video Exploration and Understanding
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
Efficient Training of Large Vision Models via Advanced Automated Progressive Learning
por: Li, Changlin, et al.
Publicado: (2024)
por: Li, Changlin, et al.
Publicado: (2024)
AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering
por: Chen, Xiuyuan, et al.
Publicado: (2023)
por: Chen, Xiuyuan, et al.
Publicado: (2023)
CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating
por: Wang, Jiyuan, et al.
Publicado: (2026)
por: Wang, Jiyuan, et al.
Publicado: (2026)
Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models
por: Gu, Zheyuan, et al.
Publicado: (2026)
por: Gu, Zheyuan, et al.
Publicado: (2026)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
por: Zohar, Orr, et al.
Publicado: (2024)
por: Zohar, Orr, et al.
Publicado: (2024)
MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models
por: Yang, Garry, et al.
Publicado: (2025)
por: Yang, Garry, et al.
Publicado: (2025)
WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model
por: Li, Zongjian, et al.
Publicado: (2024)
por: Li, Zongjian, et al.
Publicado: (2024)
FAVOR-Bench: A Comprehensive Benchmark for Fine-Grained Video Motion Understanding
por: Tu, Chongjun, et al.
Publicado: (2025)
por: Tu, Chongjun, et al.
Publicado: (2025)
IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes
por: Liang, Yujia, et al.
Publicado: (2025)
por: Liang, Yujia, et al.
Publicado: (2025)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
por: Lin, Kuanwei, et al.
Publicado: (2026)
por: Lin, Kuanwei, et al.
Publicado: (2026)
Artemis: Towards Referential Understanding in Complex Videos
por: Qiu, Jihao, et al.
Publicado: (2024)
por: Qiu, Jihao, et al.
Publicado: (2024)
Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification
por: Qin, Minghao, et al.
Publicado: (2025)
por: Qin, Minghao, et al.
Publicado: (2025)
VideoPrism: A Foundational Visual Encoder for Video Understanding
por: Zhao, Long, et al.
Publicado: (2024)
por: Zhao, Long, et al.
Publicado: (2024)
Ejemplares similares
-
Tarsier: Recipes for Training and Evaluating Large Video Description Models
por: Wang, Jiawei, et al.
Publicado: (2024) -
Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models
por: Chen, Shimin, et al.
Publicado: (2024) -
Boximator: Generating Rich and Controllable Motions for Video Synthesis
por: Wang, Jiawei, et al.
Publicado: (2024) -
StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification
por: He, Yichen, et al.
Publicado: (2024) -
From Evaluation to Defense: Advancing Safety in Video Large Language Models
por: Sun, Yiwei, et al.
Publicado: (2025)