Tarsier: Recipes for Training and Evaluating Large Video Description Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Jiawei, Yuan, Liping, Zhang, Yuchen, Sun, Haomiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
di: Yuan, Liping, et al.
Pubblicazione: (2025)
di: Yuan, Liping, et al.
Pubblicazione: (2025)
Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
di: Liu, Yahui, et al.
Pubblicazione: (2025)
di: Liu, Yahui, et al.
Pubblicazione: (2025)
Evaluating Gemini LLM in Food Image-Based Recipe and Nutrition Description with EfficientNet-B4 Visual Backbone
di: Anam, Rizal Khoirul
Pubblicazione: (2025)
di: Anam, Rizal Khoirul
Pubblicazione: (2025)
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025)
di: Wang, Zekun, et al.
Pubblicazione: (2025)
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
di: Wang, Xinze, et al.
Pubblicazione: (2025)
di: Wang, Xinze, et al.
Pubblicazione: (2025)
MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
di: Yu, Tianyu, et al.
Pubblicazione: (2025)
Test-Time Training on Video Streams
di: Wang, Renhao, et al.
Pubblicazione: (2023)
di: Wang, Renhao, et al.
Pubblicazione: (2023)
Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models
di: Chu, Zhixuan, et al.
Pubblicazione: (2024)
di: Chu, Zhixuan, et al.
Pubblicazione: (2024)
LVSA: Training-Free Sparse Attention for Long Video Diffusion
di: Glorian, Gael, et al.
Pubblicazione: (2026)
di: Glorian, Gael, et al.
Pubblicazione: (2026)
FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity
di: Tang, Jian, et al.
Pubblicazione: (2026)
di: Tang, Jian, et al.
Pubblicazione: (2026)
Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation
di: Maduabuchi, Chika, et al.
Pubblicazione: (2025)
di: Maduabuchi, Chika, et al.
Pubblicazione: (2025)
LRM-Zero: Training Large Reconstruction Models with Synthesized Data
di: Xie, Desai, et al.
Pubblicazione: (2024)
di: Xie, Desai, et al.
Pubblicazione: (2024)
Deep Image-to-Recipe Translation
di: Ma, Jiangqin, et al.
Pubblicazione: (2024)
di: Ma, Jiangqin, et al.
Pubblicazione: (2024)
HoneyBee: Data Recipes for Vision-Language Reasoners
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
Beyond Training: Dynamic Token Merging for Zero-Shot Video Understanding
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
di: Zhang, Yiming, et al.
Pubblicazione: (2024)
Text-to-CAD Generation Through Infusing Visual Feedback in Large Language Models
di: Wang, Ruiyu, et al.
Pubblicazione: (2025)
di: Wang, Ruiyu, et al.
Pubblicazione: (2025)
1-Bit FQT: Pushing the Limit of Fully Quantized Training to 1-bit
di: Gao, Chang, et al.
Pubblicazione: (2024)
di: Gao, Chang, et al.
Pubblicazione: (2024)
PRUE: A Practical Recipe for Field Boundary Segmentation at Scale
di: Muhawenayo, Gedeon, et al.
Pubblicazione: (2026)
di: Muhawenayo, Gedeon, et al.
Pubblicazione: (2026)
Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra
di: Southworth, Ben S., et al.
Pubblicazione: (2026)
di: Southworth, Ben S., et al.
Pubblicazione: (2026)
DANCE: DAta-Network Co-optimization for Efficient Segmentation Model Training and Inference
di: Li, Chaojian, et al.
Pubblicazione: (2021)
di: Li, Chaojian, et al.
Pubblicazione: (2021)
MDP3: A Training-free Approach for List-wise Frame Selection in Video-LLMs
di: Sun, Hui, et al.
Pubblicazione: (2025)
di: Sun, Hui, et al.
Pubblicazione: (2025)
KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language Models
di: Mohbat, Fnu, et al.
Pubblicazione: (2025)
di: Mohbat, Fnu, et al.
Pubblicazione: (2025)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
di: Huang, Haojian, et al.
Pubblicazione: (2025)
di: Huang, Haojian, et al.
Pubblicazione: (2025)
kNN-CLIP: Retrieval Enables Training-Free Segmentation on Continually Expanding Large Vocabularies
di: Gui, Zhongrui, et al.
Pubblicazione: (2024)
di: Gui, Zhongrui, et al.
Pubblicazione: (2024)
Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
di: Zhang, Dingkun, et al.
Pubblicazione: (2026)
Towards Large-Scale Training of Pathology Foundation Models
di: ai, kaiko., et al.
Pubblicazione: (2024)
di: ai, kaiko., et al.
Pubblicazione: (2024)
DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models
di: Tao, Keda, et al.
Pubblicazione: (2024)
di: Tao, Keda, et al.
Pubblicazione: (2024)
STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering
di: Sun, Guohao, et al.
Pubblicazione: (2024)
di: Sun, Guohao, et al.
Pubblicazione: (2024)
VideoSAM: A Large Vision Foundation Model for High-Speed Video Segmentation
di: Maduabuchi, Chika, et al.
Pubblicazione: (2024)
di: Maduabuchi, Chika, et al.
Pubblicazione: (2024)
Feedback Alignment Meets Low-Rank Manifolds: A Structured Recipe for Local Learning
di: Roy, Arani, et al.
Pubblicazione: (2025)
di: Roy, Arani, et al.
Pubblicazione: (2025)
Light Interaction: Training-Free Inference Acceleration for Interactive Video World Models
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
di: Lu, Jiacheng, et al.
Pubblicazione: (2026)
Learning an Actionable Discrete Diffusion Policy via Large-Scale Actionless Video Pre-Training
di: He, Haoran, et al.
Pubblicazione: (2024)
di: He, Haoran, et al.
Pubblicazione: (2024)
Spanning Training Progress: Temporal Dual-Depth Scoring (TDDS) for Enhanced Dataset Pruning
di: Zhang, Xin, et al.
Pubblicazione: (2023)
di: Zhang, Xin, et al.
Pubblicazione: (2023)
Variance-Aware Adaptive Weighting for Diffusion Model Training
di: Sun, Nanlong, et al.
Pubblicazione: (2026)
di: Sun, Nanlong, et al.
Pubblicazione: (2026)
A Recipe for Unbounded Data Augmentation in Visual Reinforcement Learning
di: Almuzairee, Abdulaziz, et al.
Pubblicazione: (2024)
di: Almuzairee, Abdulaziz, et al.
Pubblicazione: (2024)
Zero-Shot Video Restoration and Enhancement Using Pre-Trained Image Diffusion Model
di: Cao, Cong, et al.
Pubblicazione: (2024)
di: Cao, Cong, et al.
Pubblicazione: (2024)
Unsupervised Video Domain Adaptation with Masked Pre-Training and Collaborative Self-Training
di: Reddy, Arun, et al.
Pubblicazione: (2023)
di: Reddy, Arun, et al.
Pubblicazione: (2023)
ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
di: Li, Zhaoyang, et al.
Pubblicazione: (2025)
On Domain-Adaptive Post-Training for Multimodal Large Language Models
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
di: Cheng, Daixuan, et al.
Pubblicazione: (2024)
Taylor Videos for Action Recognition
di: Wang, Lei, et al.
Pubblicazione: (2024)
di: Wang, Lei, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding
di: Yuan, Liping, et al.
Pubblicazione: (2025) -
Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe
di: Liu, Yahui, et al.
Pubblicazione: (2025) -
Evaluating Gemini LLM in Food Image-Based Recipe and Nutrition Description with EfficientNet-B4 Visual Backbone
di: Anam, Rizal Khoirul
Pubblicazione: (2025) -
EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models
di: Wang, Zekun, et al.
Pubblicazione: (2025) -
CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling
di: Wang, Xinze, et al.
Pubblicazione: (2025)