Clapper: Compact Learning and Video Representation in VLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Kong, Lingyu, Zhang, Hongzhi, Zhang, Jingyuan, Huang, Jianzhao, Li, Kunze, Wang, Qi, Zhang, Fuzheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025)
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
di: Yu, Linhao, et al.
Pubblicazione: (2025)
di: Yu, Linhao, et al.
Pubblicazione: (2025)
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025)
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
di: Ji, Xingguang, et al.
Pubblicazione: (2025)
AR-GRPO: Training Autoregressive Image Generation Models via Reinforcement Learning
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
di: Yuan, Shihao, et al.
Pubblicazione: (2025)
Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
di: Chen, Yuxiao, et al.
Pubblicazione: (2026)
VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning
di: Zhang, Xuanyu, et al.
Pubblicazione: (2025)
di: Zhang, Xuanyu, et al.
Pubblicazione: (2025)
Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
di: Kong, Fanheng, et al.
Pubblicazione: (2025)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024)
di: Yi, Hao, et al.
Pubblicazione: (2024)
TEMPLE: Incentivizing Temporal Understanding of Video Large Language Models via Progressive Pre-SFT Alignment
di: Li, Shicheng, et al.
Pubblicazione: (2025)
di: Li, Shicheng, et al.
Pubblicazione: (2025)
LoCAtion: Long-time Collaborative Attention Framework for High Dynamic Range Video Reconstruction
di: Zhang, Qianyu, et al.
Pubblicazione: (2026)
di: Zhang, Qianyu, et al.
Pubblicazione: (2026)
PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
di: Zhang, Haoze, et al.
Pubblicazione: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
di: Wang, Xiao, et al.
Pubblicazione: (2024)
di: Wang, Xiao, et al.
Pubblicazione: (2024)
Self-Supervised Learning for Real-World Super-Resolution from Dual and Multiple Zoomed Observations
di: Zhang, Zhilu, et al.
Pubblicazione: (2024)
di: Zhang, Zhilu, et al.
Pubblicazione: (2024)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
di: Zhu, Jingyuan, et al.
Pubblicazione: (2026)
CUS-GS: A Compact Unified Structured Gaussian Splatting Framework for Multimodal Scene Representation
di: Ming, Yuhang, et al.
Pubblicazione: (2025)
di: Ming, Yuhang, et al.
Pubblicazione: (2025)
LVC: A Lightweight Compression Framework for Enhancing VLMs in Long Video Understanding
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
di: Wang, Ziyi, et al.
Pubblicazione: (2025)
Unit Region Encoding: A Unified and Compact Geometry-aware Representation for Floorplan Applications
di: Zhang, Huichao, et al.
Pubblicazione: (2025)
di: Zhang, Huichao, et al.
Pubblicazione: (2025)
A Two-Stage Adverse Weather Semantic Segmentation Method for WeatherProof Challenge CVPR 2024 Workshop UG2+
di: Wang, Jianzhao, et al.
Pubblicazione: (2024)
di: Wang, Jianzhao, et al.
Pubblicazione: (2024)
Learning Explicit Continuous Motion Representation for Dynamic Gaussian Splatting from Monocular Videos
di: Zhang, Xuankai, et al.
Pubblicazione: (2026)
di: Zhang, Xuankai, et al.
Pubblicazione: (2026)
Mavors: Multi-granularity Video Representation for Multimodal Large Language Model
di: Shi, Yang, et al.
Pubblicazione: (2025)
di: Shi, Yang, et al.
Pubblicazione: (2025)
CANeRV: Content Adaptive Neural Representation for Video Compression
di: Tang, Lv, et al.
Pubblicazione: (2025)
di: Tang, Lv, et al.
Pubblicazione: (2025)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
di: Shen, Yifan, et al.
Pubblicazione: (2025)
di: Shen, Yifan, et al.
Pubblicazione: (2025)
BIMM: Brain Inspired Masked Modeling for Video Representation Learning
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
di: Wan, Zhifan, et al.
Pubblicazione: (2024)
MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs
di: Dong, Sixun, et al.
Pubblicazione: (2025)
di: Dong, Sixun, et al.
Pubblicazione: (2025)
Scaling Video Understanding via Compact Latent Multi-Agent Collaboration
di: Chen, Kerui, et al.
Pubblicazione: (2026)
di: Chen, Kerui, et al.
Pubblicazione: (2026)
Patho-AgenticRAG: Towards Multimodal Agentic Retrieval-Augmented Generation for Pathology VLMs via Reinforcement Learning
di: Zhang, Wenchuan, et al.
Pubblicazione: (2025)
di: Zhang, Wenchuan, et al.
Pubblicazione: (2025)
Deep Pre-Alignment for VLMs
di: Yu, Tianyu, et al.
Pubblicazione: (2026)
di: Yu, Tianyu, et al.
Pubblicazione: (2026)
Linear Scaling Video VLMs for Long Video Understanding
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
di: Eyzaguirre, Cristobal, et al.
Pubblicazione: (2026)
Unrolled Decomposed Unpaired Learning for Controllable Low-Light Video Enhancement
di: Zhu, Lingyu, et al.
Pubblicazione: (2024)
di: Zhu, Lingyu, et al.
Pubblicazione: (2024)
Learning Natural Consistency Representation for Face Forgery Video Detection
di: Zhang, Daichi, et al.
Pubblicazione: (2024)
di: Zhang, Daichi, et al.
Pubblicazione: (2024)
Frequency-aware Neural Representation for Videos
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
CLGRPO: Reasoning Ability Enhancement for Small VLMs
di: Wang, Fanyi, et al.
Pubblicazione: (2025)
di: Wang, Fanyi, et al.
Pubblicazione: (2025)
Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives
di: Xie, Shaoyuan, et al.
Pubblicazione: (2025)
di: Xie, Shaoyuan, et al.
Pubblicazione: (2025)
Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs
di: Zhang, Song, et al.
Pubblicazione: (2026)
di: Zhang, Song, et al.
Pubblicazione: (2026)
ClapperText: A Benchmark for Text Recognition in Low-Resource Archival Documents
di: Lin, Tingyu, et al.
Pubblicazione: (2025)
di: Lin, Tingyu, et al.
Pubblicazione: (2025)
3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
Video Compression with Hierarchical Temporal Neural Representation
di: Zhu, Jun, et al.
Pubblicazione: (2026)
di: Zhu, Jun, et al.
Pubblicazione: (2026)
TIR-Flow: Active Video Search and Reasoning with Frozen VLMs
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
di: Jin, Hongbo, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding
di: Zhang, Hongzhi, et al.
Pubblicazione: (2025) -
Evaluating Multimodal Large Language Models on Video Captioning via Monte Carlo Tree Search
di: Yu, Linhao, et al.
Pubblicazione: (2025) -
TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos
di: Kong, Fanheng, et al.
Pubblicazione: (2025) -
Data Metabolism: An Efficient Data Design Schema For Vision Language Model
di: Zhang, Jingyuan, et al.
Pubblicazione: (2025) -
Capybara-OMNI: An Efficient Paradigm for Building Omni-Modal Language Models
di: Ji, Xingguang, et al.
Pubblicazione: (2025)