VideoAuto-R1: Video Auto Reasoning via Thinking Once, Answering Twice
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Shuming, Zhuge, Mingchen, Zhao, Changsheng, Chen, Jun, Wu, Lemeng, Liu, Zechun, Zhu, Chenchen, Cai, Zhipeng, Zhou, Chong, Liu, Haozhe, Chang, Ernie, Suri, Saksham, Xu, Hongyu, Qian, Qi, Wen, Wei, Varadarajan, Balakrishnan, Liu, Zhuang, Xu, Hu, Bordes, Florian, Krishnamoorthi, Raghuraman, Ghanem, Bernard, Chandra, Vikas, Xiong, Yunyang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026)
di: Fei, Junjie, et al.
Pubblicazione: (2026)
Efficient Track Anything
di: Xiong, Yunyang, et al.
Pubblicazione: (2024)
di: Xiong, Yunyang, et al.
Pubblicazione: (2024)
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024)
SqueezeSAM: User friendly mobile interactive segmentation
di: Varadarajan, Balakrishnan, et al.
Pubblicazione: (2023)
di: Varadarajan, Balakrishnan, et al.
Pubblicazione: (2023)
Agent-as-a-Judge: Evaluate Agents with Agents
di: Zhuge, Mingchen, et al.
Pubblicazione: (2024)
di: Zhuge, Mingchen, et al.
Pubblicazione: (2024)
dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models
di: Zhang, Wenxuan, et al.
Pubblicazione: (2026)
di: Zhang, Wenxuan, et al.
Pubblicazione: (2026)
EdgeTAM: On-Device Track Anything Model
di: Zhou, Chong, et al.
Pubblicazione: (2025)
di: Zhou, Chong, et al.
Pubblicazione: (2025)
PathFusion: Path-consistent Lidar-Camera Deep Feature Fusion
di: Wu, Lemeng, et al.
Pubblicazione: (2022)
di: Wu, Lemeng, et al.
Pubblicazione: (2022)
ColorMAE: Exploring data-independent masking strategies in Masked AutoEncoders
di: Hinojosa, Carlos, et al.
Pubblicazione: (2024)
di: Hinojosa, Carlos, et al.
Pubblicazione: (2024)
MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases
di: Liu, Zechun, et al.
Pubblicazione: (2024)
di: Liu, Zechun, et al.
Pubblicazione: (2024)
MobileMoE: Scaling On-Device Mixture of Experts
di: Chen, Yanbei, et al.
Pubblicazione: (2026)
di: Chen, Yanbei, et al.
Pubblicazione: (2026)
Efficient Universal Perception Encoder
di: Zhu, Chenchen, et al.
Pubblicazione: (2026)
di: Zhu, Chenchen, et al.
Pubblicazione: (2026)
BOLT: Boost Large Vision-Language Model Without Training for Long-form Video Understanding
di: Liu, Shuming, et al.
Pubblicazione: (2025)
di: Liu, Shuming, et al.
Pubblicazione: (2025)
Neural Computers
di: Zhuge, Mingchen, et al.
Pubblicazione: (2026)
di: Zhuge, Mingchen, et al.
Pubblicazione: (2026)
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
di: Zhao, Changsheng, et al.
Pubblicazione: (2025)
di: Zhao, Changsheng, et al.
Pubblicazione: (2025)
SpinQuant: LLM quantization with learned rotations
di: Liu, Zechun, et al.
Pubblicazione: (2024)
di: Liu, Zechun, et al.
Pubblicazione: (2024)
Communication Efficient Distributed Training with Distributed Lion
di: Liu, Bo, et al.
Pubblicazione: (2024)
di: Liu, Bo, et al.
Pubblicazione: (2024)
WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points
di: Li, Dongyue, et al.
Pubblicazione: (2026)
di: Li, Dongyue, et al.
Pubblicazione: (2026)
Measure Twice, Cut Once: A Semantic-Oriented Approach to Video Temporal Localization with Video LLMs
di: Pang, Zongshang, et al.
Pubblicazione: (2025)
di: Pang, Zongshang, et al.
Pubblicazione: (2025)
AR-Diffusion: Asynchronous Video Generation with Auto-Regressive Diffusion
di: Sun, Mingzhen, et al.
Pubblicazione: (2025)
di: Sun, Mingzhen, et al.
Pubblicazione: (2025)
LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior
di: Wang, Hanyu, et al.
Pubblicazione: (2024)
di: Wang, Hanyu, et al.
Pubblicazione: (2024)
ParetoQ: Improving Scaling Laws in Extremely Low-bit LLM Quantization
di: Liu, Zechun, et al.
Pubblicazione: (2025)
di: Liu, Zechun, et al.
Pubblicazione: (2025)
AutoMV: An Automatic Multi-Agent System for Music Video Generation
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
di: Tang, Xiaoxuan, et al.
Pubblicazione: (2025)
AutoOdom: Learning Auto-regressive Proprioceptive Odometry for Legged Locomotion
di: Luo, Changsheng, et al.
Pubblicazione: (2025)
di: Luo, Changsheng, et al.
Pubblicazione: (2025)
TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
di: Zhang, Chen-Lin, et al.
Pubblicazione: (2025)
Can Video Diffusion Model Reconstruct 4D Geometry?
di: Mai, Jinjie, et al.
Pubblicazione: (2025)
di: Mai, Jinjie, et al.
Pubblicazione: (2025)
Going Down Memory Lane: Scaling Tokens for Video Stream Understanding with Dynamic KV-Cache Memory
di: Agarwal, Vatsal, et al.
Pubblicazione: (2026)
di: Agarwal, Vatsal, et al.
Pubblicazione: (2026)
Auto-ICL: In-Context Learning without Human Supervision
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
di: Yang, Jinghan, et al.
Pubblicazione: (2023)
Don't Look Twice: Faster Video Transformers with Run-Length Tokenization
di: Choudhury, Rohan, et al.
Pubblicazione: (2024)
di: Choudhury, Rohan, et al.
Pubblicazione: (2024)
Mixture-of-Supernets: Improving Weight-Sharing Supernet Training with Architecture-Routed Mixture-of-Experts
di: Jawahar, Ganesh, et al.
Pubblicazione: (2023)
di: Jawahar, Ganesh, et al.
Pubblicazione: (2023)
UVIS: Unsupervised Video Instance Segmentation
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
di: Huang, Shuaiyi, et al.
Pubblicazione: (2024)
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
di: Yu, Zhuoran, et al.
Pubblicazione: (2023)
di: Yu, Zhuoran, et al.
Pubblicazione: (2023)
EdgeRunner: Auto-regressive Auto-encoder for Artistic Mesh Generation
di: Tang, Jiaxiang, et al.
Pubblicazione: (2024)
di: Tang, Jiaxiang, et al.
Pubblicazione: (2024)
Gyroscope-based Video Stabilisation with Auto-Calibration
di: Ovrén, Hannes, et al.
Pubblicazione: (2015)
di: Ovrén, Hannes, et al.
Pubblicazione: (2015)
Exploring Audio Hallucination in Egocentric Video Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
Think Twice, Act Once: A Co-Evolution Framework of LLM and RL for Large-Scale Decision Making
di: Wan, Xu, et al.
Pubblicazione: (2025)
di: Wan, Xu, et al.
Pubblicazione: (2025)
Trustworthy Evaluation of Robotic Manipulation: A New Benchmark and AutoEval Methods
di: Liu, Mengyuan, et al.
Pubblicazione: (2026)
di: Liu, Mengyuan, et al.
Pubblicazione: (2026)
AutoWeather4D: Autonomous Driving Video Weather Conversion via G-Buffer Dual-Pass Editing
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
di: Liu, Tianyu, et al.
Pubblicazione: (2026)
Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization
di: Xi, Haocheng, et al.
Pubblicazione: (2026)
di: Xi, Haocheng, et al.
Pubblicazione: (2026)
Target-Aware Language Modeling via Granular Data Sampling
di: Chang, Ernie, et al.
Pubblicazione: (2024)
di: Chang, Ernie, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Small Vision-Language Models are Smart Compressors for Long Video Understanding
di: Fei, Junjie, et al.
Pubblicazione: (2026) -
Efficient Track Anything
di: Xiong, Yunyang, et al.
Pubblicazione: (2024) -
LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding
di: Shen, Xiaoqian, et al.
Pubblicazione: (2024) -
SqueezeSAM: User friendly mobile interactive segmentation
di: Varadarajan, Balakrishnan, et al.
Pubblicazione: (2023) -
Agent-as-a-Judge: Evaluate Agents with Agents
di: Zhuge, Mingchen, et al.
Pubblicazione: (2024)