ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ge, Yuying, Ge, Yixiao, Li, Chen, Wang, Teng, Pu, Junfu, Li, Yizhuo, Qiu, Lu, Ma, Jin, Duan, Lisheng, Zuo, Xinyu, Luo, Jinwen, Gu, Weibo, Li, Zexuan, Zhang, Xiaojing, Tao, Yangyu, Hu, Han, Wang, Di, Shan, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
par: Pu, Junfu, et autres
Publié: (2025)
par: Pu, Junfu, et autres
Publié: (2025)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
par: Qiu, Lu, et autres
Publié: (2025)
par: Qiu, Lu, et autres
Publié: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024)
par: Li, Yizhuo, et autres
Publié: (2024)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
Aligning Latent Spaces with Flow Priors
par: Li, Yizhuo, et autres
Publié: (2025)
par: Li, Yizhuo, et autres
Publié: (2025)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
par: Chen, Yi, et autres
Publié: (2024)
par: Chen, Yi, et autres
Publié: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
par: Liu, Ruyang, et autres
Publié: (2023)
par: Liu, Ruyang, et autres
Publié: (2023)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024)
par: Li, Bohao, et autres
Publié: (2024)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
par: Ma, Shijie, et autres
Publié: (2025)
par: Ma, Shijie, et autres
Publié: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
HunyuanVideo: A Systematic Framework For Large Video Generative Models
par: Kong, Weijie, et autres
Publié: (2024)
par: Kong, Weijie, et autres
Publié: (2024)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
par: Qiu, Lu, et autres
Publié: (2024)
par: Qiu, Lu, et autres
Publié: (2024)
HunyuanVideo 1.5 Technical Report
par: Wu, Bing, et autres
Publié: (2025)
par: Wu, Bing, et autres
Publié: (2025)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation
par: Shan, Sizhe, et autres
Publié: (2025)
par: Shan, Sizhe, et autres
Publié: (2025)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models
par: Wu, Tao, et autres
Publié: (2024)
par: Wu, Tao, et autres
Publié: (2024)
SEED-Story: Multimodal Long Story Generation with Large Language Model
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation
par: Hu, Teng, et autres
Publié: (2025)
par: Hu, Teng, et autres
Publié: (2025)
Supervised Fine-tuning in turn Improves Visual Foundation Models
par: Jiang, Xiaohu, et autres
Publié: (2024)
par: Jiang, Xiaohu, et autres
Publié: (2024)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling
par: Chen, Boyu, et autres
Publié: (2026)
par: Chen, Boyu, et autres
Publié: (2026)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023)
par: Chen, Yi, et autres
Publié: (2023)
Empirical models for calculating soil wetting patterns under surface drip irrigation systems: A comprehensive analysis
par: Ge Li, et autres
Publié: (2024)
par: Ge Li, et autres
Publié: (2024)
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024)
par: Liu, Ruyang, et autres
Publié: (2024)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
par: Li, Kunchang, et autres
Publié: (2023)
par: Li, Kunchang, et autres
Publié: (2023)
VideoChat: Chat-Centric Video Understanding
par: Li, KunChang, et autres
Publié: (2023)
par: Li, KunChang, et autres
Publié: (2023)
Hunyuan-MT Technical Report
par: Zheng, Mao, et autres
Publié: (2025)
par: Zheng, Mao, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding
par: Lin, Kuanwei, et autres
Publié: (2026)
par: Lin, Kuanwei, et autres
Publié: (2026)
HunyuanOCR Technical Report
par: Hunyuan Vision Team, et autres
Publié: (2025)
par: Hunyuan Vision Team, et autres
Publié: (2025)
Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition
par: Li, Jiaqi, et autres
Publié: (2025)
par: Li, Jiaqi, et autres
Publié: (2025)
Optimized Live 4K Video Multicast
par: He, Zhaoyuan, et autres
Publié: (2023)
par: He, Zhaoyuan, et autres
Publié: (2023)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
Documents similaires
-
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
par: Pu, Junfu, et autres
Publié: (2025) -
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024) -
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
par: Qiu, Lu, et autres
Publié: (2025) -
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024) -
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
par: Cheng, Junhao, et autres
Publié: (2025)