Learning Streaming Video Representation via Multitask Training
Fuente:
arXiv
Salvato in:
| Autori principali: | Yan, Yibin, Xu, Jilan, Di, Shangzhe, Liu, Yikun, Shi, Yudi, Chen, Qirui, Li, Zeqian, Huang, Yifei, Xie, Weidi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
di: Yan, Yibin, et al.
Pubblicazione: (2026)
di: Yan, Yibin, et al.
Pubblicazione: (2026)
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
di: Shi, Yudi, et al.
Pubblicazione: (2024)
di: Shi, Yudi, et al.
Pubblicazione: (2024)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024)
di: Chen, Qirui, et al.
Pubblicazione: (2024)
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026)
di: Shi, Yudi, et al.
Pubblicazione: (2026)
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
di: Ge, Mingji, et al.
Pubblicazione: (2026)
di: Ge, Mingji, et al.
Pubblicazione: (2026)
Grounded Question-Answering in Long Egocentric Videos
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
di: Di, Shangzhe, et al.
Pubblicazione: (2023)
Universal Video Temporal Grounding with Generative Multi-modal Large Language Models
di: Li, Zeqian, et al.
Pubblicazione: (2025)
di: Li, Zeqian, et al.
Pubblicazione: (2025)
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
Multi-Sentence Grounding for Long-term Instructional Video
di: Li, Zeqian, et al.
Pubblicazione: (2023)
di: Li, Zeqian, et al.
Pubblicazione: (2023)
Retrieval-Augmented Egocentric Video Captioning
di: Xu, Jilan, et al.
Pubblicazione: (2024)
di: Xu, Jilan, et al.
Pubblicazione: (2024)
EchoSight: Advancing Visual-Language Models with Wiki Knowledge
di: Yan, Yibin, et al.
Pubblicazione: (2024)
di: Yan, Yibin, et al.
Pubblicazione: (2024)
Modeling Fine-Grained Hand-Object Dynamics for Egocentric Video Representation Learning
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
di: Pei, Baoqi, et al.
Pubblicazione: (2025)
EgoExo-Gen: Ego-centric Video Prediction by Watching Exo-centric Videos
di: Xu, Jilan, et al.
Pubblicazione: (2025)
di: Xu, Jilan, et al.
Pubblicazione: (2025)
VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
A Sanity Check on Composed Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
Object-centric Video Question Answering with Visual Grounding and Referring
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
Streaming Video Question-Answering with In-context Video KV-Cache Retrieval
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
di: Di, Shangzhe, et al.
Pubblicazione: (2025)
POINTS-Seeker: Towards Training a Multimodal Agentic Search Model from Scratch
di: Liu, Yikun, et al.
Pubblicazione: (2026)
di: Liu, Yikun, et al.
Pubblicazione: (2026)
EgoExoBench: A Benchmark for First- and Third-person View Video Understanding in MLLMs
di: He, Yuping, et al.
Pubblicazione: (2025)
di: He, Yuping, et al.
Pubblicazione: (2025)
Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation
di: Long, Zeqian, et al.
Pubblicazione: (2026)
di: Long, Zeqian, et al.
Pubblicazione: (2026)
Zero-shot Composed Text-Image Retrieval
di: Liu, Yikun, et al.
Pubblicazione: (2023)
di: Liu, Yikun, et al.
Pubblicazione: (2023)
Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding
di: Zhao, Jinghan, et al.
Pubblicazione: (2025)
di: Zhao, Jinghan, et al.
Pubblicazione: (2025)
Efficient Multitask Dense Predictor via Binarization
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding
di: Chen, Guo, et al.
Pubblicazione: (2024)
di: Chen, Guo, et al.
Pubblicazione: (2024)
VISA: Reasoning Video Object Segmentation via Large Language Models
di: Yan, Cilin, et al.
Pubblicazione: (2024)
di: Yan, Cilin, et al.
Pubblicazione: (2024)
StreamGVE: Training-Free Video Editing via Few-Step Streaming Video Generation
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
di: Jiao, Guanlong, et al.
Pubblicazione: (2026)
Auto-ACD: A Large-scale Dataset for Audio-Language Representation Learning
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
di: Sun, Luoyi, et al.
Pubblicazione: (2023)
Representation Learning on Event Stream via an Elastic Net-incorporated Tensor Network
di: Yang, Beibei, et al.
Pubblicazione: (2024)
di: Yang, Beibei, et al.
Pubblicazione: (2024)
Representation Recycling for Streaming Video Analysis
di: Ertenli, Can Ufuk, et al.
Pubblicazione: (2022)
di: Ertenli, Can Ufuk, et al.
Pubblicazione: (2022)
Event Voxel Set Transformer for Spatiotemporal Representation Learning on Event Streams
di: Xie, Bochen, et al.
Pubblicazione: (2023)
di: Xie, Bochen, et al.
Pubblicazione: (2023)
EgoVideo: Exploring Egocentric Foundation Model and Downstream Adaptation
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
di: Pei, Baoqi, et al.
Pubblicazione: (2024)
StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios
di: Wang, Yifei, et al.
Pubblicazione: (2025)
di: Wang, Yifei, et al.
Pubblicazione: (2025)
On Learning Multi-Modal Forgery Representation for Diffusion Generated Video Detection
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
di: Song, Xiufeng, et al.
Pubblicazione: (2024)
QMix: Quality-aware Learning with Mixed Noise for Robust Retinal Disease Diagnosis
di: Hou, Junlin, et al.
Pubblicazione: (2024)
di: Hou, Junlin, et al.
Pubblicazione: (2024)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
Weakly Supervised Multimodal Temporal Forgery Localization via Multitask Learning
di: Xu, Wenbo, et al.
Pubblicazione: (2025)
di: Xu, Wenbo, et al.
Pubblicazione: (2025)
See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning
di: Wei, Yuxi, et al.
Pubblicazione: (2026)
di: Wei, Yuxi, et al.
Pubblicazione: (2026)
Concept-Attention Whitening for Interpretable Skin Lesion Diagnosis
di: Hou, Junlin, et al.
Pubblicazione: (2024)
di: Hou, Junlin, et al.
Pubblicazione: (2024)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
Documenti analoghi
-
OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams
di: Yan, Yibin, et al.
Pubblicazione: (2026) -
Enhancing Video-LLM Reasoning via Agent-of-Thoughts Distillation
di: Shi, Yudi, et al.
Pubblicazione: (2024) -
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
di: Chen, Qirui, et al.
Pubblicazione: (2024) -
Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning
di: Shi, Yudi, et al.
Pubblicazione: (2026) -
DenseStep2M: A Scalable, Training-Free Pipeline for Dense Instructional Video Annotation
di: Ge, Mingji, et al.
Pubblicazione: (2026)