Streaming Long Video Understanding with Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Qian, Rui, Dong, Xiaoyi, Zhang, Pan, Zang, Yuhang, Ding, Shuangrui, Lin, Dahua, Wang, Jiaqi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024)
par: Ding, Shuangrui, et autres
Publié: (2024)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
par: Cao, Yuhang, et autres
Publié: (2024)
par: Cao, Yuhang, et autres
Publié: (2024)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos
par: Qian, Rui, et autres
Publié: (2023)
par: Qian, Rui, et autres
Publié: (2023)
Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate
par: Huang, Qidong, et autres
Publié: (2024)
par: Huang, Qidong, et autres
Publié: (2024)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Long-CLIP: Unlocking the Long-Text Capability of CLIP
par: Zhang, Beichen, et autres
Publié: (2024)
par: Zhang, Beichen, et autres
Publié: (2024)
ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way
par: Bu, Jiazi, et autres
Publié: (2024)
par: Bu, Jiazi, et autres
Publié: (2024)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
par: Li, Jinsong, et autres
Publié: (2026)
par: Li, Jinsong, et autres
Publié: (2026)
Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object Segmentation
par: Ding, Shuangrui, et autres
Publié: (2023)
par: Ding, Shuangrui, et autres
Publié: (2023)
Unified Scene Representation and Reconstruction for 3D Large Language Models
par: Chu, Tao, et autres
Publié: (2024)
par: Chu, Tao, et autres
Publié: (2024)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
Are We on the Right Way for Evaluating Large Vision-Language Models?
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction
par: Xing, Long, et autres
Publié: (2024)
par: Xing, Long, et autres
Publié: (2024)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
par: Wei, Xilin, et autres
Publié: (2025)
par: Wei, Xilin, et autres
Publié: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
par: Liu, Yuhong, et autres
Publié: (2025)
par: Liu, Yuhong, et autres
Publié: (2025)
ShareGPT4Video: Improving Video Understanding and Generation with Better Captions
par: Chen, Lin, et autres
Publié: (2024)
par: Chen, Lin, et autres
Publié: (2024)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions
par: Zhang, Pan, et autres
Publié: (2024)
par: Zhang, Pan, et autres
Publié: (2024)
HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
par: Bu, Jiazi, et autres
Publié: (2025)
par: Bu, Jiazi, et autres
Publié: (2025)
OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation
par: Huang, Qidong, et autres
Publié: (2023)
par: Huang, Qidong, et autres
Publié: (2023)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
par: Sun, Zeyi, et autres
Publié: (2024)
par: Sun, Zeyi, et autres
Publié: (2024)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
Bootstrap3D: Improving Multi-view Diffusion Model with Synthetic Data
par: Sun, Zeyi, et autres
Publié: (2024)
par: Sun, Zeyi, et autres
Publié: (2024)
ReasonPix2Pix: Instruction Reasoning Dataset for Advanced Image Editing
par: Jin, Ying, et autres
Publié: (2024)
par: Jin, Ying, et autres
Publié: (2024)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026)
par: Zhang, Zhixiong, et autres
Publié: (2026)
Visual Agentic Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
par: Zhang, Pan, et autres
Publié: (2024)
par: Zhang, Pan, et autres
Publié: (2024)
MotionClone: Training-Free Motion Cloning for Controllable Video Generation
par: Ling, Pengyang, et autres
Publié: (2024)
par: Ling, Pengyang, et autres
Publié: (2024)
CapRL: Stimulating Dense Image Caption Capabilities via Reinforcement Learning
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Documents similaires
-
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024) -
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
par: Qian, Rui, et autres
Publié: (2025) -
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025) -
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
par: Qian, Rui, et autres
Publié: (2024) -
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
par: Cao, Yuhang, et autres
Publié: (2024)