Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Lu, Jin, Zhuoran, Hao, Yupu, Chen, Yubo, Liu, Kang, Ao, Yulong, Zhao, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
par: Hao, Yupu, et autres
Publié: (2024)
par: Hao, Yupu, et autres
Publié: (2024)
WAT: Online Video Understanding Needs Watching Before Thinking
par: Han, Zifan, et autres
Publié: (2026)
par: Han, Zifan, et autres
Publié: (2026)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026)
par: Lin, Junyan, et autres
Publié: (2026)
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
par: Hao, Yupu, et autres
Publié: (2025)
par: Hao, Yupu, et autres
Publié: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
par: Zhu, Kejian, et autres
Publié: (2025)
par: Zhu, Kejian, et autres
Publié: (2025)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
par: Li, Jiachun, et autres
Publié: (2026)
par: Li, Jiachun, et autres
Publié: (2026)
StreamingThinker: Large Language Models Can Think While Reading
par: Tong, Junlong, et autres
Publié: (2025)
par: Tong, Junlong, et autres
Publié: (2025)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
StreamMOS: Streaming Moving Object Segmentation with Multi-View Perception and Dual-Span Memory
par: Li, Zhiheng, et autres
Publié: (2024)
par: Li, Zhiheng, et autres
Publié: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
par: Gong, Sitong, et autres
Publié: (2025)
par: Gong, Sitong, et autres
Publié: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
par: Liao, Huanxuan, et autres
Publié: (2026)
par: Liao, Huanxuan, et autres
Publié: (2026)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
par: Men, Tianyi, et autres
Publié: (2024)
par: Men, Tianyi, et autres
Publié: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
par: Cao, Pengfei, et autres
Publié: (2024)
par: Cao, Pengfei, et autres
Publié: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
par: Men, Tianyi, et autres
Publié: (2025)
par: Men, Tianyi, et autres
Publié: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
par: Tong, Jingqi, et autres
Publié: (2025)
par: Tong, Jingqi, et autres
Publié: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
Thinking in Streaming Video
par: Liu, Zikang, et autres
Publié: (2026)
par: Liu, Zikang, et autres
Publié: (2026)
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
par: Tong, Qinyue, et autres
Publié: (2025)
par: Tong, Qinyue, et autres
Publié: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
par: Liang, Zhijia, et autres
Publié: (2026)
par: Liang, Zhijia, et autres
Publié: (2026)
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
par: Xie, Zhifei, et autres
Publié: (2024)
par: Xie, Zhifei, et autres
Publié: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
par: Yuan, Hongbang, et autres
Publié: (2024)
par: Yuan, Hongbang, et autres
Publié: (2024)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
par: Luo, Jingnan, et autres
Publié: (2026)
par: Luo, Jingnan, et autres
Publié: (2026)
Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation
par: Wang, Chengbing, et autres
Publié: (2025)
par: Wang, Chengbing, et autres
Publié: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
par: Kang, Choongwon, et autres
Publié: (2026)
par: Kang, Choongwon, et autres
Publié: (2026)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
par: Men, Tianyi, et autres
Publié: (2024)
par: Men, Tianyi, et autres
Publié: (2024)
Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense Reasoning
par: Li, Jiachun, et autres
Publié: (2024)
par: Li, Jiachun, et autres
Publié: (2024)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
par: Wang, Haibo, et autres
Publié: (2025)
par: Wang, Haibo, et autres
Publié: (2025)
Zero-Shot Cross-Lingual Document-Level Event Causality Identification with Heterogeneous Graph Contrastive Transfer Learning
par: He, Zhitao, et autres
Publié: (2024)
par: He, Zhitao, et autres
Publié: (2024)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
par: Sun, Xiaokun, et autres
Publié: (2026)
par: Sun, Xiaokun, et autres
Publié: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
par: Zhang, Hao, et autres
Publié: (2025)
par: Zhang, Hao, et autres
Publié: (2025)
Online Reasoning Video Object Segmentation
par: Liu, Jinyuan, et autres
Publié: (2026)
par: Liu, Jinyuan, et autres
Publié: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
par: Li, Yubo, et autres
Publié: (2025)
par: Li, Yubo, et autres
Publié: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
par: Zhang, Jialiang, et autres
Publié: (2026)
par: Zhang, Jialiang, et autres
Publié: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
par: Li, Yunxin, et autres
Publié: (2025)
par: Li, Yunxin, et autres
Publié: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
par: Li, Xiaoyuan, et autres
Publié: (2025)
par: Li, Xiaoyuan, et autres
Publié: (2025)
Documents similaires
-
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
par: Hao, Yupu, et autres
Publié: (2024) -
WAT: Online Video Understanding Needs Watching Before Thinking
par: Han, Zifan, et autres
Publié: (2026) -
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
par: Lin, Junyan, et autres
Publié: (2026) -
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
par: Hao, Yupu, et autres
Publié: (2025) -
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
par: Guan, Yiran, et autres
Publié: (2026)