Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Lu, Jin, Zhuoran, Hao, Yupu, Chen, Yubo, Liu, Kang, Ao, Yulong, Zhao, Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
di: Hao, Yupu, et al.
Pubblicazione: (2024)
di: Hao, Yupu, et al.
Pubblicazione: (2024)
WAT: Online Video Understanding Needs Watching Before Thinking
di: Han, Zifan, et al.
Pubblicazione: (2026)
di: Han, Zifan, et al.
Pubblicazione: (2026)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
di: Lin, Junyan, et al.
Pubblicazione: (2026)
di: Lin, Junyan, et al.
Pubblicazione: (2026)
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
di: Hao, Yupu, et al.
Pubblicazione: (2025)
di: Hao, Yupu, et al.
Pubblicazione: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
di: Guan, Yiran, et al.
Pubblicazione: (2026)
di: Guan, Yiran, et al.
Pubblicazione: (2026)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
di: Zhu, Kejian, et al.
Pubblicazione: (2025)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2026)
di: Li, Jiachun, et al.
Pubblicazione: (2026)
StreamingThinker: Large Language Models Can Think While Reading
di: Tong, Junlong, et al.
Pubblicazione: (2025)
di: Tong, Junlong, et al.
Pubblicazione: (2025)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
di: Li, Yubo, et al.
Pubblicazione: (2026)
di: Li, Yubo, et al.
Pubblicazione: (2026)
StreamMOS: Streaming Moving Object Segmentation with Multi-View Perception and Dual-Span Memory
di: Li, Zhiheng, et al.
Pubblicazione: (2024)
di: Li, Zhiheng, et al.
Pubblicazione: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
di: Gong, Sitong, et al.
Pubblicazione: (2025)
di: Gong, Sitong, et al.
Pubblicazione: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
di: Liao, Huanxuan, et al.
Pubblicazione: (2026)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
di: Men, Tianyi, et al.
Pubblicazione: (2024)
di: Men, Tianyi, et al.
Pubblicazione: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
di: Cao, Pengfei, et al.
Pubblicazione: (2024)
di: Cao, Pengfei, et al.
Pubblicazione: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
di: Men, Tianyi, et al.
Pubblicazione: (2025)
di: Men, Tianyi, et al.
Pubblicazione: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
di: Tong, Jingqi, et al.
Pubblicazione: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
Thinking in Streaming Video
di: Liu, Zikang, et al.
Pubblicazione: (2026)
di: Liu, Zikang, et al.
Pubblicazione: (2026)
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
di: Tong, Qinyue, et al.
Pubblicazione: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
di: Liang, Zhijia, et al.
Pubblicazione: (2026)
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
di: Xie, Zhifei, et al.
Pubblicazione: (2024)
di: Xie, Zhifei, et al.
Pubblicazione: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
di: Yuan, Hongbang, et al.
Pubblicazione: (2024)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
di: Luo, Jingnan, et al.
Pubblicazione: (2026)
Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation
di: Wang, Chengbing, et al.
Pubblicazione: (2025)
di: Wang, Chengbing, et al.
Pubblicazione: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
di: Kang, Choongwon, et al.
Pubblicazione: (2026)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
di: Men, Tianyi, et al.
Pubblicazione: (2024)
di: Men, Tianyi, et al.
Pubblicazione: (2024)
Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense Reasoning
di: Li, Jiachun, et al.
Pubblicazione: (2024)
di: Li, Jiachun, et al.
Pubblicazione: (2024)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
di: Wang, Haibo, et al.
Pubblicazione: (2025)
di: Wang, Haibo, et al.
Pubblicazione: (2025)
Zero-Shot Cross-Lingual Document-Level Event Causality Identification with Heterogeneous Graph Contrastive Transfer Learning
di: He, Zhitao, et al.
Pubblicazione: (2024)
di: He, Zhitao, et al.
Pubblicazione: (2024)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
di: Sun, Xiaokun, et al.
Pubblicazione: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
di: Zhang, Hao, et al.
Pubblicazione: (2025)
di: Zhang, Hao, et al.
Pubblicazione: (2025)
Online Reasoning Video Object Segmentation
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
di: Liu, Jinyuan, et al.
Pubblicazione: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
di: Li, Yubo, et al.
Pubblicazione: (2025)
di: Li, Yubo, et al.
Pubblicazione: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
di: Zhang, Jialiang, et al.
Pubblicazione: (2026)
di: Zhang, Jialiang, et al.
Pubblicazione: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
di: Li, Yunxin, et al.
Pubblicazione: (2025)
di: Li, Yunxin, et al.
Pubblicazione: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
di: Li, Xiaoyuan, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
di: Hao, Yupu, et al.
Pubblicazione: (2024) -
WAT: Online Video Understanding Needs Watching Before Thinking
di: Han, Zifan, et al.
Pubblicazione: (2026) -
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
di: Lin, Junyan, et al.
Pubblicazione: (2026) -
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
di: Hao, Yupu, et al.
Pubblicazione: (2025) -
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
di: Guan, Yiran, et al.
Pubblicazione: (2026)