Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Lu, Jin, Zhuoran, Hao, Yupu, Chen, Yubo, Liu, Kang, Ao, Yulong, Zhao, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
por: Hao, Yupu, et al.
Publicado: (2024)
por: Hao, Yupu, et al.
Publicado: (2024)
WAT: Online Video Understanding Needs Watching Before Thinking
por: Han, Zifan, et al.
Publicado: (2026)
por: Han, Zifan, et al.
Publicado: (2026)
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2026)
por: Lin, Junyan, et al.
Publicado: (2026)
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
por: Hao, Yupu, et al.
Publicado: (2025)
por: Hao, Yupu, et al.
Publicado: (2025)
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
por: Guan, Yiran, et al.
Publicado: (2026)
por: Guan, Yiran, et al.
Publicado: (2026)
MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos
por: Zhu, Kejian, et al.
Publicado: (2025)
por: Zhu, Kejian, et al.
Publicado: (2025)
MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning
por: Li, Jiachun, et al.
Publicado: (2026)
por: Li, Jiachun, et al.
Publicado: (2026)
StreamingThinker: Large Language Models Can Think While Reading
por: Tong, Junlong, et al.
Publicado: (2025)
por: Tong, Junlong, et al.
Publicado: (2025)
Consistency of Large Reasoning Models Under Multi-Turn Attacks
por: Li, Yubo, et al.
Publicado: (2026)
por: Li, Yubo, et al.
Publicado: (2026)
StreamMOS: Streaming Moving Object Segmentation with Multi-View Perception and Dual-Span Memory
por: Li, Zhiheng, et al.
Publicado: (2024)
por: Li, Zhiheng, et al.
Publicado: (2024)
Reinforcing Video Reasoning Segmentation to Think Before It Segments
por: Gong, Sitong, et al.
Publicado: (2025)
por: Gong, Sitong, et al.
Publicado: (2025)
MIRAGE: Evaluating and Explaining Inductive Reasoning Process in Language Models
por: Li, Jiachun, et al.
Publicado: (2024)
por: Li, Jiachun, et al.
Publicado: (2024)
ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning
por: Liao, Huanxuan, et al.
Publicado: (2026)
por: Liao, Huanxuan, et al.
Publicado: (2026)
Unlocking the Future: Exploring Look-Ahead Planning Mechanistic Interpretability in Large Language Models
por: Men, Tianyi, et al.
Publicado: (2024)
por: Men, Tianyi, et al.
Publicado: (2024)
One Mind, Many Tongues: A Deep Dive into Language-Agnostic Knowledge Neurons in Large Language Models
por: Cao, Pengfei, et al.
Publicado: (2024)
por: Cao, Pengfei, et al.
Publicado: (2024)
Agent-RewardBench: Towards a Unified Benchmark for Reward Modeling across Perception, Planning, and Safety in Real-World Multimodal Agents
por: Men, Tianyi, et al.
Publicado: (2025)
por: Men, Tianyi, et al.
Publicado: (2025)
Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm
por: Tong, Jingqi, et al.
Publicado: (2025)
por: Tong, Jingqi, et al.
Publicado: (2025)
Beyond Under-Alignment: Atomic Preference Enhanced Factuality Tuning for Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
LINKED: Eliciting, Filtering and Integrating Knowledge in Large Language Model for Commonsense Reasoning
por: Li, Jiachun, et al.
Publicado: (2024)
por: Li, Jiachun, et al.
Publicado: (2024)
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)
por: Liu, Zikang, et al.
Publicado: (2026)
MediRound: Multi-Round Entity-Level Reasoning Segmentation in Medical Images
por: Tong, Qinyue, et al.
Publicado: (2025)
por: Tong, Qinyue, et al.
Publicado: (2025)
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
por: Liang, Zhijia, et al.
Publicado: (2026)
por: Liang, Zhijia, et al.
Publicado: (2026)
Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming
por: Xie, Zhifei, et al.
Publicado: (2024)
por: Xie, Zhifei, et al.
Publicado: (2024)
Towards Robust Knowledge Unlearning: An Adversarial Framework for Assessing and Improving Unlearning Robustness in Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models
por: Yuan, Hongbang, et al.
Publicado: (2024)
por: Yuan, Hongbang, et al.
Publicado: (2024)
Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation
por: Luo, Jingnan, et al.
Publicado: (2026)
por: Luo, Jingnan, et al.
Publicado: (2026)
Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation
por: Wang, Chengbing, et al.
Publicado: (2025)
por: Wang, Chengbing, et al.
Publicado: (2025)
TrimTokenator: Towards Adaptive Visual Token Pruning for Large Multimodal Models
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
por: Kang, Choongwon, et al.
Publicado: (2026)
por: Kang, Choongwon, et al.
Publicado: (2026)
A Troublemaker with Contagious Jailbreak Makes Chaos in Honest Towns
por: Men, Tianyi, et al.
Publicado: (2024)
por: Men, Tianyi, et al.
Publicado: (2024)
Focus on Your Question! Interpreting and Mitigating Toxic CoT Problems in Commonsense Reasoning
por: Li, Jiachun, et al.
Publicado: (2024)
por: Li, Jiachun, et al.
Publicado: (2024)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
por: Wang, Haibo, et al.
Publicado: (2025)
por: Wang, Haibo, et al.
Publicado: (2025)
Zero-Shot Cross-Lingual Document-Level Event Causality Identification with Heterogeneous Graph Contrastive Transfer Learning
por: He, Zhitao, et al.
Publicado: (2024)
por: He, Zhitao, et al.
Publicado: (2024)
When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition
por: Sun, Xiaokun, et al.
Publicado: (2026)
por: Sun, Xiaokun, et al.
Publicado: (2026)
TrimTokenator-LC: Towards Adaptive Visual Token Pruning for Large Multimodal Models with Long Contexts
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
Online Reasoning Video Object Segmentation
por: Liu, Jinyuan, et al.
Publicado: (2026)
por: Liu, Jinyuan, et al.
Publicado: (2026)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
por: Li, Yubo, et al.
Publicado: (2025)
por: Li, Yubo, et al.
Publicado: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
por: Zhang, Jialiang, et al.
Publicado: (2026)
por: Zhang, Jialiang, et al.
Publicado: (2026)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
por: Li, Xiaoyuan, et al.
Publicado: (2025)
por: Li, Xiaoyuan, et al.
Publicado: (2025)
Ejemplares similares
-
CITI: Enhancing Tool Utilizing Ability in Large Language Models without Sacrificing General Performance
por: Hao, Yupu, et al.
Publicado: (2024) -
WAT: Online Video Understanding Needs Watching Before Thinking
por: Han, Zifan, et al.
Publicado: (2026) -
Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models
por: Lin, Junyan, et al.
Publicado: (2026) -
Evaluating Personalized Tool-Augmented LLMs from the Perspectives of Personalization and Proactivity
por: Hao, Yupu, et al.
Publicado: (2025) -
Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously
por: Guan, Yiran, et al.
Publicado: (2026)