Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Ruizhi, Zhong, Keyang, Liu, Peng, Wu, Qi, Zhang, Haoran, Zhang, Yanhao, Chen, Chen, Lu, Haonan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
por: Liang, Zhijia, et al.
Publicado: (2026)
por: Liang, Zhijia, et al.
Publicado: (2026)
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025)
por: Yang, Zhenyu, et al.
Publicado: (2025)
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
por: Wen, Zichen, et al.
Publicado: (2026)
por: Wen, Zichen, et al.
Publicado: (2026)
ClickAttention: Click Region Similarity Guided Interactive Segmentation
por: Xu, Long, et al.
Publicado: (2024)
por: Xu, Long, et al.
Publicado: (2024)
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)
por: Liu, Zikang, et al.
Publicado: (2026)
Online Anomaly Detection over Live Social Video Streaming
por: He, Chengkun, et al.
Publicado: (2023)
por: He, Chengkun, et al.
Publicado: (2023)
GoClick: Lightweight Element Grounding Model for Autonomous GUI Interaction
por: Li, Hongxin, et al.
Publicado: (2026)
por: Li, Hongxin, et al.
Publicado: (2026)
StreamBridge: Turning Your Offline Video Large Language Model into a Proactive Streaming Assistant
por: Wang, Haibo, et al.
Publicado: (2025)
por: Wang, Haibo, et al.
Publicado: (2025)
X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction
por: Ren, Xiaoming, et al.
Publicado: (2026)
por: Ren, Xiaoming, et al.
Publicado: (2026)
Streaming Video Diffusion: Online Video Editing with Diffusion Models
por: Chen, Feng, et al.
Publicado: (2024)
por: Chen, Feng, et al.
Publicado: (2024)
StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding
por: Jin, Xinqi, et al.
Publicado: (2025)
por: Jin, Xinqi, et al.
Publicado: (2025)
PhoStream: Benchmarking Real-World Streaming for Omnimodal Assistants in Mobile Scenarios
por: Lu, Xudong, et al.
Publicado: (2026)
por: Lu, Xudong, et al.
Publicado: (2026)
Layton: Latent Consistency Tokenizer for 1024-pixel Image Reconstruction and Generation by 256 Tokens
por: Xie, Qingsong, et al.
Publicado: (2025)
por: Xie, Qingsong, et al.
Publicado: (2025)
Structured Click Control in Transformer-based Interactive Segmentation
por: Xu, Long, et al.
Publicado: (2024)
por: Xu, Long, et al.
Publicado: (2024)
FreeVA: Offline MLLM as Training-Free Video Assistant
por: Wu, Wenhao
Publicado: (2024)
por: Wu, Wenhao
Publicado: (2024)
Online Misinformation Detection in Live Streaming Videos
por: Cao, Rui
Publicado: (2025)
por: Cao, Rui
Publicado: (2025)
DMTrack: Spatio-Temporal Multimodal Tracking via Dual-Adapter
por: Li, Weihong, et al.
Publicado: (2025)
por: Li, Weihong, et al.
Publicado: (2025)
HAUR: Human Annotation Understanding and Recognition Through Text-Heavy Images
por: Yang, Yuchen, et al.
Publicado: (2024)
por: Yang, Yuchen, et al.
Publicado: (2024)
ClickVOS: Click Video Object Segmentation
por: Guo, Pinxue, et al.
Publicado: (2024)
por: Guo, Pinxue, et al.
Publicado: (2024)
LLMI3D: MLLM-based 3D Perception from a Single 2D Image
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
por: Chen, Jiahui, et al.
Publicado: (2026)
por: Chen, Jiahui, et al.
Publicado: (2026)
AssistPDA: An Online Video Surveillance Assistant for Video Anomaly Prediction, Detection, and Analysis
por: Yang, Zhiwei, et al.
Publicado: (2025)
por: Yang, Zhiwei, et al.
Publicado: (2025)
OwlCap: Harmonizing Motion-Detail for Video Captioning via HMD-270K and Caption Set Equivalence Reward
por: Zhong, Chunlin, et al.
Publicado: (2025)
por: Zhong, Chunlin, et al.
Publicado: (2025)
ClickSeg3D: Few-Click Interactive Segmentation via Semantic Embeddings
por: Kang, Xueyang, et al.
Publicado: (2026)
por: Kang, Xueyang, et al.
Publicado: (2026)
GHOST: Geometry-Hierarchical Online Streaming Token Eviction for Efficient 3D Reconstruction
por: Chen, Leyang, et al.
Publicado: (2026)
por: Chen, Leyang, et al.
Publicado: (2026)
TeleEgo: Benchmarking Egocentric AI Assistants in the Wild
por: Yan, Jiaqi, et al.
Publicado: (2025)
por: Yan, Jiaqi, et al.
Publicado: (2025)
Multi-Modal Explainable Medical AI Assistant for Trustworthy Human-AI Collaboration
por: Yang, Honglong, et al.
Publicado: (2025)
por: Yang, Honglong, et al.
Publicado: (2025)
ROMA: Real-time Omni-Multimodal Assistant with Interactive Streaming Understanding
por: Tian, Xueyun, et al.
Publicado: (2026)
por: Tian, Xueyun, et al.
Publicado: (2026)
FocalClick-XL: Towards Unified and High-quality Interactive Segmentation
por: Chen, Xi, et al.
Publicado: (2025)
por: Chen, Xi, et al.
Publicado: (2025)
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars
por: Sun, Zhiyao, et al.
Publicado: (2025)
por: Sun, Zhiyao, et al.
Publicado: (2025)
Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM
por: Liu, Peng, et al.
Publicado: (2025)
por: Liu, Peng, et al.
Publicado: (2025)
PersonaLive! Expressive Portrait Image Animation for Live Streaming
por: Li, Zhiyuan, et al.
Publicado: (2025)
por: Li, Zhiyuan, et al.
Publicado: (2025)
MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging
por: Zhang, Luyuan, et al.
Publicado: (2026)
por: Zhang, Luyuan, et al.
Publicado: (2026)
HEIE: MLLM-Based Hierarchical Explainable AIGC Image Implausibility Evaluator
por: Yang, Fan, et al.
Publicado: (2024)
por: Yang, Fan, et al.
Publicado: (2024)
Policy Expansion for Bridging Offline-to-Online Reinforcement Learning
por: Zhang, Haichao, et al.
Publicado: (2023)
por: Zhang, Haichao, et al.
Publicado: (2023)
AdaptiveClick: Clicks-aware Transformer with Adaptive Focal Loss for Interactive Image Segmentation
por: Lin, Jiacheng, et al.
Publicado: (2023)
por: Lin, Jiacheng, et al.
Publicado: (2023)
StreamGS: Online Generalizable Gaussian Splatting Reconstruction for Unposed Image Streams
por: LI, Yang, et al.
Publicado: (2025)
por: LI, Yang, et al.
Publicado: (2025)
H2VU-Benchmark: A Comprehensive Benchmark for Hierarchical Holistic Video Understanding
por: Wu, Qi, et al.
Publicado: (2025)
por: Wu, Qi, et al.
Publicado: (2025)
AI Realtor: Towards Grounded Persuasive Language Generation for Automated Copywriting
por: Wu, Jibang, et al.
Publicado: (2025)
por: Wu, Jibang, et al.
Publicado: (2025)
Building-road Collaborative Extraction from Remotely Sensed Images via Cross-Interaction
por: Guo, Haonan, et al.
Publicado: (2023)
por: Guo, Haonan, et al.
Publicado: (2023)
Ejemplares similares
-
OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning
por: Liang, Zhijia, et al.
Publicado: (2026) -
LiveStar: Live Streaming Assistant for Real-World Online Video Understanding
por: Yang, Zhenyu, et al.
Publicado: (2025) -
EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant
por: Wen, Zichen, et al.
Publicado: (2026) -
ClickAttention: Click Region Similarity Guided Interactive Segmentation
por: Xu, Long, et al.
Publicado: (2024) -
Thinking in Streaming Video
por: Liu, Zikang, et al.
Publicado: (2026)