HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming
Fuente:
arXiv
Salvato in:
| Autori principali: | Chen, Jiahui, Peng, Bo, Jia, Lianchen, Zhang, Zeyu, Huang, Tianchi, Sun, Lifeng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression
di: Li, Haoxuan, et al.
Pubblicazione: (2026)
di: Li, Haoxuan, et al.
Pubblicazione: (2026)
Decoupling Defense Strategies for Robust Image Watermarking
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
di: Chen, Jiahui, et al.
Pubblicazione: (2026)
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
di: Jeon, MinJu, et al.
Pubblicazione: (2025)
UniVid: The Open-Source Unified Video Model
di: Luo, Jiabin, et al.
Pubblicazione: (2025)
di: Luo, Jiabin, et al.
Pubblicazione: (2025)
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)
VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors
di: Tang, Jimin, et al.
Pubblicazione: (2026)
di: Tang, Jimin, et al.
Pubblicazione: (2026)
Finding Visual Saliency in Continuous Spike Stream
di: Zhu, Lin, et al.
Pubblicazione: (2024)
di: Zhu, Lin, et al.
Pubblicazione: (2024)
HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming
di: Qiu, Haonan, et al.
Pubblicazione: (2025)
di: Qiu, Haonan, et al.
Pubblicazione: (2025)
LiveCC: Learning Video LLM with Streaming Speech Transcription at Scale
di: Chen, Joya, et al.
Pubblicazione: (2025)
di: Chen, Joya, et al.
Pubblicazione: (2025)
Viewport Prediction for Volumetric Video Streaming by Exploring Video Saliency and Trajectory Information
di: Li, Jie, et al.
Pubblicazione: (2023)
di: Li, Jie, et al.
Pubblicazione: (2023)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
di: Wu, Bin, et al.
Pubblicazione: (2026)
di: Wu, Bin, et al.
Pubblicazione: (2026)
BlockVid: Block Diffusion for High-Quality and Consistent Minute-Long Video Generation
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
di: Zhang, Zeyu, et al.
Pubblicazione: (2025)
VidEdit: Zero-Shot and Spatially Aware Text-Driven Video Editing
di: Couairon, Paul, et al.
Pubblicazione: (2023)
di: Couairon, Paul, et al.
Pubblicazione: (2023)
Vid-LLM: A Compact Video-based 3D Multimodal LLM with Reconstruction-Reasoning Synergy
di: Chen, Haijier, et al.
Pubblicazione: (2025)
di: Chen, Haijier, et al.
Pubblicazione: (2025)
VidSketch: Hand-drawn Sketch-Driven Video Generation with Diffusion Control
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
di: Jiang, Lifan, et al.
Pubblicazione: (2025)
OmniVid: A Generative Framework for Universal Video Understanding
di: Wang, Junke, et al.
Pubblicazione: (2024)
di: Wang, Junke, et al.
Pubblicazione: (2024)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
di: Liu, Yexin, et al.
Pubblicazione: (2025)
di: Liu, Yexin, et al.
Pubblicazione: (2025)
FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis
di: Liang, Feng, et al.
Pubblicazione: (2023)
di: Liang, Feng, et al.
Pubblicazione: (2023)
DiffSal: Joint Audio and Video Learning for Diffusion Saliency Prediction
di: Xiong, Junwen, et al.
Pubblicazione: (2024)
di: Xiong, Junwen, et al.
Pubblicazione: (2024)
HarmoVid: Relightful Video Portrait Harmonization
di: Choi, Jun Myeong, et al.
Pubblicazione: (2026)
di: Choi, Jun Myeong, et al.
Pubblicazione: (2026)
PruneVid: Visual Token Pruning for Efficient Video Large Language Models
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
di: Huang, Xiaohu, et al.
Pubblicazione: (2024)
Beyond Interpretability: Exploring the Comprehensibility of Adaptive Video Streaming through Large Language Models
di: Jia, Lianchen, et al.
Pubblicazione: (2025)
di: Jia, Lianchen, et al.
Pubblicazione: (2025)
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
di: Choi, Seung hee, et al.
Pubblicazione: (2026)
Temporal Saliency-Guided Distillation: A Scalable Framework for Distilling Video Datasets
di: Gu, Xulin, et al.
Pubblicazione: (2025)
di: Gu, Xulin, et al.
Pubblicazione: (2025)
VideoLLM-online: Online Video Large Language Model for Streaming Video
di: Chen, Joya, et al.
Pubblicazione: (2024)
di: Chen, Joya, et al.
Pubblicazione: (2024)
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
di: Huang, Shiqi, et al.
Pubblicazione: (2026)
Relevance-guided Audio Visual Fusion for Video Saliency Prediction
di: Yu, Li, et al.
Pubblicazione: (2024)
di: Yu, Li, et al.
Pubblicazione: (2024)
Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search
di: Aljehrai, Faisal, et al.
Pubblicazione: (2026)
di: Aljehrai, Faisal, et al.
Pubblicazione: (2026)
SAGE: Saliency-Guided Contrastive Embeddings
di: Crum, Colton R., et al.
Pubblicazione: (2025)
di: Crum, Colton R., et al.
Pubblicazione: (2025)
Saliency Guided Optimization of Diffusion Latents
di: Wang, Xiwen, et al.
Pubblicazione: (2024)
di: Wang, Xiwen, et al.
Pubblicazione: (2024)
Vid2Sim: Realistic and Interactive Simulation from Video for Urban Navigation
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
di: Xie, Ziyang, et al.
Pubblicazione: (2025)
Online Anomaly Detection over Live Social Video Streaming
di: He, Chengkun, et al.
Pubblicazione: (2023)
di: He, Chengkun, et al.
Pubblicazione: (2023)
Vid-Morp: Video Moment Retrieval Pretraining from Unlabeled Videos in the Wild
di: Bao, Peijun, et al.
Pubblicazione: (2024)
di: Bao, Peijun, et al.
Pubblicazione: (2024)
IF-VidCap: Can Video Caption Models Follow Instructions?
di: Li, Shihao, et al.
Pubblicazione: (2025)
di: Li, Shihao, et al.
Pubblicazione: (2025)
VidText: Towards Comprehensive Evaluation for Video Text Understanding
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
di: Yang, Zhoufaran, et al.
Pubblicazione: (2025)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2026)
di: Jahagirdar, Soumya Shamarao, et al.
Pubblicazione: (2026)
ExpVid: A Benchmark for Experiment Video Understanding & Reasoning
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
di: Xu, Yicheng, et al.
Pubblicazione: (2025)
InstructVid2Vid: Controllable Video Editing with Natural Language Instructions
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
di: Qin, Bosheng, et al.
Pubblicazione: (2023)
Text-Audio-Visual-conditioned Diffusion Model for Video Saliency Prediction
di: Yu, Li, et al.
Pubblicazione: (2025)
di: Yu, Li, et al.
Pubblicazione: (2025)
StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering
di: Xie, Ming, et al.
Pubblicazione: (2026)
di: Xie, Ming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
HiVid-Narrator: Hierarchical Video Narrative Generation with Scene-Primed ASR-anchored Compression
di: Li, Haoxuan, et al.
Pubblicazione: (2026) -
Decoupling Defense Strategies for Robust Image Watermarking
di: Chen, Jiahui, et al.
Pubblicazione: (2026) -
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
di: Jeon, MinJu, et al.
Pubblicazione: (2025) -
UniVid: The Open-Source Unified Video Model
di: Luo, Jiabin, et al.
Pubblicazione: (2025) -
EmoVid: A Multimodal Emotion Video Dataset for Emotion-Centric Video Understanding and Generation
di: Qiu, Zongyang, et al.
Pubblicazione: (2025)