Text-Video Multi-Grained Integration for Video Moment Montage
Fuente:
arXiv
Salvato in:
| Autori principali: | Yin, Zhihui, Ma, Ye, Cao, Xipeng, Wang, Bo, Chen, Quan, Jiang, Peng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
D&M: Enriching E-commerce Videos with Sound Effects by Key Moment Detection and SFX Matching
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
di: Liu, Jingyu, et al.
Pubblicazione: (2024)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025)
di: Liu, Weijia, et al.
Pubblicazione: (2025)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
di: Liu, Shengyuan, et al.
Pubblicazione: (2024)
di: Liu, Shengyuan, et al.
Pubblicazione: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2025)
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2025)
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
di: Liu, Jiawei, et al.
Pubblicazione: (2025)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
di: Peng, Bo, et al.
Pubblicazione: (2023)
di: Peng, Bo, et al.
Pubblicazione: (2023)
EEA: Exploration-Exploitation Agent for Long Video Understanding
di: Yang, Te, et al.
Pubblicazione: (2025)
di: Yang, Te, et al.
Pubblicazione: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
di: Chen, Houlun, et al.
Pubblicazione: (2024)
di: Chen, Houlun, et al.
Pubblicazione: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
di: Liu, Weijia, et al.
Pubblicazione: (2024)
di: Liu, Weijia, et al.
Pubblicazione: (2024)
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
di: Chen, Yuhan, et al.
Pubblicazione: (2026)
di: Chen, Yuhan, et al.
Pubblicazione: (2026)
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
di: Wang, Jing, et al.
Pubblicazione: (2025)
di: Wang, Jing, et al.
Pubblicazione: (2025)
Prior Knowledge Integration via LLM Encoding and Pseudo Event Regulation for Video Moment Retrieval
di: Jiang, Yiyang, et al.
Pubblicazione: (2024)
di: Jiang, Yiyang, et al.
Pubblicazione: (2024)
Text-guided Fine-Grained Video Anomaly Understanding
di: Gu, Jihao, et al.
Pubblicazione: (2025)
di: Gu, Jihao, et al.
Pubblicazione: (2025)
VKIE: The Application of Key Information Extraction on Video Text
di: An, Siyu, et al.
Pubblicazione: (2023)
di: An, Siyu, et al.
Pubblicazione: (2023)
Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention
di: Xu, Dejia, et al.
Pubblicazione: (2024)
di: Xu, Dejia, et al.
Pubblicazione: (2024)
VideoDirector: Precise Video Editing via Text-to-Video Models
di: Wang, Yukun, et al.
Pubblicazione: (2024)
di: Wang, Yukun, et al.
Pubblicazione: (2024)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
di: Zheng, Xiangtian, et al.
Pubblicazione: (2026)
di: Zheng, Xiangtian, et al.
Pubblicazione: (2026)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Moment Quantization for Video Temporal Grounding
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
di: Sun, Xiaolong, et al.
Pubblicazione: (2025)
Background-aware Moment Detection for Video Moment Retrieval
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
di: Jung, Minjoon, et al.
Pubblicazione: (2023)
VideoTetris: Towards Compositional Text-to-Video Generation
di: Tian, Ye, et al.
Pubblicazione: (2024)
di: Tian, Ye, et al.
Pubblicazione: (2024)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
di: Sun, Baoli, et al.
Pubblicazione: (2025)
di: Sun, Baoli, et al.
Pubblicazione: (2025)
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
di: Zhang, Guofeng, et al.
Pubblicazione: (2025)
di: Zhang, Guofeng, et al.
Pubblicazione: (2025)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
di: Zhang, Bolin, et al.
Pubblicazione: (2026)
di: Zhang, Bolin, et al.
Pubblicazione: (2026)
ConsistencyTrack: A Robust Multi-Object Tracker with a Generation Strategy of Consistency Model
di: Jiang, Lifan, et al.
Pubblicazione: (2024)
di: Jiang, Lifan, et al.
Pubblicazione: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
di: Flanagan, Kevin, et al.
Pubblicazione: (2025)
Multi-entity Video Transformers for Fine-Grained Video Representation Learning
di: Walmer, Matthew, et al.
Pubblicazione: (2023)
di: Walmer, Matthew, et al.
Pubblicazione: (2023)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
di: Chen, Hong, et al.
Pubblicazione: (2023)
di: Chen, Hong, et al.
Pubblicazione: (2023)
MEVG: Multi-event Video Generation with Text-to-Video Models
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
di: Oh, Gyeongrok, et al.
Pubblicazione: (2023)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
di: Guo, Yanan, et al.
Pubblicazione: (2025)
di: Guo, Yanan, et al.
Pubblicazione: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
di: Wang, Jiarui, et al.
Pubblicazione: (2025)
Lightweight Multi-Frame Integration for Robust YOLO Object Detection in Videos
di: Quan, Yitong, et al.
Pubblicazione: (2025)
di: Quan, Yitong, et al.
Pubblicazione: (2025)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
di: He, Haibin, et al.
Pubblicazione: (2026)
di: He, Haibin, et al.
Pubblicazione: (2026)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
di: Cai, Weitong, et al.
Pubblicazione: (2024)
di: Cai, Weitong, et al.
Pubblicazione: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
di: Luo, Dezhao, et al.
Pubblicazione: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
di: Zou, Bo, et al.
Pubblicazione: (2024)
di: Zou, Bo, et al.
Pubblicazione: (2024)
FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention
di: Zhang, Peng, et al.
Pubblicazione: (2025)
di: Zhang, Peng, et al.
Pubblicazione: (2025)
Documenti analoghi
-
D&M: Enriching E-commerce Videos with Sound Effects by Key Moment Detection and SFX Matching
di: Liu, Jingyu, et al.
Pubblicazione: (2024) -
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
di: Liu, Weijia, et al.
Pubblicazione: (2025) -
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
di: Liu, Shengyuan, et al.
Pubblicazione: (2024) -
NeMo: Needle in a Montage for Video-Language Understanding
di: Hu, Zi-Yuan, et al.
Pubblicazione: (2025) -
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
di: Liu, Jiawei, et al.
Pubblicazione: (2025)