Text-Video Multi-Grained Integration for Video Moment Montage
Fuente:
arXiv
Guardado en:
| Autores principales: | Yin, Zhihui, Ma, Ye, Cao, Xipeng, Wang, Bo, Chen, Quan, Jiang, Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
D&M: Enriching E-commerce Videos with Sound Effects by Key Moment Detection and SFX Matching
por: Liu, Jingyu, et al.
Publicado: (2024)
por: Liu, Jingyu, et al.
Publicado: (2024)
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
por: Liu, Weijia, et al.
Publicado: (2025)
por: Liu, Weijia, et al.
Publicado: (2025)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
por: Liu, Shengyuan, et al.
Publicado: (2024)
por: Liu, Shengyuan, et al.
Publicado: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
por: Hu, Zi-Yuan, et al.
Publicado: (2025)
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
por: Liu, Jiawei, et al.
Publicado: (2025)
por: Liu, Jiawei, et al.
Publicado: (2025)
ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation
por: Peng, Bo, et al.
Publicado: (2023)
por: Peng, Bo, et al.
Publicado: (2023)
EEA: Exploration-Exploitation Agent for Long Video Understanding
por: Yang, Te, et al.
Publicado: (2025)
por: Yang, Te, et al.
Publicado: (2025)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024)
por: Chen, Houlun, et al.
Publicado: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
por: Liu, Weijia, et al.
Publicado: (2024)
por: Liu, Weijia, et al.
Publicado: (2024)
EagleNet: Energy-Aware Fine-Grained Relationship Learning Network for Text-Video Retrieval
por: Chen, Yuhan, et al.
Publicado: (2026)
por: Chen, Yuhan, et al.
Publicado: (2026)
WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation
por: Wang, Jing, et al.
Publicado: (2025)
por: Wang, Jing, et al.
Publicado: (2025)
Prior Knowledge Integration via LLM Encoding and Pseudo Event Regulation for Video Moment Retrieval
por: Jiang, Yiyang, et al.
Publicado: (2024)
por: Jiang, Yiyang, et al.
Publicado: (2024)
Text-guided Fine-Grained Video Anomaly Understanding
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
VKIE: The Application of Key Information Extraction on Video Text
por: An, Siyu, et al.
Publicado: (2023)
por: An, Siyu, et al.
Publicado: (2023)
Cavia: Camera-controllable Multi-view Video Diffusion with View-Integrated Attention
por: Xu, Dejia, et al.
Publicado: (2024)
por: Xu, Dejia, et al.
Publicado: (2024)
VideoDirector: Precise Video Editing via Text-to-Video Models
por: Wang, Yukun, et al.
Publicado: (2024)
por: Wang, Yukun, et al.
Publicado: (2024)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
por: Zheng, Xiangtian, et al.
Publicado: (2026)
por: Zheng, Xiangtian, et al.
Publicado: (2026)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
Moment Quantization for Video Temporal Grounding
por: Sun, Xiaolong, et al.
Publicado: (2025)
por: Sun, Xiaolong, et al.
Publicado: (2025)
Background-aware Moment Detection for Video Moment Retrieval
por: Jung, Minjoon, et al.
Publicado: (2023)
por: Jung, Minjoon, et al.
Publicado: (2023)
VideoTetris: Towards Compositional Text-to-Video Generation
por: Tian, Ye, et al.
Publicado: (2024)
por: Tian, Ye, et al.
Publicado: (2024)
MomentSeg: Moment-Centric Sampling for Enhanced Video Pixel Understanding
por: Dai, Ming, et al.
Publicado: (2025)
por: Dai, Ming, et al.
Publicado: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
por: Sun, Baoli, et al.
Publicado: (2025)
por: Sun, Baoli, et al.
Publicado: (2025)
TGT: Text-Grounded Trajectories for Locally Controlled Video Generation
por: Zhang, Guofeng, et al.
Publicado: (2025)
por: Zhang, Guofeng, et al.
Publicado: (2025)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
por: Zhang, Bolin, et al.
Publicado: (2026)
por: Zhang, Bolin, et al.
Publicado: (2026)
ConsistencyTrack: A Robust Multi-Object Tracker with a Generation Strategy of Consistency Model
por: Jiang, Lifan, et al.
Publicado: (2024)
por: Jiang, Lifan, et al.
Publicado: (2024)
Moment of Untruth: Dealing with Negative Queries in Video Moment Retrieval
por: Flanagan, Kevin, et al.
Publicado: (2025)
por: Flanagan, Kevin, et al.
Publicado: (2025)
Multi-entity Video Transformers for Fine-Grained Video Representation Learning
por: Walmer, Matthew, et al.
Publicado: (2023)
por: Walmer, Matthew, et al.
Publicado: (2023)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
por: Chen, Hong, et al.
Publicado: (2023)
por: Chen, Hong, et al.
Publicado: (2023)
MEVG: Multi-event Video Generation with Text-to-Video Models
por: Oh, Gyeongrok, et al.
Publicado: (2023)
por: Oh, Gyeongrok, et al.
Publicado: (2023)
FiLA-Video: Spatio-Temporal Compression for Fine-Grained Long Video Understanding
por: Guo, Yanan, et al.
Publicado: (2025)
por: Guo, Yanan, et al.
Publicado: (2025)
LOVE: Benchmarking and Evaluating Text-to-Video Generation and Video-to-Text Interpretation
por: Wang, Jiarui, et al.
Publicado: (2025)
por: Wang, Jiarui, et al.
Publicado: (2025)
Lightweight Multi-Frame Integration for Robust YOLO Object Detection in Videos
por: Quan, Yitong, et al.
Publicado: (2025)
por: Quan, Yitong, et al.
Publicado: (2025)
VTAgent: Agentic Keyframe Anchoring for Evidence-Aware Video TextVQA
por: He, Haibin, et al.
Publicado: (2026)
por: He, Haibin, et al.
Publicado: (2026)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
por: Cai, Weitong, et al.
Publicado: (2024)
por: Cai, Weitong, et al.
Publicado: (2024)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
por: Cai, Weitong, et al.
Publicado: (2024)
por: Cai, Weitong, et al.
Publicado: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
por: Luo, Dezhao, et al.
Publicado: (2024)
por: Luo, Dezhao, et al.
Publicado: (2024)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
VideoDistill: Language-aware Vision Distillation for Video Question Answering
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
FaNe: Towards Fine-Grained Cross-Modal Contrast with False-Negative Reduction and Text-Conditioned Sparse Attention
por: Zhang, Peng, et al.
Publicado: (2025)
por: Zhang, Peng, et al.
Publicado: (2025)
Ejemplares similares
-
D&M: Enriching E-commerce Videos with Sound Effects by Key Moment Detection and SFX Matching
por: Liu, Jingyu, et al.
Publicado: (2024) -
Denoise-then-Retrieve: Text-Conditioned Video Denoising for Video Moment Retrieval
por: Liu, Weijia, et al.
Publicado: (2025) -
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
por: Liu, Shengyuan, et al.
Publicado: (2024) -
NeMo: Needle in a Montage for Video-Language Understanding
por: Hu, Zi-Yuan, et al.
Publicado: (2025) -
DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation
por: Liu, Jiawei, et al.
Publicado: (2025)