Guardado en:
| Autores principales: | Zhu, Sa, Chen, Huashan, Zhang, Wanqian, Zhang, Jinchao, Yang, Zexian, Hao, Xiaoshuai, Li, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2506.00891 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Mitigating Semantic Collapse in Partially Relevant Video Retrieval
por: Moon, WonJun, et al.
Publicado: (2025)
por: Moon, WonJun, et al.
Publicado: (2025)
Knowledge-Refined Dual Context-Aware Network for Partially Relevant Video Retrieval
por: Yang, Junkai, et al.
Publicado: (2026)
por: Yang, Junkai, et al.
Publicado: (2026)
Ambiguity-Restrained Text-Video Representation Learning for Partially Relevant Video Retrieval
por: Cho, CH, et al.
Publicado: (2025)
por: Cho, CH, et al.
Publicado: (2025)
Prototypes are Balanced Units for Efficient and Effective Partially Relevant Video Retrieval
por: Moon, WonJun, et al.
Publicado: (2025)
por: Moon, WonJun, et al.
Publicado: (2025)
Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)
por: Zhu, Sa, et al.
Publicado: (2026)
GMMFormer: Gaussian-Mixture-Model Based Transformer for Efficient Partially Relevant Video Retrieval
por: Wang, Yuting, et al.
Publicado: (2023)
por: Wang, Yuting, et al.
Publicado: (2023)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)
por: Zhu, Sa, et al.
Publicado: (2026)
ILDiff: Generate Transparent Animated Stickers by Implicit Layout Distillation
por: Zhang, Ting, et al.
Publicado: (2024)
por: Zhang, Ting, et al.
Publicado: (2024)
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
por: Chen, Tao, et al.
Publicado: (2026)
por: Chen, Tao, et al.
Publicado: (2026)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
por: Liu, Xiaolin, et al.
Publicado: (2026)
por: Liu, Xiaolin, et al.
Publicado: (2026)
Event-VStream: Event-Driven Real-Time Understanding for Long Video Streams
por: Guo, Zhenghui, et al.
Publicado: (2026)
por: Guo, Zhenghui, et al.
Publicado: (2026)
Compressed Deepfake Video Detection Based on 3D Spatiotemporal Trajectories
por: Chen, Zongmei, et al.
Publicado: (2024)
por: Chen, Zongmei, et al.
Publicado: (2024)
Uneven Evolution of Cognition Across Generations of Generative AI Models
por: Galatzer-Levy, Isaac, et al.
Publicado: (2026)
por: Galatzer-Levy, Isaac, et al.
Publicado: (2026)
Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
por: Tan, Huajie, et al.
Publicado: (2025)
por: Tan, Huajie, et al.
Publicado: (2025)
Enhancing Visual Reliance in Text Generation: A Bayesian Perspective on Mitigating Hallucination in Large Vision-Language Models
por: Hu, Nanxing, et al.
Publicado: (2025)
por: Hu, Nanxing, et al.
Publicado: (2025)
VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models
por: Zhang, Zefan, et al.
Publicado: (2026)
por: Zhang, Zefan, et al.
Publicado: (2026)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024)
por: Chen, Houlun, et al.
Publicado: (2024)
WalkVLM:Aid Visually Impaired People Walking by Vision Language Model
por: Yuan, Zhiqiang, et al.
Publicado: (2024)
por: Yuan, Zhiqiang, et al.
Publicado: (2024)
PRVR: Partially Relevant Video Retrieval
por: Chen, Xianke, et al.
Publicado: (2022)
por: Chen, Xianke, et al.
Publicado: (2022)
YOLO-RD: Introducing Relevant and Compact Explicit Knowledge to YOLO by Retriever-Dictionary
por: Tsui, Hao-Tang, et al.
Publicado: (2024)
por: Tsui, Hao-Tang, et al.
Publicado: (2024)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
por: Wang, Yun, et al.
Publicado: (2025)
por: Wang, Yun, et al.
Publicado: (2025)
AdvDMD: Adversarial Reward Meets DMD For High-Quality Few-Step Generation
por: Wang, Xu, et al.
Publicado: (2026)
por: Wang, Xu, et al.
Publicado: (2026)
Enhancing Adversarial Robustness of Vision-Language Models through Low-Rank Adaptation
por: Ji, Yuheng, et al.
Publicado: (2024)
por: Ji, Yuheng, et al.
Publicado: (2024)
Enhancing Long Video Understanding via Hierarchical Event-Based Memory
por: Cheng, Dingxin, et al.
Publicado: (2024)
por: Cheng, Dingxin, et al.
Publicado: (2024)
ShotFinder: Imagination-Driven Open-Domain Video Shot Retrieval via Web Search
por: Yu, Tao, et al.
Publicado: (2026)
por: Yu, Tao, et al.
Publicado: (2026)
MADTempo: An Interactive System for Multi-Event Temporal Video Retrieval with Query Augmentation
por: Vu, Huu-An, et al.
Publicado: (2025)
por: Vu, Huu-An, et al.
Publicado: (2025)
Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model
por: Wu, Peng, et al.
Publicado: (2023)
por: Wu, Peng, et al.
Publicado: (2023)
Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model
por: Yang, Yang, et al.
Publicado: (2025)
por: Yang, Yang, et al.
Publicado: (2025)
Enhancing Partially Relevant Video Retrieval with Robust Alignment Learning
por: Zhang, Long, et al.
Publicado: (2025)
por: Zhang, Long, et al.
Publicado: (2025)
VidEvent: A Large Dataset for Understanding Dynamic Evolution of Events in Videos
por: Liang, Baoyu, et al.
Publicado: (2025)
por: Liang, Baoyu, et al.
Publicado: (2025)
MapFusion: A Novel BEV Feature Fusion Network for Multi-modal Map Construction
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
CSMCIR: CoT-Enhanced Symmetric Alignment with Memory Bank for Composed Image Retrieval
por: Qian, Zhipeng, et al.
Publicado: (2026)
por: Qian, Zhipeng, et al.
Publicado: (2026)
Adversarial Attack for RGB-Event based Visual Object Tracking
por: Chen, Qiang, et al.
Publicado: (2025)
por: Chen, Qiang, et al.
Publicado: (2025)
Unleashing the Power of CNN and Transformer for Balanced RGB-Event Video Recognition
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
Localizing Events in Videos with Multimodal Queries
por: Zhang, Gengyuan, et al.
Publicado: (2024)
por: Zhang, Gengyuan, et al.
Publicado: (2024)
VimoRAG: Video-based Retrieval-augmented 3D Motion Generation for Motion Language Models
por: Xu, Haidong, et al.
Publicado: (2025)
por: Xu, Haidong, et al.
Publicado: (2025)
QuRe: Query-Relevant Retrieval through Hard Negative Sampling in Composed Image Retrieval
por: Kwak, Jaehyun, et al.
Publicado: (2025)
por: Kwak, Jaehyun, et al.
Publicado: (2025)
Large Vision-Language Models Get Lost in Attention
por: Xi, Gongli, et al.
Publicado: (2026)
por: Xi, Gongli, et al.
Publicado: (2026)
Event-Enhanced Blurry Video Super-Resolution
por: Kai, Dachun, et al.
Publicado: (2025)
por: Kai, Dachun, et al.
Publicado: (2025)
IMPACT-HOI: Supervisory Control for Onset-Anchored Partial HOI Event Construction
por: Zhang, Haoshen, et al.
Publicado: (2026)
por: Zhang, Haoshen, et al.
Publicado: (2026)
Ejemplares similares
-
Mitigating Semantic Collapse in Partially Relevant Video Retrieval
por: Moon, WonJun, et al.
Publicado: (2025) -
Knowledge-Refined Dual Context-Aware Network for Partially Relevant Video Retrieval
por: Yang, Junkai, et al.
Publicado: (2026) -
Ambiguity-Restrained Text-Video Representation Learning for Partially Relevant Video Retrieval
por: Cho, CH, et al.
Publicado: (2025) -
Prototypes are Balanced Units for Efficient and Effective Partially Relevant Video Retrieval
por: Moon, WonJun, et al.
Publicado: (2025) -
Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection
por: Zhu, Sa, et al.
Publicado: (2026)