TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sun, Hao, Zhou, Mingyao, Chen, Wenjing, Xie, Wei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
par: Nishimura, Taichi, et autres
Publié: (2024)
par: Nishimura, Taichi, et autres
Publié: (2024)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
par: Ding, Yiming, et autres
Publié: (2026)
par: Ding, Yiming, et autres
Publié: (2026)
A Multimodal Transformer for Live Streaming Highlight Prediction
par: Deng, Jiaxin, et autres
Publié: (2024)
par: Deng, Jiaxin, et autres
Publié: (2024)
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
par: Gordeev, Aleksandr, et autres
Publié: (2024)
par: Gordeev, Aleksandr, et autres
Publié: (2024)
Context-Enhanced Video Moment Retrieval with Large Language Models
par: Liu, Weijia, et autres
Publié: (2024)
par: Liu, Weijia, et autres
Publié: (2024)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2026)
par: Fang, Xiang, et autres
Publié: (2026)
FashionLens: Toward Versatile Fashion Image Retrieval via Task-Adaptive Learning
par: Wen, Haokun, et autres
Publié: (2026)
par: Wen, Haokun, et autres
Publié: (2026)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
par: Lin, David Chuan-En, et autres
Publié: (2022)
par: Lin, David Chuan-En, et autres
Publié: (2022)
Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval
par: Zhang, Bolin, et autres
Publié: (2026)
par: Zhang, Bolin, et autres
Publié: (2026)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
par: Sun, Hao, et autres
Publié: (2024)
par: Sun, Hao, et autres
Publié: (2024)
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning
par: Ma, Hongxu, et autres
Publié: (2025)
par: Ma, Hongxu, et autres
Publié: (2025)
Multi-scale Bottleneck Transformer for Weakly Supervised Multimodal Violence Detection
par: Sun, Shengyang, et autres
Publié: (2024)
par: Sun, Shengyang, et autres
Publié: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
par: Chao, Jianghan, et autres
Publié: (2025)
par: Chao, Jianghan, et autres
Publié: (2025)
$\mathbf{C}^2$Former: Calibrated and Complementary Transformer for RGB-Infrared Object Detection
par: Yuan, Maoxun, et autres
Publié: (2023)
par: Yuan, Maoxun, et autres
Publié: (2023)
Unsupervised Transcript-assisted Video Summarization and Highlight Detection
par: Barbakos, Spyros, et autres
Publié: (2025)
par: Barbakos, Spyros, et autres
Publié: (2025)
MorphText: Deep Morphology Regularized Arbitrary-shape Scene Text Detection
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
DVF: Advancing Robust and Accurate Fine-Grained Image Retrieval with Retrieval Guidelines
par: Jiang, Xin, et autres
Publié: (2024)
par: Jiang, Xin, et autres
Publié: (2024)
HMPE:HeatMap Embedding for Efficient Transformer-Based Small Object Detection
par: Zeng, YangChen
Publié: (2025)
par: Zeng, YangChen
Publié: (2025)
PLayerTV: Advanced Player Tracking and Identification for Automatic Soccer Highlight Clips
par: Solberg, Håkon Maric, et autres
Publié: (2024)
par: Solberg, Håkon Maric, et autres
Publié: (2024)
DPDETR: Decoupled Position Detection Transformer for Infrared-Visible Object Detection
par: Guo, Junjie, et autres
Publié: (2024)
par: Guo, Junjie, et autres
Publié: (2024)
Delving Deeper: Hierarchical Visual Perception for Robust Video-Text Retrieval
par: Xie, Zequn, et autres
Publié: (2026)
par: Xie, Zequn, et autres
Publié: (2026)
Fine-grained Image Retrieval via Dual-Vision Adaptation
par: Jiang, Xin, et autres
Publié: (2025)
par: Jiang, Xin, et autres
Publié: (2025)
Riemann-based Multi-scale Attention Reasoning Network for Text-3D Retrieval
par: Li, Wenrui, et autres
Publié: (2024)
par: Li, Wenrui, et autres
Publié: (2024)
TALDS-Net: Task-Aware Adaptive Local Descriptors Selection for Few-shot Image Classification
par: Qiao, Qian, et autres
Publié: (2023)
par: Qiao, Qian, et autres
Publié: (2023)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval
par: Yang, Yuxin, et autres
Publié: (2026)
par: Yang, Yuxin, et autres
Publié: (2026)
On the Robustness of Human-Object Interaction Detection against Distribution Shift
par: Xie, Chi, et autres
Publié: (2025)
par: Xie, Chi, et autres
Publié: (2025)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
par: Fang, Xiang, et autres
Publié: (2022)
par: Fang, Xiang, et autres
Publié: (2022)
In Anticipation of Perfect Deepfake: Identity-anchored Artifact-agnostic Detection under Rebalanced Deepfake Detection Protocol
par: Wang, Wei-Han, et autres
Publié: (2024)
par: Wang, Wei-Han, et autres
Publié: (2024)
PRVR: Partially Relevant Video Retrieval
par: Chen, Xianke, et autres
Publié: (2022)
par: Chen, Xianke, et autres
Publié: (2022)
CL2CM: Improving Cross-Lingual Cross-Modal Retrieval via Cross-Lingual Knowledge Transfer
par: Wang, Yabing, et autres
Publié: (2023)
par: Wang, Yabing, et autres
Publié: (2023)
Relating CNN-Transformer Fusion Network for Change Detection
par: Gao, Yuhao, et autres
Publié: (2024)
par: Gao, Yuhao, et autres
Publié: (2024)
SD-DiT: Unleashing the Power of Self-supervised Discrimination in Diffusion Transformer
par: Zhu, Rui, et autres
Publié: (2024)
par: Zhu, Rui, et autres
Publié: (2024)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
par: Shao, Qian, et autres
Publié: (2023)
par: Shao, Qian, et autres
Publié: (2023)
Robust Self-Paced Hashing for Cross-Modal Retrieval with Noisy Labels
par: Pu, Ruitao, et autres
Publié: (2025)
par: Pu, Ruitao, et autres
Publié: (2025)
A Simple Task-aware Contrastive Local Descriptor Selection Strategy for Few-shot Learning between inter class and intra class
par: Qiao, Qian, et autres
Publié: (2024)
par: Qiao, Qian, et autres
Publié: (2024)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
par: Yang, Haibo, et autres
Publié: (2024)
par: Yang, Haibo, et autres
Publié: (2024)
PathVLM-R1: A Reinforcement Learning-Driven Reasoning Model for Pathology Visual-Language Tasks
par: Wu, Jianyu, et autres
Publié: (2025)
par: Wu, Jianyu, et autres
Publié: (2025)
Spatiotemporal Graph Guided Multi-modal Network for Livestreaming Product Retrieval
par: Hu, Xiaowan, et autres
Publié: (2024)
par: Hu, Xiaowan, et autres
Publié: (2024)
Documents similaires
-
Lighthouse: A User-Friendly Library for Reproducible Video Moment Retrieval and Highlight Detection
par: Nishimura, Taichi, et autres
Publié: (2024) -
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
par: Ding, Yiming, et autres
Publié: (2026) -
A Multimodal Transformer for Live Streaming Highlight Prediction
par: Deng, Jiaxin, et autres
Publié: (2024) -
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
par: Gordeev, Aleksandr, et autres
Publié: (2024) -
Context-Enhanced Video Moment Retrieval with Large Language Models
par: Liu, Weijia, et autres
Publié: (2024)