GIRL-DETR: Gradient-Isolated Reinforcement Learning for Video Moment Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Shihang, Kuai, Mingjin, Wei, Ye, Zhang, Zhen, Ji, Wei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
por: Park, Seojeong, et al.
Publicado: (2024)
por: Park, Seojeong, et al.
Publicado: (2024)
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024)
por: Chen, Houlun, et al.
Publicado: (2024)
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
por: Yuan, Huaying, et al.
Publicado: (2025)
por: Yuan, Huaying, et al.
Publicado: (2025)
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
por: Yu, An, et al.
Publicado: (2025)
por: Yu, An, et al.
Publicado: (2025)
LP-DETR: Layer-wise Progressive Relations for Object Detection
por: Kang, Zhengjian, et al.
Publicado: (2025)
por: Kang, Zhengjian, et al.
Publicado: (2025)
When One Moment Isn't Enough: Multi-Moment Retrieval with Cross-Moment Interactions
por: Cao, Zhuo, et al.
Publicado: (2025)
por: Cao, Zhuo, et al.
Publicado: (2025)
SLVideo: A Sign Language Video Moment Retrieval Framework
por: Martins, Gonçalo Vinagre, et al.
Publicado: (2024)
por: Martins, Gonçalo Vinagre, et al.
Publicado: (2024)
UAV-DETR: DETR for Anti-Drone Target Detection
por: Yang, Jun, et al.
Publicado: (2026)
por: Yang, Jun, et al.
Publicado: (2026)
ClipTBP: Clip-Pair based Temporal Boundary Prediction with Boundary-Aware Learning for Moment Retrieval
por: Kim, Ji-Hyeon, et al.
Publicado: (2026)
por: Kim, Ji-Hyeon, et al.
Publicado: (2026)
AO-DETR: Anti-Overlapping DETR for X-Ray Prohibited Items Detection
por: Li, Mingyuan, et al.
Publicado: (2024)
por: Li, Mingyuan, et al.
Publicado: (2024)
Task-Driven Exploration: Decoupling and Inter-Task Feedback for Joint Moment Retrieval and Highlight Detection
por: Yang, Jin, et al.
Publicado: (2024)
por: Yang, Jin, et al.
Publicado: (2024)
DeepSport: A Multimodal Large Language Model for Comprehensive Sports Video Reasoning via Agentic Reinforcement Learning
por: Zou, Junbo, et al.
Publicado: (2025)
por: Zou, Junbo, et al.
Publicado: (2025)
CP-DETR: Concept Prompt Guide DETR Toward Stronger Universal Object Detection
por: Chen, Qibo, et al.
Publicado: (2024)
por: Chen, Qibo, et al.
Publicado: (2024)
VideoLights: Feature Refinement and Cross-Task Alignment Transformer for Joint Video Highlight Detection and Moment Retrieval
por: Paul, Dhiman, et al.
Publicado: (2024)
por: Paul, Dhiman, et al.
Publicado: (2024)
Learning Segment Similarity and Alignment in Large-Scale Content Based Video Retrieval
por: Jiang, Chen, et al.
Publicado: (2023)
por: Jiang, Chen, et al.
Publicado: (2023)
Who Can We Trust? Scope-Aware Video Moment Retrieval with Multi-Agent Conflict
por: Wu, Chaochen, et al.
Publicado: (2025)
por: Wu, Chaochen, et al.
Publicado: (2025)
Watch Video, Catch Keyword: Context-aware Keyword Attention for Moment Retrieval and Highlight Detection
por: Um, Sung Jin, et al.
Publicado: (2025)
por: Um, Sung Jin, et al.
Publicado: (2025)
TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors
por: Hsieh, Jun-Wei, et al.
Publicado: (2026)
por: Hsieh, Jun-Wei, et al.
Publicado: (2026)
Nodule-DETR: A Novel DETR Architecture with Frequency-Channel Attention for Ultrasound Thyroid Nodule Detection
por: Wang, Jingjing, et al.
Publicado: (2026)
por: Wang, Jingjing, et al.
Publicado: (2026)
SO-DETR: Leveraging Dual-Domain Features and Knowledge Distillation for Small Object Detection
por: Zhang, Huaxiang, et al.
Publicado: (2025)
por: Zhang, Huaxiang, et al.
Publicado: (2025)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
por: Zhang, Miaosen, et al.
Publicado: (2024)
por: Zhang, Miaosen, et al.
Publicado: (2024)
VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning
por: Ding, Yang, et al.
Publicado: (2025)
por: Ding, Yang, et al.
Publicado: (2025)
FrameMind: Frame-Interleaved Video Reasoning via Reinforcement Learning
por: Ge, Haonan, et al.
Publicado: (2025)
por: Ge, Haonan, et al.
Publicado: (2025)
Moment-Video: Diagnosing Temporal Fidelity of Video MLLMs on Momentary Visual Events
por: Liu, Xiaolin, et al.
Publicado: (2026)
por: Liu, Xiaolin, et al.
Publicado: (2026)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
por: Fei, Hao, et al.
Publicado: (2024)
por: Fei, Hao, et al.
Publicado: (2024)
DEIM: DETR with Improved Matching for Fast Convergence
por: Huang, Shihua, et al.
Publicado: (2024)
por: Huang, Shihua, et al.
Publicado: (2024)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
por: Luo, Yongdong, et al.
Publicado: (2024)
por: Luo, Yongdong, et al.
Publicado: (2024)
AvatarShield: Visual Reinforcement Learning for Human-Centric Synthetic Video Detection
por: Xu, Zhipei, et al.
Publicado: (2025)
por: Xu, Zhipei, et al.
Publicado: (2025)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
por: Chen, Ruizhe, et al.
Publicado: (2025)
por: Chen, Ruizhe, et al.
Publicado: (2025)
MVMR: A New Framework for Evaluating Faithfulness of Video Moment Retrieval against Multiple Distractors
por: Yang, Nakyeong, et al.
Publicado: (2023)
por: Yang, Nakyeong, et al.
Publicado: (2023)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
por: Fei, Hao, et al.
Publicado: (2023)
por: Fei, Hao, et al.
Publicado: (2023)
Saliency-Guided DETR for Moment Retrieval and Highlight Detection
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
por: Gordeev, Aleksandr, et al.
Publicado: (2024)
DySink: Dynamic Frame Sinks for Autoregressive Long Video Generation
por: Ye, Bo, et al.
Publicado: (2026)
por: Ye, Bo, et al.
Publicado: (2026)
MS-DETR: Towards Effective Video Moment Retrieval and Highlight Detection by Joint Motion-Semantic Learning
por: Ma, Hongxu, et al.
Publicado: (2025)
por: Ma, Hongxu, et al.
Publicado: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
por: Yue, Feng, et al.
Publicado: (2025)
por: Yue, Feng, et al.
Publicado: (2025)
Hierarchical Representation Matching for CLIP-based Class-Incremental Learning
por: Wen, Zhen-Hao, et al.
Publicado: (2025)
por: Wen, Zhen-Hao, et al.
Publicado: (2025)
Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning
por: Du, Dazhao, et al.
Publicado: (2026)
por: Du, Dazhao, et al.
Publicado: (2026)
Uneven Event Modeling for Partially Relevant Video Retrieval
por: Zhu, Sa, et al.
Publicado: (2025)
por: Zhu, Sa, et al.
Publicado: (2025)
Robust Multiple Description Neural Video Codec with Masked Transformer for Dynamic and Noisy Networks
por: Hu, Xinyue, et al.
Publicado: (2024)
por: Hu, Xinyue, et al.
Publicado: (2024)
Ejemplares similares
-
MomentMix Augmentation with Length-Aware DETR for Temporally Robust Moment Retrieval
por: Park, Seojeong, et al.
Publicado: (2024) -
VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding
por: Chen, Houlun, et al.
Publicado: (2024) -
MomentSeeker: A Task-Oriented Benchmark For Long-Video Moment Retrieval
por: Yuan, Huaying, et al.
Publicado: (2025) -
SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM
por: Yu, An, et al.
Publicado: (2025) -
LP-DETR: Layer-wise Progressive Relations for Object Detection
por: Kang, Zhengjian, et al.
Publicado: (2025)