$R^2$-Tuning: Efficient Image-to-Video Transfer Learning for Video Temporal Grounding
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Ye, He, Jixuan, Li, Wanhua, Kim, Junsik, Wei, Donglai, Pfister, Hanspeter, Chen, Chang Wen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
di: He, Jixuan, et al.
Pubblicazione: (2024)
di: He, Jixuan, et al.
Pubblicazione: (2024)
Joint-Task Regularization for Partially Labeled Multi-Task Learning
di: Nishi, Kento, et al.
Pubblicazione: (2024)
di: Nishi, Kento, et al.
Pubblicazione: (2024)
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
di: Hou, Karly, et al.
Pubblicazione: (2025)
di: Hou, Karly, et al.
Pubblicazione: (2025)
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
di: Shi, Zhiyi, et al.
Pubblicazione: (2024)
di: Shi, Zhiyi, et al.
Pubblicazione: (2024)
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
di: Wu, Chenyu, et al.
Pubblicazione: (2026)
di: Wu, Chenyu, et al.
Pubblicazione: (2026)
SocialGPT: Prompting LLMs for Social Relation Reasoning via Greedy Segment Optimization
di: Li, Wanhua, et al.
Pubblicazione: (2024)
di: Li, Wanhua, et al.
Pubblicazione: (2024)
LangFlash: Feed-forward 3D Language Gaussian Splatting from Sparse Unposed Images
di: Liu, Yilong, et al.
Pubblicazione: (2026)
di: Liu, Yilong, et al.
Pubblicazione: (2026)
Spatial-Temporal Pre-Training for Embryo Viability Prediction Using Time-Lapse Videos
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
Tree of Attributes Prompt Learning for Vision-Language Models
di: Ding, Tong, et al.
Pubblicazione: (2024)
di: Ding, Tong, et al.
Pubblicazione: (2024)
S$^3$-TTA: Scale-Style Selection for Test-Time Augmentation in Biomedical Image Segmentation
di: Xie, Kangxian, et al.
Pubblicazione: (2023)
di: Xie, Kangxian, et al.
Pubblicazione: (2023)
LangSplat: 3D Language Gaussian Splatting
di: Qin, Minghan, et al.
Pubblicazione: (2023)
di: Qin, Minghan, et al.
Pubblicazione: (2023)
TriSAM: Tri-Plane SAM for zero-shot cortical blood vessel segmentation in VEM images
di: Wan, Jia, et al.
Pubblicazione: (2024)
di: Wan, Jia, et al.
Pubblicazione: (2024)
Is What You Ask For What You Get? Investigating Concept Associations in Text-to-Image Models
di: Magid, Salma Abdel, et al.
Pubblicazione: (2024)
di: Magid, Salma Abdel, et al.
Pubblicazione: (2024)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
di: Wu, Jianlong, et al.
Pubblicazione: (2025)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
di: Liu, Ye, et al.
Pubblicazione: (2025)
di: Liu, Ye, et al.
Pubblicazione: (2025)
DualEdit: Dual Editing for Knowledge Updating in Vision-Language Models
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
di: Shi, Zhiyi, et al.
Pubblicazione: (2025)
Multimodal Learning for Embryo Viability Prediction in Clinical IVF
di: Kim, Junsik, et al.
Pubblicazione: (2024)
di: Kim, Junsik, et al.
Pubblicazione: (2024)
RoboTAG: End-to-end Robot Configuration Estimation via Topological Alignment Graph
di: Liu, Yifan, et al.
Pubblicazione: (2025)
di: Liu, Yifan, et al.
Pubblicazione: (2025)
Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning
di: Yue, Feng, et al.
Pubblicazione: (2025)
di: Yue, Feng, et al.
Pubblicazione: (2025)
Learning Gaze-aware Compositional GAN
di: Aranjuelo, Nerea, et al.
Pubblicazione: (2024)
di: Aranjuelo, Nerea, et al.
Pubblicazione: (2024)
Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning
di: Gu, Xin, et al.
Pubblicazione: (2025)
di: Gu, Xin, et al.
Pubblicazione: (2025)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
di: Hu, Jingjing, et al.
Pubblicazione: (2024)
Seq2Time: Sequential Knowledge Transfer for Video LLM Temporal Grounding
di: Deng, Andong, et al.
Pubblicazione: (2024)
di: Deng, Andong, et al.
Pubblicazione: (2024)
EfficientMT: Efficient Temporal Adaptation for Motion Transfer in Text-to-Video Diffusion Models
di: Cai, Yufei, et al.
Pubblicazione: (2025)
di: Cai, Yufei, et al.
Pubblicazione: (2025)
LangSplatV2: High-dimensional 3D Language Gaussian Splatting with 450+ FPS
di: Li, Wanhua, et al.
Pubblicazione: (2025)
di: Li, Wanhua, et al.
Pubblicazione: (2025)
Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos
di: Jiang, Songtao, et al.
Pubblicazione: (2026)
di: Jiang, Songtao, et al.
Pubblicazione: (2026)
Virtual Multiplex Staining for Histological Images using a Marker-wise Conditioned Diffusion Model
di: Oh, Hyun-Jic, et al.
Pubblicazione: (2025)
di: Oh, Hyun-Jic, et al.
Pubblicazione: (2025)
EvoGround: Self-Evolving Video Agents for Video Temporal Grounding
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
di: Jung, Minjoon, et al.
Pubblicazione: (2026)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
di: Guo, Chaohong, et al.
Pubblicazione: (2026)
4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models
di: Li, Wanhua, et al.
Pubblicazione: (2025)
di: Li, Wanhua, et al.
Pubblicazione: (2025)
Temporal Grounding as a Learning Signal for Referring Video Object Segmentation
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
di: Lee, Seunghun, et al.
Pubblicazione: (2025)
GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure
di: Gu, Leslie, et al.
Pubblicazione: (2025)
di: Gu, Leslie, et al.
Pubblicazione: (2025)
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
di: Dong, Lu, et al.
Pubblicazione: (2025)
di: Dong, Lu, et al.
Pubblicazione: (2025)
Task-Specific Directions: Definition, Exploration, and Utilization in Parameter Efficient Fine-Tuning
di: Si, Chongjie, et al.
Pubblicazione: (2024)
di: Si, Chongjie, et al.
Pubblicazione: (2024)
Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment
di: Senocak, Arda, et al.
Pubblicazione: (2024)
di: Senocak, Arda, et al.
Pubblicazione: (2024)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
di: Wasim, Syed Talal, et al.
Pubblicazione: (2023)
Multi-Scale Contrastive Learning for Video Temporal Grounding
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
di: Nguyen, Thong Thanh, et al.
Pubblicazione: (2024)
Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding
di: Lee, Jin-Seop, et al.
Pubblicazione: (2025)
di: Lee, Jin-Seop, et al.
Pubblicazione: (2025)
Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding
di: Gao, Shida, et al.
Pubblicazione: (2025)
di: Gao, Shida, et al.
Pubblicazione: (2025)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
di: Li, Jiaze, et al.
Pubblicazione: (2026)
di: Li, Jiaze, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Affordance-Aware Object Insertion via Mask-Aware Dual Diffusion
di: He, Jixuan, et al.
Pubblicazione: (2024) -
Joint-Task Regularization for Partially Labeled Multi-Task Learning
di: Nishi, Kento, et al.
Pubblicazione: (2024) -
CTRL-GS: Cascaded Temporal Residue Learning for 4D Gaussian Splatting
di: Hou, Karly, et al.
Pubblicazione: (2025) -
MoRA: LoRA Guided Multi-Modal Disease Diagnosis with Missing Modality
di: Shi, Zhiyi, et al.
Pubblicazione: (2024) -
RiGS: Rigid-aware 4D Gaussian Splatting from a Single Monocular Video
di: Wu, Chenyu, et al.
Pubblicazione: (2026)