Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Hu, Jian, Cheng, Zixu, Gong, Shaogang, Guan, Isabel, Hao, Jianye, Wang, Jun, Shao, Kun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Grounding Video Reasoning in Physical Signals
par: Osmanli, Alibay, et autres
Publié: (2026)
par: Osmanli, Alibay, et autres
Publié: (2026)
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
par: Cheng, Zixu, et autres
Publié: (2024)
par: Cheng, Zixu, et autres
Publié: (2024)
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
par: Cheng, Zixu, et autres
Publié: (2026)
par: Cheng, Zixu, et autres
Publié: (2026)
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
par: Cheng, Zixu, et autres
Publié: (2025)
par: Cheng, Zixu, et autres
Publié: (2025)
CoS: Chain-of-Shot Prompting for Long Video Understanding
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation
par: Hu, Jian, et autres
Publié: (2024)
par: Hu, Jian, et autres
Publié: (2024)
InvSeg: Test-Time Prompt Inversion for Semantic Segmentation
par: Lin, Jiayi, et autres
Publié: (2024)
par: Lin, Jiayi, et autres
Publié: (2024)
Temporal Score Analysis for Understanding and Correcting Diffusion Artifacts
par: Cao, Yu, et autres
Publié: (2025)
par: Cao, Yu, et autres
Publié: (2025)
ViSMaP: Unsupervised Hour-long Video Summarisation by Meta-Prompting
par: Hu, Jian, et autres
Publié: (2025)
par: Hu, Jian, et autres
Publié: (2025)
Few-Shot Image Generation by Conditional Relaxing Diffusion Inversion
par: Cao, Yu, et autres
Publié: (2024)
par: Cao, Yu, et autres
Publié: (2024)
Diversified Augmentation with Domain Adaptation for Debiased Video Temporal Grounding
par: Ren, Junlong, et autres
Publié: (2025)
par: Ren, Junlong, et autres
Publié: (2025)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
par: Chen, Zhiwei, et autres
Publié: (2025)
par: Chen, Zhiwei, et autres
Publié: (2025)
XFMamba: Cross-Fusion Mamba for Multi-View Medical Image Classification
par: Zheng, Xiaoyu, et autres
Publié: (2025)
par: Zheng, Xiaoyu, et autres
Publié: (2025)
EVIDENT: Routing MLLM Adaptation through Entity-Grounded Visual Evidence for Cross-Domain Video Temporal Grounding
par: Ahn, Geo, et autres
Publié: (2026)
par: Ahn, Geo, et autres
Publié: (2026)
Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels
par: Cai, Weitong, et autres
Publié: (2024)
par: Cai, Weitong, et autres
Publié: (2024)
Training-free Zero-shot Composed Image Retrieval with Local Concept Reranking
par: Sun, Shitong, et autres
Publié: (2023)
par: Sun, Shitong, et autres
Publié: (2023)
Neuro-Symbolic Spatial Reasoning in Segmentation
par: Lin, Jiayi, et autres
Publié: (2025)
par: Lin, Jiayi, et autres
Publié: (2025)
On-Policy Distillation with Best-of-N Teacher Rollout Selection
par: Zhang, Ke, et autres
Publié: (2026)
par: Zhang, Ke, et autres
Publié: (2026)
Adaptive Domain Shift in Diffusion Models for Cross-Modality Image Translation
par: Wang, Zihao, et autres
Publié: (2026)
par: Wang, Zihao, et autres
Publié: (2026)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
par: Li, Zixu, et autres
Publié: (2026)
par: Li, Zixu, et autres
Publié: (2026)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
par: Chen, Zhiwei, et autres
Publié: (2026)
par: Chen, Zhiwei, et autres
Publié: (2026)
ActPrompt: In-Domain Feature Adaptation via Action Cues for Video Temporal Grounding
par: Wang, Yubin, et autres
Publié: (2024)
par: Wang, Yubin, et autres
Publié: (2024)
TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge
par: Li, Zixu, et autres
Publié: (2026)
par: Li, Zixu, et autres
Publié: (2026)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
par: Fu, Zhiheng, et autres
Publié: (2026)
par: Fu, Zhiheng, et autres
Publié: (2026)
Towards Real-world Lens Active Alignment with Unlabeled Data via Domain Adaptation
par: Li, Wenyong, et autres
Publié: (2026)
par: Li, Wenyong, et autres
Publié: (2026)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
par: Zhao, Zixu, et autres
Publié: (2025)
par: Zhao, Zixu, et autres
Publié: (2025)
Enhancing Zero-Shot Facial Expression Recognition by LLM Knowledge Transfer
par: Zhao, Zengqun, et autres
Publié: (2024)
par: Zhao, Zengqun, et autres
Publié: (2024)
Uncertainty-quantified Pulse Signal Recovery from Facial Video using Regularized Stochastic Interpolants
par: Shenoy, Vineet R., et autres
Publié: (2026)
par: Shenoy, Vineet R., et autres
Publié: (2026)
Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation
par: Li, Jiaze, et autres
Publié: (2026)
par: Li, Jiaze, et autres
Publié: (2026)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
par: Ma, Kaijing, et autres
Publié: (2024)
par: Ma, Kaijing, et autres
Publié: (2024)
Unified Static and Dynamic Network: Efficient Temporal Filtering for Video Grounding
par: Hu, Jingjing, et autres
Publié: (2024)
par: Hu, Jingjing, et autres
Publié: (2024)
Moment Quantization for Video Temporal Grounding
par: Sun, Xiaolong, et autres
Publié: (2025)
par: Sun, Xiaolong, et autres
Publié: (2025)
Dual-domain Adaptation Networks for Realistic Image Super-resolution
par: Fang, Chaowei, et autres
Publié: (2025)
par: Fang, Chaowei, et autres
Publié: (2025)
Unleashing Unlabeled Data: A Paradigm for Cross-View Geo-Localization
par: Li, Guopeng, et autres
Publié: (2024)
par: Li, Guopeng, et autres
Publié: (2024)
DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning
par: Zhou, Yang, et autres
Publié: (2026)
par: Zhou, Yang, et autres
Publié: (2026)
Semi-Supervised Crowd Counting from Unlabeled Data
par: Duan, Haoran, et autres
Publié: (2021)
par: Duan, Haoran, et autres
Publié: (2021)
MLLM as Video Narrator: Mitigating Modality Imbalance in Video Moment Retrieval
par: Cai, Weitong, et autres
Publié: (2024)
par: Cai, Weitong, et autres
Publié: (2024)
Generative Video Diffusion for Unseen Novel Semantic Video Moment Retrieval
par: Luo, Dezhao, et autres
Publié: (2024)
par: Luo, Dezhao, et autres
Publié: (2024)
CrossEarth-Gate: Fisher-Guided Adaptive Tuning Engine for Efficient Adaptation of Cross-Domain Remote Sensing Semantic Segmentation
par: Cao, Shilei, et autres
Publié: (2025)
par: Cao, Shilei, et autres
Publié: (2025)
Documents similaires
-
INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation
par: Hu, Jian, et autres
Publié: (2025) -
Grounding Video Reasoning in Physical Signals
par: Osmanli, Alibay, et autres
Publié: (2026) -
SHINE: Saliency-aware HIerarchical NEgative Ranking for Compositional Temporal Grounding
par: Cheng, Zixu, et autres
Publié: (2024) -
GraphThinker: Reinforcing Temporally Grounded Video Reasoning with Event Graph Thinking
par: Cheng, Zixu, et autres
Publié: (2026) -
V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning
par: Cheng, Zixu, et autres
Publié: (2025)