VrdONE: One-stage Video Visual Relation Detection
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Xinjie, Zheng, Chenxi, Xu, Xuemiao, Liu, Bangzhen, Zheng, Weiying, Zhang, Huaidong, He, Shengfeng |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rotation-Adaptive Point Cloud Domain Generalization via Intricate Orientation Learning
par: Liu, Bangzhen, et autres
Publié: (2025)
par: Liu, Bangzhen, et autres
Publié: (2025)
RecDreamer: Consistent Text-to-3D Generation via Uniform Score Distillation
par: Zheng, Chenxi, et autres
Publié: (2025)
par: Zheng, Chenxi, et autres
Publié: (2025)
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
par: Huang, Ronggang, et autres
Publié: (2025)
par: Huang, Ronggang, et autres
Publié: (2025)
Seeing 3D Through 2D Lenses: 3D Few-Shot Class-Incremental Learning via Cross-Modal Geometric Rectification
par: Xiang, Tuo, et autres
Publié: (2025)
par: Xiang, Tuo, et autres
Publié: (2025)
Learning with Unreliability: Fast Few-shot Voxel Radiance Fields with Relative Geometric Consistency
par: Xu, Yingjie, et autres
Publié: (2024)
par: Xu, Yingjie, et autres
Publié: (2024)
SITA: Structurally Imperceptible and Transferable Adversarial Attacks for Stylized Image Generation
par: Kang, Jingdan, et autres
Publié: (2025)
par: Kang, Jingdan, et autres
Publié: (2025)
StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
par: Yang, Haoxin, et autres
Publié: (2025)
par: Yang, Haoxin, et autres
Publié: (2025)
G2Face: High-Fidelity Reversible Face Anonymization via Generative and Geometric Priors
par: Yang, Haoxin, et autres
Publié: (2024)
par: Yang, Haoxin, et autres
Publié: (2024)
NexusGS: Sparse View Synthesis with Epipolar Depth Priors in 3D Gaussian Splatting
par: Zheng, Yulong, et autres
Publié: (2025)
par: Zheng, Yulong, et autres
Publié: (2025)
Cross-Subject Mind Decoding from Inaccurate Representations
par: Xu, Yangyang, et autres
Publié: (2025)
par: Xu, Yangyang, et autres
Publié: (2025)
Registration is a Powerful Rotation-Invariance Learner for 3D Anomaly Detection
par: Yu, Yuyang, et autres
Publié: (2025)
par: Yu, Yuyang, et autres
Publié: (2025)
NavOne: One-Step Global Planning for Vision-Language Navigation on Top-Down Maps
par: Zhan, Dijia, et autres
Publié: (2026)
par: Zhan, Dijia, et autres
Publié: (2026)
OpenVidVRD: Open-Vocabulary Video Visual Relation Detection via Prompt-Driven Semantic Space Alignment
par: Liu, Qi, et autres
Publié: (2025)
par: Liu, Qi, et autres
Publié: (2025)
Action Dubber: Timing Audible Actions via Inflectional Flow
par: Wan, Wenlong, et autres
Publié: (2025)
par: Wan, Wenlong, et autres
Publié: (2025)
PersonaMagic: Stage-Regulated High-Fidelity Face Customization with Tandem Equilibrium
par: Li, Xinzhe, et autres
Publié: (2024)
par: Li, Xinzhe, et autres
Publié: (2024)
Beyond Inference Intervention: Identity-Decoupled Diffusion for Face Anonymization
par: Yang, Haoxin, et autres
Publié: (2025)
par: Yang, Haoxin, et autres
Publié: (2025)
SCJD: Sparse Correlation and Joint Distillation for Efficient 3D Human Pose Estimation
par: Chen, Weihong, et autres
Publié: (2025)
par: Chen, Weihong, et autres
Publié: (2025)
ProstaTD: Bridging Surgical Triplet from Classification to Fully Supervised Detection
par: Chen, Yiliang, et autres
Publié: (2025)
par: Chen, Yiliang, et autres
Publié: (2025)
StarPose: 3D Human Pose Estimation via Spatial-Temporal Autoregressive Diffusion
par: Yang, Haoxin, et autres
Publié: (2025)
par: Yang, Haoxin, et autres
Publié: (2025)
Zero-Shot Video Translation via Token Warping
par: Zhu, Haiming, et autres
Publié: (2024)
par: Zhu, Haiming, et autres
Publié: (2024)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
par: Guo, Chaohong, et autres
Publié: (2026)
par: Guo, Chaohong, et autres
Publié: (2026)
EchoONE: Segmenting Multiple echocardiography Planes in One Model
par: Hu, Jiongtong, et autres
Publié: (2024)
par: Hu, Jiongtong, et autres
Publié: (2024)
Efficient One-stage Video Object Detection by Exploiting Temporal Consistency
par: Sun, Guanxiong, et autres
Publié: (2024)
par: Sun, Guanxiong, et autres
Publié: (2024)
OneVOS: Unifying Video Object Segmentation with All-in-One Transformer Framework
par: Li, Wanyun, et autres
Publié: (2024)
par: Li, Wanyun, et autres
Publié: (2024)
OneRestore: A Universal Restoration Framework for Composite Degradation
par: Guo, Yu, et autres
Publié: (2024)
par: Guo, Yu, et autres
Publié: (2024)
Hyperspectral Adapter for Object Tracking based on Hyperspectral Video
par: Gao, Long, et autres
Publié: (2025)
par: Gao, Long, et autres
Publié: (2025)
MotionAdapter: Video Motion Transfer via Content-Aware Attention Customization
par: Zhang, Zhexin, et autres
Publié: (2026)
par: Zhang, Zhexin, et autres
Publié: (2026)
MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
EHPE: A Segmented Architecture for Enhanced Hand Pose Estimation
par: Zheng, Bolun, et autres
Publié: (2025)
par: Zheng, Bolun, et autres
Publié: (2025)
Visual-Linguistic Agent: Towards Collaborative Contextual Object Reasoning
par: Yang, Jingru, et autres
Publié: (2024)
par: Yang, Jingru, et autres
Publié: (2024)
DiffusionAD: Norm-guided One-step Denoising Diffusion for Anomaly Detection
par: Zhang, Hui, et autres
Publié: (2023)
par: Zhang, Hui, et autres
Publié: (2023)
Spa3R: Predictive Spatial Field Modeling for 3D Visual Reasoning
par: Jiang, Haoyi, et autres
Publié: (2026)
par: Jiang, Haoyi, et autres
Publié: (2026)
OBMO: One Bounding Box Multiple Objects for Monocular 3D Object Detection
par: Huang, Chenxi, et autres
Publié: (2022)
par: Huang, Chenxi, et autres
Publié: (2022)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
par: Bai, Zechen, et autres
Publié: (2024)
par: Bai, Zechen, et autres
Publié: (2024)
Safe-Sora: Safe Text-to-Video Generation via Graphical Watermarking
par: Su, Zihan, et autres
Publié: (2025)
par: Su, Zihan, et autres
Publié: (2025)
Lagrangian Motion Fields for Long-term Motion Generation
par: Yang, Yifei, et autres
Publié: (2024)
par: Yang, Yifei, et autres
Publié: (2024)
Unifying Global-Local Representations in Salient Object Detection with Transformer
par: Ren, Sucheng, et autres
Publié: (2021)
par: Ren, Sucheng, et autres
Publié: (2021)
Divide-and-Conquer: Confluent Triple-Flow Network for RGB-T Salient Object Detection
par: Tang, Hao, et autres
Publié: (2024)
par: Tang, Hao, et autres
Publié: (2024)
Exploring Hyperspectral Anomaly Detection with Human Vision: A Small Target Aware Detector
par: Ma, Jitao, et autres
Publié: (2024)
par: Ma, Jitao, et autres
Publié: (2024)
SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer
par: Hui, Zheng, et autres
Publié: (2026)
par: Hui, Zheng, et autres
Publié: (2026)
Documents similaires
-
Rotation-Adaptive Point Cloud Domain Generalization via Intricate Orientation Learning
par: Liu, Bangzhen, et autres
Publié: (2025) -
RecDreamer: Consistent Text-to-3D Generation via Uniform Score Distillation
par: Zheng, Chenxi, et autres
Publié: (2025) -
ViewSRD: 3D Visual Grounding via Structured Multi-View Decomposition
par: Huang, Ronggang, et autres
Publié: (2025) -
Seeing 3D Through 2D Lenses: 3D Few-Shot Class-Incremental Learning via Cross-Modal Geometric Rectification
par: Xiang, Tuo, et autres
Publié: (2025) -
Learning with Unreliability: Fast Few-shot Voxel Radiance Fields with Relative Geometric Consistency
par: Xu, Yingjie, et autres
Publié: (2024)