RLBind: Adversarial-Invariant Cross-Modal Alignment for Unified Robust Embeddings
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Lu, Yuhong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SGAligner++: Cross-Modal Language-Aided 3D Scene Graph Alignment
par: Singh, Binod, et autres
Publié: (2025)
par: Singh, Binod, et autres
Publié: (2025)
Fast, Robust, Permutation-and-Sign Invariant SO(3) Pattern Alignment
par: Sarker, Anik, et autres
Publié: (2025)
par: Sarker, Anik, et autres
Publié: (2025)
Robust 3D Object Detection from LiDAR-Radar Point Clouds via Cross-Modal Feature Augmentation
par: Deng, Jianning, et autres
Publié: (2023)
par: Deng, Jianning, et autres
Publié: (2023)
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
par: Zhou, Yiyun, et autres
Publié: (2025)
par: Zhou, Yiyun, et autres
Publié: (2025)
Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
par: Zhao, Jianbo, et autres
Publié: (2025)
par: Zhao, Jianbo, et autres
Publié: (2025)
ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers
par: Lygerakis, Fotios, et autres
Publié: (2025)
par: Lygerakis, Fotios, et autres
Publié: (2025)
123D: Unifying Multi-Modal Autonomous Driving Data at Scale
par: Dauner, Daniel, et autres
Publié: (2026)
par: Dauner, Daniel, et autres
Publié: (2026)
BEVPose: Unveiling Scene Semantics through Pose-Guided Multi-Modal BEV Alignment
par: Hosseinzadeh, Mehdi, et autres
Publié: (2024)
par: Hosseinzadeh, Mehdi, et autres
Publié: (2024)
AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis
par: Wu, Xiaofei, et autres
Publié: (2026)
par: Wu, Xiaofei, et autres
Publié: (2026)
Perspective-Invariant 3D Object Detection
par: Liang, Ao, et autres
Publié: (2025)
par: Liang, Ao, et autres
Publié: (2025)
Alignment Scores: Robust Metrics for Multiview Pose Accuracy Evaluation
par: Lee, Seong Hun, et autres
Publié: (2024)
par: Lee, Seong Hun, et autres
Publié: (2024)
Cross-Modal Visual Relocalization in Prior LiDAR Maps Utilizing Intensity Textures
par: Shen, Qiyuan, et autres
Publié: (2024)
par: Shen, Qiyuan, et autres
Publié: (2024)
Towards Dense and Accurate Radar Perception Via Efficient Cross-Modal Diffusion Model
par: Zhang, Ruibin, et autres
Publié: (2024)
par: Zhang, Ruibin, et autres
Publié: (2024)
XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association
par: Fang, Zhihua, et autres
Publié: (2025)
par: Fang, Zhihua, et autres
Publié: (2025)
Multimodal Graph Representation Learning for Robust Surgical Workflow Recognition with Adversarial Feature Disentanglement
par: Bai, Long, et autres
Publié: (2025)
par: Bai, Long, et autres
Publié: (2025)
Multi-Modal Graph Convolutional Network with Sinusoidal Encoding for Robust Human Action Segmentation
par: Xing, Hao, et autres
Publié: (2025)
par: Xing, Hao, et autres
Publié: (2025)
Real-Time Lane Detection via Efficient Feature Alignment and Covariance Optimization for Low-Power Embedded Systems
par: Liu, Yian, et autres
Publié: (2026)
par: Liu, Yian, et autres
Publié: (2026)
Cross-Modal Semi-Dense 6-DoF Tracking of an Event Camera in Challenging Conditions
par: Zuo, Yi-Fan, et autres
Publié: (2024)
par: Zuo, Yi-Fan, et autres
Publié: (2024)
MambaPlace:Text-to-Point-Cloud Cross-Modal Place Recognition with Attention Mamba Mechanisms
par: Shang, Tianyi, et autres
Publié: (2024)
par: Shang, Tianyi, et autres
Publié: (2024)
CMR-Agent: Learning a Cross-Modal Agent for Iterative Image-to-Point Cloud Registration
par: Yao, Gongxin, et autres
Publié: (2024)
par: Yao, Gongxin, et autres
Publié: (2024)
IRIS-SLAM: Unified Geo-Instance Representations for Robust Semantic Localization and Mapping
par: Xiao, Tingyang, et autres
Publié: (2026)
par: Xiao, Tingyang, et autres
Publié: (2026)
SLAM Adversarial Lab: An Extensible Framework for Visual SLAM Robustness Evaluation under Adverse Conditions
par: Hefny, Mohamed, et autres
Publié: (2026)
par: Hefny, Mohamed, et autres
Publié: (2026)
RISeg: Robot Interactive Object Segmentation via Body Frame-Invariant Features
par: Qian, Howard H., et autres
Publié: (2024)
par: Qian, Howard H., et autres
Publié: (2024)
Surgical-VQLA++: Adversarial Contrastive Learning for Calibrated Robust Visual Question-Localized Answering in Robotic Surgery
par: Bai, Long, et autres
Publié: (2024)
par: Bai, Long, et autres
Publié: (2024)
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
par: Man, Yunze, et autres
Publié: (2023)
par: Man, Yunze, et autres
Publié: (2023)
UGG: Unified Generative Grasping
par: Lu, Jiaxin, et autres
Publié: (2023)
par: Lu, Jiaxin, et autres
Publié: (2023)
LiDAR-VGGT: Cross-Modal Coarse-to-Fine Fusion for Globally Consistent and Metric-Scale Dense Mapping
par: Wang, Lijie, et autres
Publié: (2025)
par: Wang, Lijie, et autres
Publié: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
par: Shang, Tianyi, et autres
Publié: (2025)
par: Shang, Tianyi, et autres
Publié: (2025)
Structure-Invariant Range-Visual-Inertial Odometry
par: Alberico, Ivan, et autres
Publié: (2024)
par: Alberico, Ivan, et autres
Publié: (2024)
ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation
par: Ren, Huan, et autres
Publié: (2026)
par: Ren, Huan, et autres
Publié: (2026)
(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization
par: Li, Minglei, et autres
Publié: (2026)
par: Li, Minglei, et autres
Publié: (2026)
LIDEA: Human-to-Robot Imitation Learning via Implicit Feature Distillation and Explicit Geometry Alignment
par: Xu, Yifu, et autres
Publié: (2026)
par: Xu, Yifu, et autres
Publié: (2026)
Monocular Visual Place Recognition in LiDAR Maps via Cross-Modal State Space Model and Multi-View Matching
par: Yao, Gongxin, et autres
Publié: (2024)
par: Yao, Gongxin, et autres
Publié: (2024)
UniBEV: Multi-modal 3D Object Detection with Uniform BEV Encoders for Robustness against Missing Sensor Modalities
par: Wang, Shiming, et autres
Publié: (2023)
par: Wang, Shiming, et autres
Publié: (2023)
Accelerated Rotation-Invariant Convolution for UAV Image Segmentation
par: Manduhu, Manduhu, et autres
Publié: (2025)
par: Manduhu, Manduhu, et autres
Publié: (2025)
BILTS: A Bi-Invariant Similarity Measure for Robust Object Trajectory Recognition under Reference Frame Variations
par: Verduyn, Arno, et autres
Publié: (2024)
par: Verduyn, Arno, et autres
Publié: (2024)
HAVT-IVD: Heterogeneity-Aware Cross-Modal Network for Audio-Visual Surveillance: Idling Vehicles Detection With Multichannel Audio and Multiscale Visual Cues
par: Li, Xiwen, et autres
Publié: (2025)
par: Li, Xiwen, et autres
Publié: (2025)
ModaLink: Unifying Modalities for Efficient Image-to-PointCloud Place Recognition
par: Xie, Weidong, et autres
Publié: (2024)
par: Xie, Weidong, et autres
Publié: (2024)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
par: Wang, Yi, et autres
Publié: (2026)
par: Wang, Yi, et autres
Publié: (2026)
UniMoCo: Unified Modality Completion for Robust Multi-Modal Embeddings
par: Qin, Jiajun, et autres
Publié: (2025)
par: Qin, Jiajun, et autres
Publié: (2025)
Documents similaires
-
SGAligner++: Cross-Modal Language-Aided 3D Scene Graph Alignment
par: Singh, Binod, et autres
Publié: (2025) -
Fast, Robust, Permutation-and-Sign Invariant SO(3) Pattern Alignment
par: Sarker, Anik, et autres
Publié: (2025) -
Robust 3D Object Detection from LiDAR-Radar Point Clouds via Cross-Modal Feature Augmentation
par: Deng, Jianning, et autres
Publié: (2023) -
Collaborative Representation Learning for Alignment of Tactile, Language, and Vision Modalities
par: Zhou, Yiyun, et autres
Publié: (2025) -
Autoregressive End-to-End Planning with Time-Invariant Spatial Alignment and Multi-Objective Policy Refinement
par: Zhao, Jianbo, et autres
Publié: (2025)