REALM: An RGB and Event Aligned Latent Manifold for Cross-Modal Perception
Fuente:
arXiv
Salvato in:
| Autori principali: | Polizzi, Vincenzo, Lindell, David B., Kelly, Jonathan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
VibES: Induced Vibration for Persistent Event-Based Sensing
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2025)
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2025)
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023)
di: Man, Yunze, et al.
Pubblicazione: (2023)
FaVoR: Features via Voxel Rendering for Camera Relocalization
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2024)
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2024)
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
di: Wang, Sheng
Pubblicazione: (2025)
di: Wang, Sheng
Pubblicazione: (2025)
Toward Aligning Human and Robot Actions via Multi-Modal Demonstration Learning
di: Zahid, Azizul, et al.
Pubblicazione: (2025)
di: Zahid, Azizul, et al.
Pubblicazione: (2025)
CoCMT: Communication-Efficient Cross-Modal Transformer for Collaborative Perception
di: Wang, Rujia, et al.
Pubblicazione: (2025)
di: Wang, Rujia, et al.
Pubblicazione: (2025)
Cycle-Correspondence Loss: Learning Dense View-Invariant Visual Features from Unlabeled and Unordered RGB Images
di: Adrian, David B., et al.
Pubblicazione: (2024)
di: Adrian, David B., et al.
Pubblicazione: (2024)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2026)
di: Wang, Yi, et al.
Pubblicazione: (2026)
Flat'n'Fold: A Diverse Multi-Modal Dataset for Garment Perception and Manipulation
di: Zhuang, Lipeng, et al.
Pubblicazione: (2024)
di: Zhuang, Lipeng, et al.
Pubblicazione: (2024)
Learning Shared RGB-D Fields: Unified Self-supervised Pre-training for Label-efficient LiDAR-Camera 3D Perception
di: Xu, Xiaohao, et al.
Pubblicazione: (2024)
di: Xu, Xiaohao, et al.
Pubblicazione: (2024)
Single-Frame Point-Pixel Registration via Supervised Cross-Modal Feature Matching
di: Han, Yu, et al.
Pubblicazione: (2025)
di: Han, Yu, et al.
Pubblicazione: (2025)
Complementary Random Masking for RGB-Thermal Semantic Segmentation
di: Shin, Ukcheol, et al.
Pubblicazione: (2023)
di: Shin, Ukcheol, et al.
Pubblicazione: (2023)
Online,Target-Free LiDAR-Camera Extrinsic Calibration via Cross-Modal Mask Matching
di: Huang, Zhiwei, et al.
Pubblicazione: (2024)
di: Huang, Zhiwei, et al.
Pubblicazione: (2024)
PhotoBot: Reference-Guided Interactive Photography via Natural Language
di: Limoyo, Oliver, et al.
Pubblicazione: (2024)
di: Limoyo, Oliver, et al.
Pubblicazione: (2024)
RGB-only Active 3D Scene Graph Generation for Indoor Mobile Robots
di: Modi, Giorgia, et al.
Pubblicazione: (2026)
di: Modi, Giorgia, et al.
Pubblicazione: (2026)
SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM
di: Keetha, Nikhil, et al.
Pubblicazione: (2023)
di: Keetha, Nikhil, et al.
Pubblicazione: (2023)
Cross-Modal Instructions for Robot Motion Generation
di: Barron, William, et al.
Pubblicazione: (2025)
di: Barron, William, et al.
Pubblicazione: (2025)
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
di: Hao, Haihong, et al.
Pubblicazione: (2026)
di: Hao, Haihong, et al.
Pubblicazione: (2026)
DepthVision: Enabling Robust Vision-Language Models with GAN-Based LiDAR-to-RGB Synthesis for Autonomous Driving
di: Kirchner, Sven, et al.
Pubblicazione: (2025)
di: Kirchner, Sven, et al.
Pubblicazione: (2025)
V3D-SLAM: Robust RGB-D SLAM in Dynamic Environments with 3D Semantic Geometry Voting
di: Dang, Tuan, et al.
Pubblicazione: (2024)
di: Dang, Tuan, et al.
Pubblicazione: (2024)
DiLA: Disentangled Latent Action World Models
di: Zhang, Tianqiu, et al.
Pubblicazione: (2026)
di: Zhang, Tianqiu, et al.
Pubblicazione: (2026)
Chain of World: World Model Thinking in Latent Motion
di: Yang, Fuxiang, et al.
Pubblicazione: (2026)
di: Yang, Fuxiang, et al.
Pubblicazione: (2026)
Towards Closing the Domain Gap with Event Cameras
di: Sevinc, M. Oltan, et al.
Pubblicazione: (2025)
di: Sevinc, M. Oltan, et al.
Pubblicazione: (2025)
IMPACT-HOI: Supervisory Control for Onset-Anchored Partial HOI Event Construction
di: Zhang, Haoshen, et al.
Pubblicazione: (2026)
di: Zhang, Haoshen, et al.
Pubblicazione: (2026)
Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models
di: Lei, Zixing, et al.
Pubblicazione: (2026)
di: Lei, Zixing, et al.
Pubblicazione: (2026)
SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds
di: Zhou, Yunsong, et al.
Pubblicazione: (2026)
di: Zhou, Yunsong, et al.
Pubblicazione: (2026)
Latent Gaussian Splatting for 4D Panoptic Occupancy Tracking
di: Luz, Maximilian, et al.
Pubblicazione: (2026)
di: Luz, Maximilian, et al.
Pubblicazione: (2026)
Conditioning Latent-Space Clusters for Real-World Anomaly Classification
di: Bogdoll, Daniel, et al.
Pubblicazione: (2023)
di: Bogdoll, Daniel, et al.
Pubblicazione: (2023)
Safety-Aligned 3D Object Detection: Single-Vehicle, Cooperative, and End-to-End Perspectives
di: Liao, Brian Hsuan-Cheng, et al.
Pubblicazione: (2026)
di: Liao, Brian Hsuan-Cheng, et al.
Pubblicazione: (2026)
CleverDistiller: Simple and Spatially Consistent Cross-modal Distillation
di: Govindarajan, Hariprasath, et al.
Pubblicazione: (2025)
di: Govindarajan, Hariprasath, et al.
Pubblicazione: (2025)
RealAppliance: Let High-fidelity Appliance Assets Controllable and Workable as Aligned Real Manuals
di: Gao, Yuzheng, et al.
Pubblicazione: (2025)
di: Gao, Yuzheng, et al.
Pubblicazione: (2025)
Manipulation as in Simulation: Enabling Accurate Geometry Perception in Robots
di: Liu, Minghuan, et al.
Pubblicazione: (2025)
di: Liu, Minghuan, et al.
Pubblicazione: (2025)
STAMP: Scalable Task And Model-agnostic Collaborative Perception
di: Gao, Xiangbo, et al.
Pubblicazione: (2025)
di: Gao, Xiangbo, et al.
Pubblicazione: (2025)
Spatially Visual Perception for End-to-End Robotic Learning
di: Davies, Travis, et al.
Pubblicazione: (2024)
di: Davies, Travis, et al.
Pubblicazione: (2024)
RPMArt: Towards Robust Perception and Manipulation for Articulated Objects
di: Wang, Junbo, et al.
Pubblicazione: (2024)
di: Wang, Junbo, et al.
Pubblicazione: (2024)
Efficient Robotic Policy Learning via Latent Space Backward Planning
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
di: Liu, Dongxiu, et al.
Pubblicazione: (2025)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
di: Song, Jingyu, et al.
Pubblicazione: (2025)
di: Song, Jingyu, et al.
Pubblicazione: (2025)
On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
di: Guo, Jianing, et al.
Pubblicazione: (2025)
di: Guo, Jianing, et al.
Pubblicazione: (2025)
Planning in 8 Tokens: A Compact Discrete Tokenizer for Latent World Model
di: Kim, Dongwon, et al.
Pubblicazione: (2026)
di: Kim, Dongwon, et al.
Pubblicazione: (2026)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
di: Tang, Zuojin, et al.
Pubblicazione: (2026)
Documenti analoghi
-
VibES: Induced Vibration for Persistent Event-Based Sensing
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2025) -
DualCross: Cross-Modality Cross-Domain Adaptation for Monocular BEV Perception
di: Man, Yunze, et al.
Pubblicazione: (2023) -
FaVoR: Features via Voxel Rendering for Camera Relocalization
di: Polizzi, Vincenzo, et al.
Pubblicazione: (2024) -
RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation
di: Wang, Sheng
Pubblicazione: (2025) -
Toward Aligning Human and Robot Actions via Multi-Modal Demonstration Learning
di: Zahid, Azizul, et al.
Pubblicazione: (2025)