OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Qiu, Liuxiang, Da, Hui, Niu, Yuzhen, Zhao, Tiesong, Cao, Yang, Zha, Zheng-Jun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Event-based Visual Deformation Measurement
di: Wu, Yuliang, et al.
Pubblicazione: (2026)
di: Wu, Yuliang, et al.
Pubblicazione: (2026)
Visual-Geometric Collaborative Guidance for Affordance Learning
di: Luo, Hongchen, et al.
Pubblicazione: (2024)
di: Luo, Hongchen, et al.
Pubblicazione: (2024)
Omni Survey for Multimodality Analysis in Visual Object Tracking
di: Tang, Zhangyong, et al.
Pubblicazione: (2025)
di: Tang, Zhangyong, et al.
Pubblicazione: (2025)
Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
di: Li, Yuyang, et al.
Pubblicazione: (2025)
di: Li, Yuyang, et al.
Pubblicazione: (2025)
Grid: Omni Visual Generation
di: Wan, Cong, et al.
Pubblicazione: (2024)
di: Wan, Cong, et al.
Pubblicazione: (2024)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding
di: Ye, Junliang, et al.
Pubblicazione: (2025)
di: Ye, Junliang, et al.
Pubblicazione: (2025)
MMDG-Bench: A Benchmark for Multimodal Domain Generalization
di: Zhan, Qianshan, et al.
Pubblicazione: (2026)
di: Zhan, Qianshan, et al.
Pubblicazione: (2026)
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
di: Zhao, Jiaxing, et al.
Pubblicazione: (2025)
HERO: Human Reaction Generation from Videos
di: Yu, Chengjun, et al.
Pubblicazione: (2025)
di: Yu, Chengjun, et al.
Pubblicazione: (2025)
VinciCoder: Unifying Multimodal Code Generation via Coarse-to-fine Visual Reinforcement Learning
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
di: Zhao, Xuanle, et al.
Pubblicazione: (2025)
TOUCH: Text-guided Controllable Generation of Free-Form Hand-Object Interactions
di: Han, Guangyi, et al.
Pubblicazione: (2025)
di: Han, Guangyi, et al.
Pubblicazione: (2025)
OmniCam: Unified Multimodal Video Generation via Camera Control
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
di: Yang, Xiaoda, et al.
Pubblicazione: (2025)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
di: Wang, Zehan, et al.
Pubblicazione: (2024)
di: Wang, Zehan, et al.
Pubblicazione: (2024)
LEMON: Learning 3D Human-Object Interaction Relation from 2D Images
di: Yang, Yuhang, et al.
Pubblicazione: (2023)
di: Yang, Yuhang, et al.
Pubblicazione: (2023)
Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion
di: Li, Lijiang, et al.
Pubblicazione: (2026)
di: Li, Lijiang, et al.
Pubblicazione: (2026)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
di: Liu, Jialun, et al.
Pubblicazione: (2026)
di: Liu, Jialun, et al.
Pubblicazione: (2026)
UIF: An Objective Quality Assessment for Underwater Image Enhancement
di: Zheng, Yannan, et al.
Pubblicazione: (2022)
di: Zheng, Yannan, et al.
Pubblicazione: (2022)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
di: Xi, Dianbing, et al.
Pubblicazione: (2025)
OmniHD-Scenes: A Next-Generation Multimodal Dataset for Autonomous Driving
di: Zheng, Lianqing, et al.
Pubblicazione: (2024)
di: Zheng, Lianqing, et al.
Pubblicazione: (2024)
Tactile DreamFusion: Exploiting Tactile Sensing for 3D Generation
di: Gao, Ruihan, et al.
Pubblicazione: (2024)
di: Gao, Ruihan, et al.
Pubblicazione: (2024)
RAIN: Real-time Animation of Infinite Video Stream
di: Shu, Zhilei, et al.
Pubblicazione: (2024)
di: Shu, Zhilei, et al.
Pubblicazione: (2024)
OMUDA: Omni-level Masking for Unsupervised Domain Adaptation in Semantic Segmentation
di: Ou, Yang, et al.
Pubblicazione: (2025)
di: Ou, Yang, et al.
Pubblicazione: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
di: Yu, Wenwen, et al.
Pubblicazione: (2025)
Diverse Deep Feature Ensemble Learning for Omni-Domain Generalized Person Re-identification
di: Ang, Eugene P. W., et al.
Pubblicazione: (2024)
di: Ang, Eugene P. W., et al.
Pubblicazione: (2024)
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
di: Chen, Qian, et al.
Pubblicazione: (2026)
di: Chen, Qian, et al.
Pubblicazione: (2026)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
di: Zhou, Zhiwang, et al.
Pubblicazione: (2025)
di: Zhou, Zhiwang, et al.
Pubblicazione: (2025)
OmniSch: A Multimodal PCB Schematic Benchmark For Structured Diagram Visual Reasoning
di: Lu, Taiting, et al.
Pubblicazione: (2026)
di: Lu, Taiting, et al.
Pubblicazione: (2026)
VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
di: Zhu, Jiaying, et al.
Pubblicazione: (2025)
DreamOmni2: Multimodal Instruction-based Editing and Generation
di: Xia, Bin, et al.
Pubblicazione: (2025)
di: Xia, Bin, et al.
Pubblicazione: (2025)
OmniGen: Unified Multimodal Sensor Generation for Autonomous Driving
di: Tang, Tao, et al.
Pubblicazione: (2025)
di: Tang, Tao, et al.
Pubblicazione: (2025)
OmniMotion: Multimodal Motion Generation with Continuous Masked Autoregression
di: Li, Zhe, et al.
Pubblicazione: (2025)
di: Li, Zhe, et al.
Pubblicazione: (2025)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025)
di: Zhao, Rui, et al.
Pubblicazione: (2025)
The Language of Touch: Translating Vibrations into Text with Dual-Branch Learning
di: Chen, Jin, et al.
Pubblicazione: (2026)
di: Chen, Jin, et al.
Pubblicazione: (2026)
FC3DNet: A Fully Connected Encoder-Decoder for Efficient Demoir'eing
di: Du, Zhibo, et al.
Pubblicazione: (2024)
di: Du, Zhibo, et al.
Pubblicazione: (2024)
End-to-End Spatial-Temporal Transformer for Real-time 4D HOI Reconstruction
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
di: Zhang, Haoyu, et al.
Pubblicazione: (2026)
Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation
di: AI, Inclusion, et al.
Pubblicazione: (2025)
di: AI, Inclusion, et al.
Pubblicazione: (2025)
Aligned Divergent Pathways for Omni-Domain Generalized Person Re-Identification
di: Ang, Eugene P. W., et al.
Pubblicazione: (2024)
di: Ang, Eugene P. W., et al.
Pubblicazione: (2024)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
di: Zhao, Shifang, et al.
Pubblicazione: (2025)
di: Zhao, Shifang, et al.
Pubblicazione: (2025)
Beyond Fidelity: Semantic Similarity Assessment in Low-Level Image Processing
di: Wang, Runjie, et al.
Pubblicazione: (2026)
di: Wang, Runjie, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Event-based Visual Deformation Measurement
di: Wu, Yuliang, et al.
Pubblicazione: (2026) -
Visual-Geometric Collaborative Guidance for Affordance Learning
di: Luo, Hongchen, et al.
Pubblicazione: (2024) -
Omni Survey for Multimodality Analysis in Visual Object Tracking
di: Tang, Zhangyong, et al.
Pubblicazione: (2025) -
Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
di: Li, Yuyang, et al.
Pubblicazione: (2025) -
Grid: Omni Visual Generation
di: Wan, Cong, et al.
Pubblicazione: (2024)