OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zehan, Zhang, Ziang, Zhang, Hang, Liu, Luping, Huang, Rongjie, Cheng, Xize, Zhao, Hengshuang, Zhao, Zhou |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
par: Huang, Haifeng, et autres
Publié: (2023)
par: Huang, Haifeng, et autres
Publié: (2023)
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
Orient Anything: Learning Robust Object Orientation Estimation from Rendering 3D Models
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
Depth Anything with Any Prior
par: Wang, Zehan, et autres
Publié: (2025)
par: Wang, Zehan, et autres
Publié: (2025)
OmniMamba: Efficient and Unified Multimodal Understanding and Generation via State Space Models
par: Zou, Jialv, et autres
Publié: (2025)
par: Zou, Jialv, et autres
Publié: (2025)
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
par: Zhao, Shifang, et autres
Publié: (2025)
par: Zhao, Shifang, et autres
Publié: (2025)
Omni Survey for Multimodality Analysis in Visual Object Tracking
par: Tang, Zhangyong, et autres
Publié: (2025)
par: Tang, Zhangyong, et autres
Publié: (2025)
UniBind: LLM-Augmented Unified and Balanced Representation Space to Bind Them All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
par: Lyu, Yuanhuiyi, et autres
Publié: (2024)
OA-CNNs: Omni-Adaptive Sparse CNNs for 3D Semantic Segmentation
par: Peng, Bohao, et autres
Publié: (2024)
par: Peng, Bohao, et autres
Publié: (2024)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
par: Zhang, Guohui, et autres
Publié: (2026)
par: Zhang, Guohui, et autres
Publié: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025)
par: Yao, Jiali, et autres
Publié: (2025)
Omni-Scene: Omni-Gaussian Representation for Ego-Centric Sparse-View Scene Reconstruction
par: Wei, Dongxu, et autres
Publié: (2024)
par: Wei, Dongxu, et autres
Publié: (2024)
OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization
par: Han, Minghao, et autres
Publié: (2026)
par: Han, Minghao, et autres
Publié: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
par: Peng, Haosong, et autres
Publié: (2025)
par: Peng, Haosong, et autres
Publié: (2025)
OmniRe: Omni Urban Scene Reconstruction
par: Chen, Ziyu, et autres
Publié: (2024)
par: Chen, Ziyu, et autres
Publié: (2024)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
par: Zhao, Ruixiang, et autres
Publié: (2026)
par: Zhao, Ruixiang, et autres
Publié: (2026)
OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering
par: Jia, Yiduo, et autres
Publié: (2026)
par: Jia, Yiduo, et autres
Publié: (2026)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
par: Xi, Dianbing, et autres
Publié: (2025)
par: Xi, Dianbing, et autres
Publié: (2025)
DreamOmni2: Multimodal Instruction-based Editing and Generation
par: Xia, Bin, et autres
Publié: (2025)
par: Xia, Bin, et autres
Publié: (2025)
OmniEvent: Unified Event Representation Learning
par: Yan, Weiqi, et autres
Publié: (2025)
par: Yan, Weiqi, et autres
Publié: (2025)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
par: Wei, Yujie, et autres
Publié: (2026)
par: Wei, Yujie, et autres
Publié: (2026)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
par: Liu, Jialun, et autres
Publié: (2026)
par: Liu, Jialun, et autres
Publié: (2026)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
par: Yang, Morunliu, et autres
Publié: (2026)
par: Yang, Morunliu, et autres
Publié: (2026)
Context Unrolling in Omni Models
par: Yang, Ceyuan, et autres
Publié: (2026)
par: Yang, Ceyuan, et autres
Publié: (2026)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
Kling-Omni Technical Report
par: Kling Team, et autres
Publié: (2025)
par: Kling Team, et autres
Publié: (2025)
OmniVaT: Single Domain Generalization for Multimodal Visual-Tactile Learning
par: Qiu, Liuxiang, et autres
Publié: (2026)
par: Qiu, Liuxiang, et autres
Publié: (2026)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
OmniVCus: Feedforward Subject-driven Video Customization with Multimodal Control Conditions
par: Cai, Yuanhao, et autres
Publié: (2025)
par: Cai, Yuanhao, et autres
Publié: (2025)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
par: Tao, Haoyi, et autres
Publié: (2026)
par: Tao, Haoyi, et autres
Publié: (2026)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
Omni-Weather: A Unified Multimodal Model for Weather Radar Understanding and Generation
par: Zhou, Zhiwang, et autres
Publié: (2025)
par: Zhou, Zhiwang, et autres
Publié: (2025)
Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
par: Liao, Chao, et autres
Publié: (2025)
par: Liao, Chao, et autres
Publié: (2025)
ViT-Lens: Towards Omni-modal Representations
par: Lei, Weixian, et autres
Publié: (2023)
par: Lei, Weixian, et autres
Publié: (2023)
Documents similaires
-
OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All
par: Lyu, Yuanhuiyi, et autres
Publié: (2024) -
FreeBind: Free Lunch in Unified Multimodal Space via Knowledge Fusion
par: Wang, Zehan, et autres
Publié: (2024) -
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024) -
Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers
par: Huang, Haifeng, et autres
Publié: (2023) -
GenSpace: Benchmarking Spatially-Aware Image Generation
par: Wang, Zehan, et autres
Publié: (2025)