Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fei, Ben, Li, Yixuan, Yang, Weidong, Ma, Lipeng, He, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
3DMambaIPF: A State Space Model for Iterative Point Cloud Filtering via Differentiable Rendering
par: Zhou, Qingyuan, et autres
Publié: (2024)
par: Zhou, Qingyuan, et autres
Publié: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
par: Min, Chen, et autres
Publié: (2023)
par: Min, Chen, et autres
Publié: (2023)
Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
par: You, Hong-Jie, et autres
Publié: (2025)
par: You, Hong-Jie, et autres
Publié: (2025)
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
par: Liu, Liwen, et autres
Publié: (2025)
par: Liu, Liwen, et autres
Publié: (2025)
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
par: Wang, Tianyi, et autres
Publié: (2025)
par: Wang, Tianyi, et autres
Publié: (2025)
Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset
par: Mo, Wentao, et autres
Publié: (2025)
par: Mo, Wentao, et autres
Publié: (2025)
Music2Palette: Emotion-aligned Color Palette Generation via Cross-Modal Representation Learning
par: Hu, Jiayun, et autres
Publié: (2025)
par: Hu, Jiayun, et autres
Publié: (2025)
Structure-Aware Residual-Center Representation for Self-Supervised Open-Set 3D Cross-Modal Retrieval
par: Xu, Yang, et autres
Publié: (2024)
par: Xu, Yang, et autres
Publié: (2024)
XGC-AVis: Towards Audio-Visual Content Understanding with a Multi-Agent Collaborative System
par: Cao, Yuqin, et autres
Publié: (2025)
par: Cao, Yuqin, et autres
Publié: (2025)
Scaling up Multimodal Pre-training for Sign Language Understanding
par: Zhou, Wengang, et autres
Publié: (2024)
par: Zhou, Wengang, et autres
Publié: (2024)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
par: Jiang, Chaoya, et autres
Publié: (2023)
par: Jiang, Chaoya, et autres
Publié: (2023)
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
par: Ding, Muhe, et autres
Publié: (2024)
par: Ding, Muhe, et autres
Publié: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
par: Wang, Xiao, et autres
Publié: (2023)
par: Wang, Xiao, et autres
Publié: (2023)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
par: He, Xusheng, et autres
Publié: (2025)
par: He, Xusheng, et autres
Publié: (2025)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
par: Li, Yuxuan, et autres
Publié: (2024)
par: Li, Yuxuan, et autres
Publié: (2024)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
par: Wei, Tianxin, et autres
Publié: (2024)
par: Wei, Tianxin, et autres
Publié: (2024)
HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning
par: Chen, Liyang, et autres
Publié: (2025)
par: Chen, Liyang, et autres
Publié: (2025)
Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning
par: Zhang, Lingzi, et autres
Publié: (2023)
par: Zhang, Lingzi, et autres
Publié: (2023)
Efficient Object-centric Representation Learning with Pre-trained Geometric Prior
par: Khac, Phúc H. Le, et autres
Publié: (2024)
par: Khac, Phúc H. Le, et autres
Publié: (2024)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
par: Zheng, Junjie, et autres
Publié: (2025)
par: Zheng, Junjie, et autres
Publié: (2025)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
par: Han, Jiaming, et autres
Publié: (2025)
par: Han, Jiaming, et autres
Publié: (2025)
Recognizing Everything from All Modalities at Once: Grounded Multimodal Universal Information Extraction
par: Zhang, Meishan, et autres
Publié: (2024)
par: Zhang, Meishan, et autres
Publié: (2024)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
par: Li, Zeju, et autres
Publié: (2024)
par: Li, Zeju, et autres
Publié: (2024)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
par: Ma, Zhiyong, et autres
Publié: (2025)
par: Ma, Zhiyong, et autres
Publié: (2025)
3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation
par: Li, Yaoru, et autres
Publié: (2025)
par: Li, Yaoru, et autres
Publié: (2025)
Divide and Conquer: Multimodal Video Deepfake Detection via Cross-Modal Fusion and Localization
par: Li, Qingcao, et autres
Publié: (2026)
par: Li, Qingcao, et autres
Publié: (2026)
MotionBeat: Motion-Aligned Music Representation via Embodied Contrastive Learning and Bar-Equivariant Contact-Aware Encoding
par: Wang, Xuanchen, et autres
Publié: (2025)
par: Wang, Xuanchen, et autres
Publié: (2025)
Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning
par: Wang, Youze, et autres
Publié: (2023)
par: Wang, Youze, et autres
Publié: (2023)
GestureHYDRA: Semantic Co-speech Gesture Synthesis via Hybrid Modality Diffusion Transformer and Cascaded-Synchronized Retrieval-Augmented Generation
par: Yang, Quanwei, et autres
Publié: (2025)
par: Yang, Quanwei, et autres
Publié: (2025)
CIRP: Cross-Item Relational Pre-training for Multimodal Product Bundling
par: Ma, Yunshan, et autres
Publié: (2024)
par: Ma, Yunshan, et autres
Publié: (2024)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
Towards Interactive Multimodal Representation of ML Functions for Human Understanding of ML
par: Wang, Bokang, et autres
Publié: (2026)
par: Wang, Bokang, et autres
Publié: (2026)
Towards Structure-aware Model for Multi-modal Knowledge Graph Completion
par: Li, Linyu, et autres
Publié: (2025)
par: Li, Linyu, et autres
Publié: (2025)
RoSMM: A Robust and Secure Multi-Modal Watermarking Framework for Diffusion Models
par: Fang, ZhongLi, et autres
Publié: (2025)
par: Fang, ZhongLi, et autres
Publié: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
AFL-Net: Integrating Audio, Facial, and Lip Modalities with a Two-step Cross-attention for Robust Speaker Diarization in the Wild
par: Yin, Yongkang, et autres
Publié: (2023)
par: Yin, Yongkang, et autres
Publié: (2023)
HistLLM: A Unified Framework for LLM-Based Multimodal Recommendation with User History Encoding and Compression
par: Zhang, Chen, et autres
Publié: (2025)
par: Zhang, Chen, et autres
Publié: (2025)
Streaming Real-Time Rendered Scenes as 3D Gaussians
par: Siekkinen, Matti, et autres
Publié: (2026)
par: Siekkinen, Matti, et autres
Publié: (2026)
Documents similaires
-
3DMambaIPF: A State Space Model for Iterative Point Cloud Filtering via Differentiable Rendering
par: Zhou, Qingyuan, et autres
Publié: (2024) -
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
par: Min, Chen, et autres
Publié: (2023) -
Pianist Transformer: Towards Expressive Piano Performance Rendering via Scalable Self-Supervised Pre-Training
par: You, Hong-Jie, et autres
Publié: (2025) -
Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding
par: Liu, Liwen, et autres
Publié: (2025) -
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
par: Wang, Tianyi, et autres
Publié: (2025)