MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Yu, Hai-Tao, Song, Mofei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
por: Wang, Tianyi, et al.
Publicado: (2025)
por: Wang, Tianyi, et al.
Publicado: (2025)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
por: Zhang, Dongxu, et al.
Publicado: (2026)
por: Zhang, Dongxu, et al.
Publicado: (2026)
Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding
por: Mane, Atharv Mahesh, et al.
Publicado: (2025)
por: Mane, Atharv Mahesh, et al.
Publicado: (2025)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
por: Li, Shenshen, et al.
Publicado: (2025)
por: Li, Shenshen, et al.
Publicado: (2025)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
por: Shan, Ziyu, et al.
Publicado: (2024)
por: Shan, Ziyu, et al.
Publicado: (2024)
MM-MovieDubber: Towards Multi-Modal Learning for Multi-Modal Movie Dubbing
por: Zheng, Junjie, et al.
Publicado: (2025)
por: Zheng, Junjie, et al.
Publicado: (2025)
Robust Fuzzy Multi-view Learning under View Conflict
por: Duan, Siyuan, et al.
Publicado: (2026)
por: Duan, Siyuan, et al.
Publicado: (2026)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
por: Shan, Ziyu, et al.
Publicado: (2024)
por: Shan, Ziyu, et al.
Publicado: (2024)
On-the-Fly Object-aware Representative Point Selection in Point Cloud
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
por: Zhang, Xiaoyu, et al.
Publicado: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
Evaluating the Impact of Point Cloud Colorization on Semantic Segmentation Accuracy
por: Zhu, Qinfeng, et al.
Publicado: (2024)
por: Zhu, Qinfeng, et al.
Publicado: (2024)
Towards Multi-Task Multi-Modal Models: A Video Generative Perspective
por: Yu, Lijun
Publicado: (2024)
por: Yu, Lijun
Publicado: (2024)
Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey
por: Wang, Xiao, et al.
Publicado: (2023)
por: Wang, Xiao, et al.
Publicado: (2023)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
por: Cai, Minghong, et al.
Publicado: (2024)
por: Cai, Minghong, et al.
Publicado: (2024)
Harnessing Self-Supervised Features for Art Classification
por: Melis, Federico, et al.
Publicado: (2026)
por: Melis, Federico, et al.
Publicado: (2026)
Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework
por: Liu, Ke, et al.
Publicado: (2026)
por: Liu, Ke, et al.
Publicado: (2026)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
por: Zhang, Yulong, et al.
Publicado: (2025)
por: Zhang, Yulong, et al.
Publicado: (2025)
LLM-EvRep: Learning an LLM-Compatible Event Representation Using a Self-Supervised Framework
por: Yu, Zongyou, et al.
Publicado: (2025)
por: Yu, Zongyou, et al.
Publicado: (2025)
Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability
por: Li, Chengzhi, et al.
Publicado: (2025)
por: Li, Chengzhi, et al.
Publicado: (2025)
GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality
por: Zhang, Zhiwei, et al.
Publicado: (2026)
por: Zhang, Zhiwei, et al.
Publicado: (2026)
Taming Modality Entanglement in Continual Audio-Visual Segmentation
por: Hong, Yuyang, et al.
Publicado: (2025)
por: Hong, Yuyang, et al.
Publicado: (2025)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025)
por: Zhang, Yinghui, et al.
Publicado: (2025)
Enhancing Visible-Infrared Person Re-identification with Modality- and Instance-aware Visual Prompt Learning
por: Wu, Ruiqi, et al.
Publicado: (2024)
por: Wu, Ruiqi, et al.
Publicado: (2024)
EvRepSL: Event-Stream Representation via Self-Supervised Learning for Event-Based Vision
por: Qu, Qiang, et al.
Publicado: (2024)
por: Qu, Qiang, et al.
Publicado: (2024)
CountingFruit: Language-Guided 3D Fruit Counting with Semantic Gaussian Splatting
por: Li, Fengze, et al.
Publicado: (2025)
por: Li, Fengze, et al.
Publicado: (2025)
DualComp: End-to-End Learning of a Unified Dual-Modality Lossless Compressor
por: Zhao, Yan, et al.
Publicado: (2025)
por: Zhao, Yan, et al.
Publicado: (2025)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
por: Tian, Zeyue, et al.
Publicado: (2026)
por: Tian, Zeyue, et al.
Publicado: (2026)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
por: Mo, Wentao, et al.
Publicado: (2026)
por: Mo, Wentao, et al.
Publicado: (2026)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
por: Yao, Lei, et al.
Publicado: (2025)
por: Yao, Lei, et al.
Publicado: (2025)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
por: Yu, Jiashuo, et al.
Publicado: (2025)
por: Yu, Jiashuo, et al.
Publicado: (2025)
Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
por: Zhang, Hang, et al.
Publicado: (2024)
por: Zhang, Hang, et al.
Publicado: (2024)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
por: Yu, Xuzheng, et al.
Publicado: (2024)
por: Yu, Xuzheng, et al.
Publicado: (2024)
Efficient and Generic Point Model for Lossless Point Cloud Attribute Compression
por: You, Kang, et al.
Publicado: (2024)
por: You, Kang, et al.
Publicado: (2024)
RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models
por: Lin, Xiang, et al.
Publicado: (2025)
por: Lin, Xiang, et al.
Publicado: (2025)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2022)
por: Fang, Xiang, et al.
Publicado: (2022)
Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping
por: Zhou, Chao, et al.
Publicado: (2026)
por: Zhou, Chao, et al.
Publicado: (2026)
Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models
por: Yu, Xiaomin, et al.
Publicado: (2026)
por: Yu, Xiaomin, et al.
Publicado: (2026)
Tracking and Segmenting Anything in Any Modality
por: Zhang, Tianlu, et al.
Publicado: (2025)
por: Zhang, Tianlu, et al.
Publicado: (2025)
Ejemplares similares
-
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
por: Wang, Tianyi, et al.
Publicado: (2025) -
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
por: Zhang, Dongxu, et al.
Publicado: (2026) -
Ges3ViG: Incorporating Pointing Gestures into Language-Based 3D Visual Grounding for Embodied Reference Understanding
por: Mane, Atharv Mahesh, et al.
Publicado: (2025) -
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
por: Li, Shenshen, et al.
Publicado: (2025) -
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
por: Zhang, Xiaoyu, et al.
Publicado: (2025)