Saved in:
| Main Authors: | Bonakdar, Omid, Mozayani, Nasser |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2509.16768 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Source-Free Domain Adaptation via Multi-view Contrastive Learning
by: Farhadi, Amirfarhad, et al.
Published: (2025)
by: Farhadi, Amirfarhad, et al.
Published: (2025)
PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing
by: Xie, Yiping, et al.
Published: (2025)
by: Xie, Yiping, et al.
Published: (2025)
FDCT: Frequency-Aware Decomposition and Cross-Modal Token-Alignment for Multi-Sensor Target Classification
by: Sami, Shoaib Meraj, et al.
Published: (2025)
by: Sami, Shoaib Meraj, et al.
Published: (2025)
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
by: Bai, Fan, et al.
Published: (2024)
by: Bai, Fan, et al.
Published: (2024)
A Two-Stage Progressive Pre-training using Multi-Modal Contrastive Masked Autoencoders
by: Jamal, Muhammad Abdullah, et al.
Published: (2024)
by: Jamal, Muhammad Abdullah, et al.
Published: (2024)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
by: Wang, Chunshi, et al.
Published: (2025)
by: Wang, Chunshi, et al.
Published: (2025)
Med3DInsight: Enhancing 3D Medical Image Understanding with 2D Multi-Modal Large Language Models
by: Chen, Qiuhui, et al.
Published: (2024)
by: Chen, Qiuhui, et al.
Published: (2024)
MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models
by: Hu, Lulu, et al.
Published: (2026)
by: Hu, Lulu, et al.
Published: (2026)
OmniPart: Part-Aware 3D Generation with Semantic Decoupling and Structural Cohesion
by: Yang, Yunhan, et al.
Published: (2025)
by: Yang, Yunhan, et al.
Published: (2025)
PartGen: Part-level 3D Generation and Reconstruction with Multi-View Diffusion Models
by: Chen, Minghao, et al.
Published: (2024)
by: Chen, Minghao, et al.
Published: (2024)
Empowering Large Language Models with 3D Situation Awareness
by: Yuan, Zhihao, et al.
Published: (2025)
by: Yuan, Zhihao, et al.
Published: (2025)
Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis
by: Yu, Yang, et al.
Published: (2026)
by: Yu, Yang, et al.
Published: (2026)
Lumina-DiMOO: An Omni Diffusion Large Language Model for Multi-Modal Generation and Understanding
by: Xin, Yi, et al.
Published: (2025)
by: Xin, Yi, et al.
Published: (2025)
Large Motion Model for Unified Multi-Modal Motion Generation
by: Zhang, Mingyuan, et al.
Published: (2024)
by: Zhang, Mingyuan, et al.
Published: (2024)
3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds
by: Chu, Hengshuo, et al.
Published: (2025)
by: Chu, Hengshuo, et al.
Published: (2025)
SeaLion: Semantic Part-Aware Latent Point Diffusion Models for 3D Generation
by: Zhu, Dekai, et al.
Published: (2025)
by: Zhu, Dekai, et al.
Published: (2025)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
by: Zhu, Haowen, et al.
Published: (2026)
by: Zhu, Haowen, et al.
Published: (2026)
Slow-Fast Architecture for Video Multi-Modal Large Language Models
by: Shi, Min, et al.
Published: (2025)
by: Shi, Min, et al.
Published: (2025)
Jailbreak Large Vision-Language Models Through Multi-Modal Linkage
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
by: Nie, Jiahao, et al.
Published: (2024)
by: Nie, Jiahao, et al.
Published: (2024)
Adaptive LiDAR Scanning: Harnessing Temporal Cues for Efficient 3D Object Detection via Multi-Modal Fusion
by: Shoouri, Sara, et al.
Published: (2025)
by: Shoouri, Sara, et al.
Published: (2025)
Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models
by: Li, Yuanbo, et al.
Published: (2026)
by: Li, Yuanbo, et al.
Published: (2026)
Chirpy3D: Part-Aware Multi-View Diffusion for Creative Fine-Grained Object Generation
by: Ng, Kam Woh, et al.
Published: (2025)
by: Ng, Kam Woh, et al.
Published: (2025)
MammothModa: Multi-Modal Large Language Model
by: She, Qi, et al.
Published: (2024)
by: She, Qi, et al.
Published: (2024)
Collaborative Multi-Modal Coding for High-Quality 3D Generation
by: Cao, Ziang, et al.
Published: (2025)
by: Cao, Ziang, et al.
Published: (2025)
Cobra: Extending Mamba to Multi-Modal Large Language Model for Efficient Inference
by: Zhao, Han, et al.
Published: (2024)
by: Zhao, Han, et al.
Published: (2024)
Harnessing Large Language and Vision-Language Models for Robust Out-of-Distribution Detection
by: Lee, Pei-Kang, et al.
Published: (2025)
by: Lee, Pei-Kang, et al.
Published: (2025)
Multi-Modal Generative Embedding Model
by: Ma, Feipeng, et al.
Published: (2024)
by: Ma, Feipeng, et al.
Published: (2024)
Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models
by: Xu, Runsen, et al.
Published: (2025)
by: Xu, Runsen, et al.
Published: (2025)
HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding
by: Yao, Lei, et al.
Published: (2026)
by: Yao, Lei, et al.
Published: (2026)
Diffusion Models For Multi-Modal Generative Modeling
by: Chen, Changyou, et al.
Published: (2024)
by: Chen, Changyou, et al.
Published: (2024)
PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation
by: Umam, Ardian, et al.
Published: (2023)
by: Umam, Ardian, et al.
Published: (2023)
Harnessing Large Language Models for Training-free Video Anomaly Detection
by: Zanella, Luca, et al.
Published: (2024)
by: Zanella, Luca, et al.
Published: (2024)
CG-MLLM: Captioning and Generating 3D content via Multi-modal Large Language Models
by: Huang, Junming, et al.
Published: (2026)
by: Huang, Junming, et al.
Published: (2026)
OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models
by: Yang, Morunliu, et al.
Published: (2026)
by: Yang, Morunliu, et al.
Published: (2026)
Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models
by: XU, Dunyuan, et al.
Published: (2025)
by: XU, Dunyuan, et al.
Published: (2025)
Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval
by: Ko, Dohwan, et al.
Published: (2025)
by: Ko, Dohwan, et al.
Published: (2025)
Detect, Classify, Act: Categorizing Industrial Anomalies with Multi-Modal Large Language Models
by: Mokhtar, Sassan, et al.
Published: (2025)
by: Mokhtar, Sassan, et al.
Published: (2025)
Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models
by: Jung, Daniel Sungho, et al.
Published: (2026)
by: Jung, Daniel Sungho, et al.
Published: (2026)
X-VARS: Introducing Explainability in Football Refereeing with Multi-Modal Large Language Model
by: Held, Jan, et al.
Published: (2024)
by: Held, Jan, et al.
Published: (2024)
Similar Items
-
Source-Free Domain Adaptation via Multi-view Contrastive Learning
by: Farhadi, Amirfarhad, et al.
Published: (2025) -
PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing
by: Xie, Yiping, et al.
Published: (2025) -
FDCT: Frequency-Aware Decomposition and Cross-Modal Token-Alignment for Multi-Sensor Target Classification
by: Sami, Shoaib Meraj, et al.
Published: (2025) -
M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models
by: Bai, Fan, et al.
Published: (2024) -
A Two-Stage Progressive Pre-training using Multi-Modal Contrastive Masked Autoencoders
by: Jamal, Muhammad Abdullah, et al.
Published: (2024)