Direction-aware 3D Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Quan, Xuan, Weihao, Wang, Junjue, Yokoya, Naoto, Shao, Ling, Lu, Shijian |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
par: Tsujimoto, Mai, et autres
Publié: (2025)
par: Tsujimoto, Mai, et autres
Publié: (2025)
Foundation Models for Remote Sensing and Earth Observation: A Survey
par: Xiao, Aoran, et autres
Publié: (2024)
par: Xiao, Aoran, et autres
Publié: (2024)
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
par: Xuan, Weihao, et autres
Publié: (2025)
par: Xuan, Weihao, et autres
Publié: (2025)
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
par: Xuan, Weihao, et autres
Publié: (2025)
par: Xuan, Weihao, et autres
Publié: (2025)
L3DR: 3D-aware LiDAR Diffusion and Rectification
par: Liu, Quan, et autres
Publié: (2026)
par: Liu, Quan, et autres
Publié: (2026)
Segment Anything with Multiple Modalities
par: Xiao, Aoran, et autres
Publié: (2024)
par: Xiao, Aoran, et autres
Publié: (2024)
Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers
par: Dai, Pengyu, et autres
Publié: (2026)
par: Dai, Pengyu, et autres
Publié: (2026)
SynRS3D: A Synthetic Dataset for Global 3D Semantic Understanding from Monocular Remote Sensing Imagery
par: Song, Jian, et autres
Publié: (2024)
par: Song, Jian, et autres
Publié: (2024)
Multimodal 3D Reasoning Segmentation with Complex Scenes
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
par: Wang, Junjue, et autres
Publié: (2025)
par: Wang, Junjue, et autres
Publié: (2025)
A Comprehensive Study on Visual Token Redundancy for Discrete Diffusion-based Multimodal Large Language Models
par: Li, Duo, et autres
Publié: (2025)
par: Li, Duo, et autres
Publié: (2025)
OpenEarth-Agent: From Tool Calling to Tool Creation for Open-Environment Earth Observation
par: Zhao, Sijie, et autres
Publié: (2026)
par: Zhao, Sijie, et autres
Publié: (2026)
SOGS: Second-Order Anchor for Advanced 3D Gaussian Splatting
par: Zhang, Jiahui, et autres
Publié: (2025)
par: Zhang, Jiahui, et autres
Publié: (2025)
CAT-SAM: Conditional Tuning for Few-Shot Adaptation of Segment Anything Model
par: Xiao, Aoran, et autres
Publié: (2024)
par: Xiao, Aoran, et autres
Publié: (2024)
A Survey of Label-Efficient Deep Learning for 3D Point Clouds
par: Xiao, Aoran, et autres
Publié: (2023)
par: Xiao, Aoran, et autres
Publié: (2023)
Enhancing 3D LiDAR Segmentation by Shaping Dense and Accurate 2D Semantic Predictions
par: Dong, Xiaoyu, et autres
Publié: (2026)
par: Dong, Xiaoyu, et autres
Publié: (2026)
Novel View Extrapolation with Video Diffusion Priors
par: Liu, Kunhao, et autres
Publié: (2024)
par: Liu, Kunhao, et autres
Publié: (2024)
GaussianOcc: Fully Self-supervised and Efficient 3D Occupancy Estimation with Gaussian Splatting
par: Gan, Wanshui, et autres
Publié: (2024)
par: Gan, Wanshui, et autres
Publié: (2024)
StyleGaussian: Instant 3D Style Transfer with Gaussian Splatting
par: Liu, Kunhao, et autres
Publié: (2024)
par: Liu, Kunhao, et autres
Publié: (2024)
Referring Multiple Regions with Large Multimodal Models via Contextual Latent Steering
par: Xing, Yun, et autres
Publié: (2026)
par: Xing, Yun, et autres
Publié: (2026)
MonoMAE: Enhancing Monocular 3D Detection through Depth-Aware Masked Autoencoders
par: Jiang, Xueying, et autres
Publié: (2024)
par: Jiang, Xueying, et autres
Publié: (2024)
PCR-GS: COLMAP-Free 3D Gaussian Splatting via Pose Co-Regularizations
par: Wei, Yu, et autres
Publié: (2025)
par: Wei, Yu, et autres
Publié: (2025)
MuSASplat: Efficient Sparse-View 3D Gaussian Splats via Lightweight Multi-Scale Adaptation
par: Xu, Muyu, et autres
Publié: (2025)
par: Xu, Muyu, et autres
Publié: (2025)
MM-OVSeg:Multimodal Optical-SAR Fusion for Open-Vocabulary Segmentation in Remote Sensing
par: Wei, Yimin, et autres
Publié: (2026)
par: Wei, Yimin, et autres
Publié: (2026)
Exploring 3D Reasoning-Driven Planning: From Implicit Human Intentions to Route-Aware Activity Planning
par: Jiang, Xueying, et autres
Publié: (2025)
par: Jiang, Xueying, et autres
Publié: (2025)
BRIGHT: A globally distributed multimodal building damage assessment dataset with very-high-resolution for all-weather disaster response
par: Chen, Hongruixuan, et autres
Publié: (2025)
par: Chen, Hongruixuan, et autres
Publié: (2025)
GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing
par: Xiao, Aoran, et autres
Publié: (2026)
par: Xiao, Aoran, et autres
Publié: (2026)
LongHalQA: Long-Context Hallucination Evaluation for MultiModal Large Language Models
par: Qiu, Han, et autres
Publié: (2024)
par: Qiu, Han, et autres
Publié: (2024)
Robust Self-Supervised Cross-Modal Super-Resolution against Real-World Misaligned Observations
par: Dong, Xiaoyu, et autres
Publié: (2026)
par: Dong, Xiaoyu, et autres
Publié: (2026)
MP-HSIR: A Multi-Prompt Framework for Universal Hyperspectral Image Restoration
par: Wu, Zhehui, et autres
Publié: (2025)
par: Wu, Zhehui, et autres
Publié: (2025)
Part-X-MLLM: Part-aware 3D Multimodal Large Language Model
par: Wang, Chunshi, et autres
Publié: (2025)
par: Wang, Chunshi, et autres
Publié: (2025)
STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding
par: Li, Wenhao, et autres
Publié: (2026)
par: Li, Wenhao, et autres
Publié: (2026)
Domain Adaptation for Large-Vocabulary Object Detectors
par: Jiang, Kai, et autres
Publié: (2024)
par: Jiang, Kai, et autres
Publié: (2024)
Unsupervised Domain Adaptation Architecture Search with Self-Training for Land Cover Mapping
par: Broni-Bediako, Clifford, et autres
Publié: (2024)
par: Broni-Bediako, Clifford, et autres
Publié: (2024)
Enhancing Monocular Height Estimation via Sparse LiDAR-Guided Correction
par: Song, Jian, et autres
Publié: (2025)
par: Song, Jian, et autres
Publié: (2025)
Boosting Reasoning in Large Multimodal Models via Activation Replay
par: Xing, Yun, et autres
Publié: (2025)
par: Xing, Yun, et autres
Publié: (2025)
ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance
par: Li, Duo, et autres
Publié: (2025)
par: Li, Duo, et autres
Publié: (2025)
SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection
par: Qi, Tianye, et autres
Publié: (2025)
par: Qi, Tianye, et autres
Publié: (2025)
Local-to-Global Cross-Modal Attention-Aware Fusion for HSI-X Semantic Segmentation
par: Zhang, Xuming, et autres
Publié: (2024)
par: Zhang, Xuming, et autres
Publié: (2024)
V4d: voxel for 4d novel view synthesis
par: Gan, Wanshui, et autres
Publié: (2022)
par: Gan, Wanshui, et autres
Publié: (2022)
Documents similaires
-
Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery
par: Tsujimoto, Mai, et autres
Publié: (2025) -
Foundation Models for Remote Sensing and Earth Observation: A Survey
par: Xiao, Aoran, et autres
Publié: (2024) -
Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models
par: Xuan, Weihao, et autres
Publié: (2025) -
DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding
par: Xuan, Weihao, et autres
Publié: (2025) -
L3DR: 3D-aware LiDAR Diffusion and Rectification
par: Liu, Quan, et autres
Publié: (2026)