Advancing 3D Scene Understanding with MV-ScanQA Multi-View Reasoning Evaluation and TripAlign Pre-training Dataset
Fuente:
arXiv
Guardado en:
| Autores principales: | Mo, Wentao, Chen, Qingchao, Peng, Yuxin, Huang, Siyuan, Liu, Yang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
por: Fei, Ben, et al.
Publicado: (2024)
por: Fei, Ben, et al.
Publicado: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
por: Min, Chen, et al.
Publicado: (2023)
por: Min, Chen, et al.
Publicado: (2023)
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
por: Gao, Zhilin, et al.
Publicado: (2025)
por: Gao, Zhilin, et al.
Publicado: (2025)
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
por: Gao, Jiayi, et al.
Publicado: (2025)
por: Gao, Jiayi, et al.
Publicado: (2025)
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
por: Tran, Quang-Linh, et al.
Publicado: (2025)
por: Tran, Quang-Linh, et al.
Publicado: (2025)
Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs
por: Mo, Wentao, et al.
Publicado: (2026)
por: Mo, Wentao, et al.
Publicado: (2026)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
por: Zou, Jialing, et al.
Publicado: (2023)
por: Zou, Jialing, et al.
Publicado: (2023)
Robust Fuzzy Multi-view Learning under View Conflict
por: Duan, Siyuan, et al.
Publicado: (2026)
por: Duan, Siyuan, et al.
Publicado: (2026)
Scaling up Multimodal Pre-training for Sign Language Understanding
por: Zhou, Wengang, et al.
Publicado: (2024)
por: Zhou, Wengang, et al.
Publicado: (2024)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
por: He, Xusheng, et al.
Publicado: (2025)
por: He, Xusheng, et al.
Publicado: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
por: Li, Zeju, et al.
Publicado: (2024)
por: Li, Zeju, et al.
Publicado: (2024)
Accelerating Multi-Condition T2I Generation via Adaptive Condition Offloading and Pruning
por: Kong, Yuxin, et al.
Publicado: (2026)
por: Kong, Yuxin, et al.
Publicado: (2026)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
por: Dong, Wenqi, et al.
Publicado: (2025)
por: Dong, Wenqi, et al.
Publicado: (2025)
Disparity-based Stereo Image Compression with Aligned Cross-View Priors
por: Zhai, Yongqi, et al.
Publicado: (2022)
por: Zhai, Yongqi, et al.
Publicado: (2022)
Challenging Dataset and Multi-modal Gated Mixture of Experts Model for Remote Sensing Copy-Move Forgery Understanding
por: Zhang, Ze, et al.
Publicado: (2025)
por: Zhang, Ze, et al.
Publicado: (2025)
Short-Form Video Viewing Behavior Analysis and Multi-Step Viewing Time Prediction
por: Yen, Vu Thi Hai, et al.
Publicado: (2026)
por: Yen, Vu Thi Hai, et al.
Publicado: (2026)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning
por: Wang, Youze, et al.
Publicado: (2023)
por: Wang, Youze, et al.
Publicado: (2023)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
por: Ma, Chenghao, et al.
Publicado: (2025)
por: Ma, Chenghao, et al.
Publicado: (2025)
GScomp-QA: A Subjective Dataset for Quality Assessment of Compressed Gaussian Splatting
por: Martin, Pedro, et al.
Publicado: (2026)
por: Martin, Pedro, et al.
Publicado: (2026)
GS-QA: Comprehensive Quality Assessment Benchmark for Gaussian Splatting View Synthesis
por: Martin, Pedro, et al.
Publicado: (2025)
por: Martin, Pedro, et al.
Publicado: (2025)
MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
por: Peng, Yuezhang, et al.
Publicado: (2025)
por: Peng, Yuezhang, et al.
Publicado: (2025)
Jamendo-QA: A Large-Scale Music Question Answering Dataset
por: Koh, Junyoung, et al.
Publicado: (2025)
por: Koh, Junyoung, et al.
Publicado: (2025)
NeRF-QA: Neural Radiance Fields Quality Assessment Database
por: Martin, Pedro, et al.
Publicado: (2023)
por: Martin, Pedro, et al.
Publicado: (2023)
Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions
por: Shi, Junchang, et al.
Publicado: (2025)
por: Shi, Junchang, et al.
Publicado: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
por: Bai, Hayes, et al.
Publicado: (2026)
por: Bai, Hayes, et al.
Publicado: (2026)
360+x: A Panoptic Multi-modal Scene Understanding Dataset
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding
por: Wang, Jieyi, et al.
Publicado: (2026)
por: Wang, Jieyi, et al.
Publicado: (2026)
Multimodal Pre-training Framework for Sequential Recommendation via Contrastive Learning
por: Zhang, Lingzi, et al.
Publicado: (2023)
por: Zhang, Lingzi, et al.
Publicado: (2023)
NeRF View Synthesis: Subjective Quality Assessment and Objective Metrics Evaluation
por: Martin, Pedro, et al.
Publicado: (2024)
por: Martin, Pedro, et al.
Publicado: (2024)
Contrastive Pre-Training with Multi-View Fusion for No-Reference Point Cloud Quality Assessment
por: Shan, Ziyu, et al.
Publicado: (2024)
por: Shan, Ziyu, et al.
Publicado: (2024)
MViR: Multi-View Visual-Semantic Representation for Fake News Detection
por: Liang, Haochen, et al.
Publicado: (2026)
por: Liang, Haochen, et al.
Publicado: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
MV-Crafter: An Intelligent System for Music-guided Video Generation
por: Chen, Chuer, et al.
Publicado: (2025)
por: Chen, Chuer, et al.
Publicado: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
por: Calbucura, Nicolas, et al.
Publicado: (2025)
por: Calbucura, Nicolas, et al.
Publicado: (2025)
RA-BLIP: Multimodal Adaptive Retrieval-Augmented Bootstrapping Language-Image Pre-training
por: Ding, Muhe, et al.
Publicado: (2024)
por: Ding, Muhe, et al.
Publicado: (2024)
InfiMM-WebMath-40B: Advancing Multimodal Pre-Training for Enhanced Mathematical Reasoning
por: Han, Xiaotian, et al.
Publicado: (2024)
por: Han, Xiaotian, et al.
Publicado: (2024)
Multi-modal and Metadata Capture Model for Micro Video Popularity Prediction
por: Lu, Jiacheng, et al.
Publicado: (2025)
por: Lu, Jiacheng, et al.
Publicado: (2025)
Modularized Zero-shot VQA with Pre-trained Models
por: Cao, Rui, et al.
Publicado: (2023)
por: Cao, Rui, et al.
Publicado: (2023)
Reinforcing Pre-trained Models Using Counterfactual Images
por: Li, Xiang, et al.
Publicado: (2024)
por: Li, Xiang, et al.
Publicado: (2024)
Ejemplares similares
-
Towards Unified Representation of Multi-Modal Pre-training for 3D Understanding via Differentiable Rendering
por: Fei, Ben, et al.
Publicado: (2024) -
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
por: Min, Chen, et al.
Publicado: (2023) -
Ges-QA: A Multidimensional Quality Assessment Dataset for Audio-to-3D Gesture Generation
por: Gao, Zhilin, et al.
Publicado: (2025) -
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement
por: Gao, Jiayi, et al.
Publicado: (2025) -
OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset
por: Tran, Quang-Linh, et al.
Publicado: (2025)