Gespeichert in:
| Hauptverfasser: | He, Qingrong, Lin, Kejun, Chen, Shizhe, Hu, Anwen, Jin, Qin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2404.14705 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
von: Liu, Ruiping, et al.
Veröffentlicht: (2025)
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
von: Zhang, Liang, et al.
Veröffentlicht: (2024)
von: Zhang, Liang, et al.
Veröffentlicht: (2024)
Empowering Large Language Models with 3D Situation Awareness
von: Yuan, Zhihao, et al.
Veröffentlicht: (2025)
von: Yuan, Zhihao, et al.
Veröffentlicht: (2025)
Learning High-Fidelity Robot Self-Model with Articulated 3D Gaussian Splatting
von: Hu, Kejun, et al.
Veröffentlicht: (2025)
von: Hu, Kejun, et al.
Veröffentlicht: (2025)
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
von: Zhang, Yue, et al.
Veröffentlicht: (2024)
Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
von: Garcia, Ricardo, et al.
Veröffentlicht: (2024)
von: Garcia, Ricardo, et al.
Veröffentlicht: (2024)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
von: Huang, Tai-Ming, et al.
Veröffentlicht: (2025)
von: Huang, Tai-Ming, et al.
Veröffentlicht: (2025)
MLLM-For3D: Adapting Multimodal Large Language Model for 3D Reasoning Segmentation
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
von: Huang, Jiaxin, et al.
Veröffentlicht: (2025)
Think-as-You-See: Streaming Chain-of-Thought Reasoning for Large Vision-Language Models
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
von: Zhang, Jialiang, et al.
Veröffentlicht: (2026)
Scaling Cross-Environment Failure Reasoning Data for Vision-Language Robotic Manipulation
von: Pacaud, Paul, et al.
Veröffentlicht: (2025)
von: Pacaud, Paul, et al.
Veröffentlicht: (2025)
Think3D: Thinking with Space for Spatial Reasoning
von: Zhang, Zaibin, et al.
Veröffentlicht: (2026)
von: Zhang, Zaibin, et al.
Veröffentlicht: (2026)
From Perception to Reasoning: Deep Thinking Empowers Multimodal Large Language Models
von: Zhu, Wenxin, et al.
Veröffentlicht: (2025)
von: Zhu, Wenxin, et al.
Veröffentlicht: (2025)
Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World
von: Huang, Yuzhi, et al.
Veröffentlicht: (2026)
von: Huang, Yuzhi, et al.
Veröffentlicht: (2026)
From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
von: Cai, Chen, et al.
Veröffentlicht: (2025)
von: Cai, Chen, et al.
Veröffentlicht: (2025)
PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction
von: Chen, Shizhe, et al.
Veröffentlicht: (2026)
von: Chen, Shizhe, et al.
Veröffentlicht: (2026)
GTA-Net: An IoT-Integrated 3D Human Pose Estimation System for Real-Time Adolescent Sports Posture Correction
von: Yuan, Shizhe, et al.
Veröffentlicht: (2024)
von: Yuan, Shizhe, et al.
Veröffentlicht: (2024)
SUGAR: Pre-training 3D Visual Representations for Robotics
von: Chen, Shizhe, et al.
Veröffentlicht: (2024)
von: Chen, Shizhe, et al.
Veröffentlicht: (2024)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
von: Huang, Kuan-Chih, et al.
Veröffentlicht: (2024)
von: Huang, Kuan-Chih, et al.
Veröffentlicht: (2024)
SOE: SO(3)-Equivariant 3D MRI Encoding
von: He, Shizhe, et al.
Veröffentlicht: (2024)
von: He, Shizhe, et al.
Veröffentlicht: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
von: He, Zhihao, et al.
Veröffentlicht: (2025)
von: He, Zhihao, et al.
Veröffentlicht: (2025)
Rethinking the State Update Gate for Long-Sequence Recurrent 3D Reconstruction
von: Ren, Kejun, et al.
Veröffentlicht: (2026)
von: Ren, Kejun, et al.
Veröffentlicht: (2026)
What if? Emulative Simulation with World Models for Situated Reasoning
von: Liu, Ruiping, et al.
Veröffentlicht: (2026)
von: Liu, Ruiping, et al.
Veröffentlicht: (2026)
Situational Awareness Matters in 3D Vision Language Reasoning
von: Man, Yunze, et al.
Veröffentlicht: (2024)
von: Man, Yunze, et al.
Veröffentlicht: (2024)
Multi-modal Situated Reasoning in 3D Scenes
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2024)
von: Linghu, Xiongkun, et al.
Veröffentlicht: (2024)
Online 3D Scene Reconstruction Using Neural Object Priors
von: Chabal, Thomas, et al.
Veröffentlicht: (2025)
von: Chabal, Thomas, et al.
Veröffentlicht: (2025)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
von: Sun, Jintao, et al.
Veröffentlicht: (2026)
von: Sun, Jintao, et al.
Veröffentlicht: (2026)
mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
von: Li, Yunxin, et al.
Veröffentlicht: (2025)
ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
von: Wu, Peiran, et al.
Veröffentlicht: (2025)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
von: Wang, Jiaqi, et al.
Veröffentlicht: (2025)
Enhancing Vision Language Models with Logic Reasoning for Situational Awareness
von: Pradeep, Pavana, et al.
Veröffentlicht: (2026)
von: Pradeep, Pavana, et al.
Veröffentlicht: (2026)
Dual-Anchoring: Addressing State Drift in Vision-Language Navigation
von: Wu, Kangyi, et al.
Veröffentlicht: (2026)
von: Wu, Kangyi, et al.
Veröffentlicht: (2026)
Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
von: Wang, Lehan, et al.
Veröffentlicht: (2025)
NextBestPath: Efficient 3D Mapping of Unseen Environments
von: Li, Shiyao, et al.
Veröffentlicht: (2025)
von: Li, Shiyao, et al.
Veröffentlicht: (2025)
mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
von: Hu, Anwen, et al.
Veröffentlicht: (2024)
Making Large Language Models Better Planners with Reasoning-Decision Alignment
von: Huang, Zhijian, et al.
Veröffentlicht: (2024)
von: Huang, Zhijian, et al.
Veröffentlicht: (2024)
Reinforcing Video Reasoning with Focused Thinking
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
von: Dang, Jisheng, et al.
Veröffentlicht: (2025)
OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model
von: Zhang, Kunshen
Veröffentlicht: (2025)
von: Zhang, Kunshen
Veröffentlicht: (2025)
Beyond Medical Diagnostics: How Medical Multimodal Large Language Models Think in Space
von: Trinh, Quoc-Huy, et al.
Veröffentlicht: (2026)
von: Trinh, Quoc-Huy, et al.
Veröffentlicht: (2026)
mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models
von: Ye, Jiabo, et al.
Veröffentlicht: (2024)
von: Ye, Jiabo, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
von: Liu, Ruiping, et al.
Veröffentlicht: (2025) -
TinyChart: Efficient Chart Understanding with Visual Token Merging and Program-of-Thoughts Learning
von: Zhang, Liang, et al.
Veröffentlicht: (2024) -
Empowering Large Language Models with 3D Situation Awareness
von: Yuan, Zhihao, et al.
Veröffentlicht: (2025) -
Learning High-Fidelity Robot Self-Model with Articulated 3D Gaussian Splatting
von: Hu, Kejun, et al.
Veröffentlicht: (2025) -
SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models
von: Zhang, Yue, et al.
Veröffentlicht: (2024)