Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kang, Weitai, Huang, Haifeng, Shang, Yuzhang, Shah, Mubarak, Yan, Yan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
di: Li, Kunyang, et al.
Pubblicazione: (2026)
di: Li, Kunyang, et al.
Pubblicazione: (2026)
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)
di: Wu, Junyi, et al.
Pubblicazione: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion
di: Li, Kunyang, et al.
Pubblicazione: (2026)
di: Li, Kunyang, et al.
Pubblicazione: (2026)
VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
di: Fan, Zhiwen, et al.
Pubblicazione: (2025)
3DResT: A Strong Baseline for Semi-Supervised 3D Referring Expression Segmentation
di: Chen, Wenxin, et al.
Pubblicazione: (2025)
di: Chen, Wenxin, et al.
Pubblicazione: (2025)
Transcrib3D: 3D Referring Expression Resolution through Large Language Models
di: Fang, Jiading, et al.
Pubblicazione: (2024)
di: Fang, Jiading, et al.
Pubblicazione: (2024)
Ross3D: Reconstructive Visual Instruction Tuning with 3D-Awareness
di: Wang, Haochen, et al.
Pubblicazione: (2025)
di: Wang, Haochen, et al.
Pubblicazione: (2025)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
di: Luo, Chuwei, et al.
Pubblicazione: (2024)
Reason3D: Searching and Reasoning 3D Segmentation via Large Language Model
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
di: Huang, Kuan-Chih, et al.
Pubblicazione: (2024)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
di: Wang, Yan, et al.
Pubblicazione: (2025)
di: Wang, Yan, et al.
Pubblicazione: (2025)
MedHallTune: An Instruction-Tuning Benchmark for Mitigating Medical Hallucination in Vision-Language Models
di: Yan, Qiao, et al.
Pubblicazione: (2025)
di: Yan, Qiao, et al.
Pubblicazione: (2025)
PointAD: Comprehending 3D Anomalies from Points and Pixels for Zero-shot 3D Anomaly Detection
di: Zhou, Qihang, et al.
Pubblicazione: (2024)
di: Zhou, Qihang, et al.
Pubblicazione: (2024)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
di: Kumar, Komal, et al.
Pubblicazione: (2025)
di: Kumar, Komal, et al.
Pubblicazione: (2025)
ACTRESS: Active Retraining for Semi-supervised Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
VoxRep: Enhancing 3D Spatial Understanding in 2D Vision-Language Models via Voxel Representation
di: Dao, Alan, et al.
Pubblicazione: (2025)
di: Dao, Alan, et al.
Pubblicazione: (2025)
LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning
di: You, Zebin, et al.
Pubblicazione: (2025)
di: You, Zebin, et al.
Pubblicazione: (2025)
3D-VLA: A 3D Vision-Language-Action Generative World Model
di: Zhen, Haoyu, et al.
Pubblicazione: (2024)
di: Zhen, Haoyu, et al.
Pubblicazione: (2024)
QuEST: Low-bit Diffusion Model Quantization via Efficient Selective Finetuning
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
di: Wang, Haoxuan, et al.
Pubblicazione: (2024)
Instruction-Following Evaluation of Large Vision-Language Models
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
di: Shiono, Daiki, et al.
Pubblicazione: (2025)
Efficient Multimodal Dataset Distillation via Generative Models
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2025)
The Telephone Game: Evaluating Semantic Drift in Unified Models
di: Mollah, Sabbir, et al.
Pubblicazione: (2025)
di: Mollah, Sabbir, et al.
Pubblicazione: (2025)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
di: Liu, Fuxiao, et al.
Pubblicazione: (2023)
Supplementing Missing Visions via Dialog for Scene Graph Generations
di: Zhao, Zhenghao, et al.
Pubblicazione: (2022)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2022)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
di: Zheng, Duo, et al.
Pubblicazione: (2024)
di: Zheng, Duo, et al.
Pubblicazione: (2024)
Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
di: Li, Jingru, et al.
Pubblicazione: (2026)
di: Li, Jingru, et al.
Pubblicazione: (2026)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction
di: Kang, Weitai, et al.
Pubblicazione: (2025)
di: Kang, Weitai, et al.
Pubblicazione: (2025)
Error-Driven Scene Editing for 3D Grounding in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2025)
di: Zhang, Yue, et al.
Pubblicazione: (2025)
Dataset Quantization with Active Learning based Adaptive Sampling
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
di: Zhao, Zhenghao, et al.
Pubblicazione: (2024)
Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models
di: Liu, Dingning, et al.
Pubblicazione: (2024)
di: Liu, Dingning, et al.
Pubblicazione: (2024)
Otter: A Multi-Modal Model with In-Context Instruction Tuning
di: Li, Bo, et al.
Pubblicazione: (2023)
di: Li, Bo, et al.
Pubblicazione: (2023)
Measuring and Improving Persuasiveness of Large Language Models
di: Singh, Somesh, et al.
Pubblicazione: (2024)
di: Singh, Somesh, et al.
Pubblicazione: (2024)
Instruction-Free Tuning of Large Vision Language Models for Medical Instruction Following
di: Kang, Myeongkyun, et al.
Pubblicazione: (2026)
di: Kang, Myeongkyun, et al.
Pubblicazione: (2026)
freePruner: A Training-free Approach for Large Multimodal Model Acceleration
di: Xu, Bingxin, et al.
Pubblicazione: (2024)
di: Xu, Bingxin, et al.
Pubblicazione: (2024)
Language-Image Models with 3D Understanding
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
di: Cho, Jang Hyun, et al.
Pubblicazione: (2024)
Efficient Multitask Dense Predictor via Binarization
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
SegVG: Transferring Object Bounding Box to Segmentation for Visual Grounding
di: Kang, Weitai, et al.
Pubblicazione: (2024) -
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
di: Li, Kunyang, et al.
Pubblicazione: (2026) -
ExpVG: Investigating the Design Space of Visual Grounding in Multimodal Large Language Model
di: Kang, Weitai, et al.
Pubblicazione: (2025) -
PTQ4DiT: Post-training Quantization for Diffusion Transformers
di: Wu, Junyi, et al.
Pubblicazione: (2024)