VQA-Diff: Exploiting VQA and Diffusion for Zero-Shot Image-to-3D Vehicle Asset Generation in Autonomous Driving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yibo, Yang, Zheyuan, Wu, Guile, Ren, Yuan, Lin, Kejian, Liu, Bingbing, Liu, Yang, Shan, Jinjun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Effective NeRFs and SDFs Representations with 3D Generative Adversarial Networks for 3D Object Generation
par: Yang, Zheyuan, et autres
Publié: (2023)
par: Yang, Zheyuan, et autres
Publié: (2023)
HIPPo: Harnessing Image-to-3D Priors for Model-free Zero-shot 6D Pose Estimation
par: Liu, Yibo, et autres
Publié: (2025)
par: Liu, Yibo, et autres
Publié: (2025)
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
par: Ren, Yuan, et autres
Publié: (2024)
par: Ren, Yuan, et autres
Publié: (2024)
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
par: Wu, Guile, et autres
Publié: (2025)
par: Wu, Guile, et autres
Publié: (2025)
ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
par: Yin, Shaofeng, et autres
Publié: (2025)
par: Yin, Shaofeng, et autres
Publié: (2025)
Learn 3D VQA Better with Active Selection and Reannotation
par: Zhou, Shengli, et autres
Publié: (2025)
par: Zhou, Shengli, et autres
Publié: (2025)
DiffVQA: Video Quality Assessment Using Diffusion Feature Extractor
par: Chen, Wei-Ting, et autres
Publié: (2025)
par: Chen, Wei-Ting, et autres
Publié: (2025)
Nighttime Autonomous Driving Scene Reconstruction with Physically-Based Gaussian Splatting
par: Kim, Tae-Kyeong, et autres
Publié: (2026)
par: Kim, Tae-Kyeong, et autres
Publié: (2026)
Box-QAymo: Box-Referring VQA Dataset for Autonomous Driving
par: Etchegaray, Djamahl, et autres
Publié: (2025)
par: Etchegaray, Djamahl, et autres
Publié: (2025)
L-PR: Exploiting LiDAR Fiducial Marker for Unordered Low Overlap Multiview Point Cloud Registration
par: Liu, Yibo, et autres
Publié: (2024)
par: Liu, Yibo, et autres
Publié: (2024)
ArmGS: Composite Gaussian Appearance Refinement for Modeling Dynamic Urban Environments
par: Wu, Guile, et autres
Publié: (2025)
par: Wu, Guile, et autres
Publié: (2025)
HAC: Parameter-Efficient Hyperbolic Adaptation of CLIP for Zero-Shot VQA
par: Dibitonto, Francesco, et autres
Publié: (2026)
par: Dibitonto, Francesco, et autres
Publié: (2026)
FilterRAG: Zero-Shot Informed Retrieval-Augmented Generation to Mitigate Hallucinations in VQA
par: Sarwar, Nobin
Publié: (2025)
par: Sarwar, Nobin
Publié: (2025)
Fiducial Tag Localization on a 3D LiDAR Prior Map
par: Liu, Yibo, et autres
Publié: (2022)
par: Liu, Yibo, et autres
Publié: (2022)
Knowledge Generation for Zero-shot Knowledge-based VQA
par: Cao, Rui, et autres
Publié: (2024)
par: Cao, Rui, et autres
Publié: (2024)
WSI-VQA: Interpreting Whole Slide Images by Generative Visual Question Answering
par: Chen, Pingyi, et autres
Publié: (2024)
par: Chen, Pingyi, et autres
Publié: (2024)
Bridging the Gap between 2D and 3D Visual Question Answering: A Fusion Approach for 3D VQA
par: Mo, Wentao, et autres
Publié: (2024)
par: Mo, Wentao, et autres
Publié: (2024)
DiffIR2VR-Zero: Zero-Shot Video Restoration with Diffusion-based Image Restoration Models
par: Yeh, Chang-Han, et autres
Publié: (2024)
par: Yeh, Chang-Han, et autres
Publié: (2024)
UnPose: Uncertainty-Guided Diffusion Priors for Zero-Shot Pose Estimation
par: Jiang, Zhaodong, et autres
Publié: (2025)
par: Jiang, Zhaodong, et autres
Publié: (2025)
Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification
par: Cao, Zongwan, et autres
Publié: (2026)
par: Cao, Zongwan, et autres
Publié: (2026)
Filling the Image Information Gap for VQA: Prompting Large Language Models to Proactively Ask Questions
par: Wang, Ziyue, et autres
Publié: (2023)
par: Wang, Ziyue, et autres
Publié: (2023)
RefAny3D: 3D Asset-Referenced Diffusion Models for Image Generation
par: Huang, Hanzhuo, et autres
Publié: (2026)
par: Huang, Hanzhuo, et autres
Publié: (2026)
Few-Shot VQA with Frozen LLMs: A Tale of Two Approaches
par: Sterner, Igor, et autres
Publié: (2024)
par: Sterner, Igor, et autres
Publié: (2024)
Part-Level 3D Gaussian Vehicle Generation with Joint and Hinge Axis Estimation
par: Qian, Shiyao, et autres
Publié: (2026)
par: Qian, Shiyao, et autres
Publié: (2026)
VQA-Levels: A Hierarchical Approach for Classifying Questions in VQA
par: Madaka, Madhuri Latha, et autres
Publié: (2025)
par: Madaka, Madhuri Latha, et autres
Publié: (2025)
RGC-VQA: An Exploration Database for Robotic-Generated Video Quality Assessment
par: Jin, Jianing, et autres
Publié: (2025)
par: Jin, Jianing, et autres
Publié: (2025)
Language and Geometry Grounded Sparse Voxel Representations for Holistic Scene Understanding
par: Wu, Guile, et autres
Publié: (2026)
par: Wu, Guile, et autres
Publié: (2026)
Modularized Zero-shot VQA with Pre-trained Models
par: Cao, Rui, et autres
Publié: (2023)
par: Cao, Rui, et autres
Publié: (2023)
Knowledge Condensation and Reasoning for Knowledge-based VQA
par: Hao, Dongze, et autres
Publié: (2024)
par: Hao, Dongze, et autres
Publié: (2024)
BERT-VQA: Visual Question Answering on Plots
par: Vu, Tai, et autres
Publié: (2025)
par: Vu, Tai, et autres
Publié: (2025)
SURE-VQA: Systematic Understanding of Robustness Evaluation in Medical VQA Tasks
par: Kahl, Kim-Celine, et autres
Publié: (2024)
par: Kahl, Kim-Celine, et autres
Publié: (2024)
ZeShot-VQA: Zero-Shot Visual Question Answering Framework with Answer Mapping for Natural Disaster Damage Assessment
par: Karimi, Ehsan, et autres
Publié: (2025)
par: Karimi, Ehsan, et autres
Publié: (2025)
DiffStega: Towards Universal Training-Free Coverless Image Steganography with Diffusion Models
par: Yang, Yiwei, et autres
Publié: (2024)
par: Yang, Yiwei, et autres
Publié: (2024)
An Evaluation of GPT-4V and Gemini in Online VQA
par: Liu, Mengchen, et autres
Publié: (2023)
par: Liu, Mengchen, et autres
Publié: (2023)
Multi-Agent VQA: Exploring Multi-Agent Foundation Models in Zero-Shot Visual Question Answering
par: Jiang, Bowen, et autres
Publié: (2024)
par: Jiang, Bowen, et autres
Publié: (2024)
Med-GRIM: Enhanced Zero-Shot Medical VQA using prompt-embedded Multimodal Graph RAG
par: Madavan, Rakesh Raj, et autres
Publié: (2025)
par: Madavan, Rakesh Raj, et autres
Publié: (2025)
DiN: Diffusion Model for Robust Medical VQA with Semantic Noisy Labels
par: Guo, Erjian, et autres
Publié: (2025)
par: Guo, Erjian, et autres
Publié: (2025)
MISS: A Generative Pretraining and Finetuning Approach for Med-VQA
par: Chen, Jiawei, et autres
Publié: (2024)
par: Chen, Jiawei, et autres
Publié: (2024)
DualDiff: Dual-branch Diffusion Model for Autonomous Driving with Semantic Fusion
par: Li, Haoteng, et autres
Publié: (2025)
par: Li, Haoteng, et autres
Publié: (2025)
Diffusion-Based Generative Models for 3D Occupancy Prediction in Autonomous Driving
par: Wang, Yunshen, et autres
Publié: (2025)
par: Wang, Yunshen, et autres
Publié: (2025)
Documents similaires
-
Learning Effective NeRFs and SDFs Representations with 3D Generative Adversarial Networks for 3D Object Generation
par: Yang, Zheyuan, et autres
Publié: (2023) -
HIPPo: Harnessing Image-to-3D Priors for Model-free Zero-shot 6D Pose Estimation
par: Liu, Yibo, et autres
Publié: (2025) -
UniGaussian: Driving Scene Reconstruction from Multiple Camera Models via Unified Gaussian Representations
par: Ren, Yuan, et autres
Publié: (2024) -
MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer
par: Wu, Guile, et autres
Publié: (2025) -
ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools
par: Yin, Shaofeng, et autres
Publié: (2025)