VLM-Assisted Continual learning for Visual Question Answering in Self-Driving
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Yuxin, Qi, Mengshi, Liu, Liang, Ma, Huadong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Improving Batch Normalization with TTA for Robust Object Detection in Self-Driving
di: Liao, Dacheng, et al.
Pubblicazione: (2024)
di: Liao, Dacheng, et al.
Pubblicazione: (2024)
Question-Aware Evidence Ledgers for Video Relational Reasoning
di: Ou, Yilin, et al.
Pubblicazione: (2026)
di: Ou, Yilin, et al.
Pubblicazione: (2026)
Learning Group Interactions and Semantic Intentions for Multi-Object Trajectory Prediction
di: Qi, Mengshi, et al.
Pubblicazione: (2024)
di: Qi, Mengshi, et al.
Pubblicazione: (2024)
T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous Driving
di: Lv, Changsheng, et al.
Pubblicazione: (2024)
di: Lv, Changsheng, et al.
Pubblicazione: (2024)
Multi-Stage Contrastive Regression for Action Quality Assessment
di: An, Qi, et al.
Pubblicazione: (2024)
di: An, Qi, et al.
Pubblicazione: (2024)
Towards Efficient Object Re-Identification with A Novel Cloud-Edge Collaborative Framework
di: Wang, Chuanming, et al.
Pubblicazione: (2024)
di: Wang, Chuanming, et al.
Pubblicazione: (2024)
Uncovering the human motion pattern: Pattern Memory-based Diffusion Model for Trajectory Prediction
di: Yang, Yuxin, et al.
Pubblicazione: (2024)
di: Yang, Yuxin, et al.
Pubblicazione: (2024)
Towards Robust Unsupervised Attention Prediction in Autonomous Driving
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Robust Disentangled Counterfactual Learning for Physical Audiovisual Commonsense Reasoning
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Decomposed Vector-Quantized Variational Autoencoder for Human Grasp Generation
di: Zhao, Zhe, et al.
Pubblicazione: (2024)
di: Zhao, Zhe, et al.
Pubblicazione: (2024)
Global-Local Tree Search in VLMs for 3D Indoor Scene Generation
di: Deng, Wei, et al.
Pubblicazione: (2025)
di: Deng, Wei, et al.
Pubblicazione: (2025)
Explainable Action Form Assessment by Exploiting Multimodal Chain-of-Thoughts Reasoning
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
A New Teacher-Reviewer-Student Framework for Semi-supervised 2D Human Pose Estimation
di: Yun, Wulian, et al.
Pubblicazione: (2025)
di: Yun, Wulian, et al.
Pubblicazione: (2025)
Semi-Supervised Teacher-Reference-Student Architecture for Action Quality Assessment
di: Yun, Wulian, et al.
Pubblicazione: (2024)
di: Yun, Wulian, et al.
Pubblicazione: (2024)
One VLM to Keep it Learning: Generation and Balancing for Data-free Continual Visual Question Answering
di: Das, Deepayan, et al.
Pubblicazione: (2024)
di: Das, Deepayan, et al.
Pubblicazione: (2024)
DriveLM: Driving with Graph Visual Question Answering
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
di: Sima, Chonghao, et al.
Pubblicazione: (2023)
Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Action Quality Assessment via Hierarchical Pose-guided Multi-stage Contrastive Regression
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
Mutual Distillation Learning For Person Re-Identification
di: Fu, Huiyuan, et al.
Pubblicazione: (2024)
di: Fu, Huiyuan, et al.
Pubblicazione: (2024)
DriveXQA: Cross-modal Visual Question Answering for Adverse Driving Scene Understanding
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
di: Tao, Mingzhe, et al.
Pubblicazione: (2026)
Improving Partially Observed Trajectories Forecasting by Target-driven Self-Distillation
di: Shu, Peng, et al.
Pubblicazione: (2025)
di: Shu, Peng, et al.
Pubblicazione: (2025)
Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition
di: Wang, Chuanming, et al.
Pubblicazione: (2025)
di: Wang, Chuanming, et al.
Pubblicazione: (2025)
TinyDrive: Multiscale Visual Question Answering with Selective Token Routing for Autonomous Driving
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
di: Hassani, Hossein, et al.
Pubblicazione: (2025)
Self-Bootstrapped Visual-Language Model for Knowledge Selection and Question Answering
di: Hao, Dongze, et al.
Pubblicazione: (2024)
di: Hao, Dongze, et al.
Pubblicazione: (2024)
LaPA: Latent Prompt Assist Model For Medical Visual Question Answering
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
di: Gu, Tiancheng, et al.
Pubblicazione: (2024)
VIoTGPT: Learning to Schedule Vision Tools in LLMs towards Intelligent Video Internet of Things
di: Zhong, Yaoyao, et al.
Pubblicazione: (2023)
di: Zhong, Yaoyao, et al.
Pubblicazione: (2023)
DC-SAM: In-Context Segment Anything in Images and Videos via Dual Consistency
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
di: Qi, Mengshi, et al.
Pubblicazione: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
di: Tang, Jingqun, et al.
Pubblicazione: (2024)
LingoQA: Visual Question Answering for Autonomous Driving
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
di: Marcu, Ana-Maria, et al.
Pubblicazione: (2023)
STRIDE-QA: Visual Question Answering Dataset for Spatiotemporal Reasoning in Urban Driving Scenes
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
di: Ishihara, Keishi, et al.
Pubblicazione: (2025)
Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression
di: Cai, Yuliang, et al.
Pubblicazione: (2026)
di: Cai, Yuliang, et al.
Pubblicazione: (2026)
Object Retrieval for Visual Question Answering with Outside Knowledge
di: Kan, Shichao, et al.
Pubblicazione: (2024)
di: Kan, Shichao, et al.
Pubblicazione: (2024)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
di: Zhang, Xiaoman, et al.
Pubblicazione: (2023)
Selectively Answering Visual Questions
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
di: Eisenschlos, Julian Martin, et al.
Pubblicazione: (2024)
AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
di: Zhang, Peifeng, et al.
Pubblicazione: (2026)
VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
di: Chen, Jiayi, et al.
Pubblicazione: (2026)
Visually Interpretable Subtask Reasoning for Visual Question Answering
di: Cheng, Yu, et al.
Pubblicazione: (2025)
di: Cheng, Yu, et al.
Pubblicazione: (2025)
Targeted Visual Prompting for Medical Visual Question Answering
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
di: Tascon-Morales, Sergio, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Improving Batch Normalization with TTA for Robust Object Detection in Self-Driving
di: Liao, Dacheng, et al.
Pubblicazione: (2024) -
Question-Aware Evidence Ledgers for Video Relational Reasoning
di: Ou, Yilin, et al.
Pubblicazione: (2026) -
Learning Group Interactions and Semantic Intentions for Multi-Object Trajectory Prediction
di: Qi, Mengshi, et al.
Pubblicazione: (2024) -
T2SG: Traffic Topology Scene Graph for Topology Reasoning in Autonomous Driving
di: Lv, Changsheng, et al.
Pubblicazione: (2024) -
Multi-Stage Contrastive Regression for Action Quality Assessment
di: An, Qi, et al.
Pubblicazione: (2024)