Guardado en:
| Autores principales: | Wu, Xiangyu, Chi, Zhouyang, Yang, Yang, Lu, Jianfeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2407.04255 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Solution for OOD-CV UNICORN Challenge 2024 Object Detection Assistance LLM Counting Ability Improvement
por: Chi, Zhouyang, et al.
Publicado: (2024)
por: Chi, Zhouyang, et al.
Publicado: (2024)
The Solution for the CVPR2023 NICE Image Captioning Challenge
por: Wu, Xiangyu, et al.
Publicado: (2023)
por: Wu, Xiangyu, et al.
Publicado: (2023)
The Solution for Temporal Sound Localisation Task of ICCV 1st Perception Test Challenge 2023
por: Huang, Yurui, et al.
Publicado: (2024)
por: Huang, Yurui, et al.
Publicado: (2024)
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
por: Wu, Xiangyu, et al.
Publicado: (2025)
por: Wu, Xiangyu, et al.
Publicado: (2025)
Multimodal Classification via Total Correlation Maximization
por: Yu, Feng, et al.
Publicado: (2026)
por: Yu, Feng, et al.
Publicado: (2026)
The Solution for the ICCV 2023 1st Scientific Figure Captioning Challenge
por: Chao, Dian, et al.
Publicado: (2024)
por: Chao, Dian, et al.
Publicado: (2024)
Multimodal Rationales for Explainable Visual Question Answering
por: Li, Kun, et al.
Publicado: (2024)
por: Li, Kun, et al.
Publicado: (2024)
1st Place Solution to the 1st SkatingVerse Challenge
por: Sun, Tao, et al.
Publicado: (2024)
por: Sun, Tao, et al.
Publicado: (2024)
Multimodal Classification via Modal-Aware Interactive Enhancement
por: Jiang, Qing-Yuan, et al.
Publicado: (2024)
por: Jiang, Qing-Yuan, et al.
Publicado: (2024)
BERT-VQA: Visual Question Answering on Plots
por: Vu, Tai, et al.
Publicado: (2025)
por: Vu, Tai, et al.
Publicado: (2025)
The Solution for the GAIIC2024 RGB-TIR object detection Challenge
por: Wu, Xiangyu, et al.
Publicado: (2024)
por: Wu, Xiangyu, et al.
Publicado: (2024)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
por: Huang, Muye, et al.
Publicado: (2024)
por: Huang, Muye, et al.
Publicado: (2024)
First Place Solution to the Multiple-choice Video QA Track of The Second Perception Test Challenge
por: Peng, Yingzhe, et al.
Publicado: (2024)
por: Peng, Yingzhe, et al.
Publicado: (2024)
Unifying Image Processing as Visual Prompting Question Answering
por: Liu, Yihao, et al.
Publicado: (2023)
por: Liu, Yihao, et al.
Publicado: (2023)
Selectively Answering Visual Questions
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
por: Eisenschlos, Julian Martin, et al.
Publicado: (2024)
MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering
por: Fan, Xinqi, et al.
Publicado: (2026)
por: Fan, Xinqi, et al.
Publicado: (2026)
Reconstruction as a Bridge for Event-Based Visual Question Answering
por: Lou, Hanyue, et al.
Publicado: (2025)
por: Lou, Hanyue, et al.
Publicado: (2025)
Multi-Label Test-Time Adaptation with Bound Entropy Minimization
por: Wu, Xiangyu, et al.
Publicado: (2025)
por: Wu, Xiangyu, et al.
Publicado: (2025)
Questioning the Stability of Visual Question Answering
por: Rosenfeld, Amir, et al.
Publicado: (2025)
por: Rosenfeld, Amir, et al.
Publicado: (2025)
First Place Solution to the MLCAS 2025 GWFSS Challenge: The Devil is in the Detail and Minority
por: Cao, Songliang, et al.
Publicado: (2025)
por: Cao, Songliang, et al.
Publicado: (2025)
Hallucination Benchmark in Medical Visual Question Answering
por: Wu, Jinge, et al.
Publicado: (2024)
por: Wu, Jinge, et al.
Publicado: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
MedThink: Explaining Medical Visual Question Answering via Multimodal Decision-Making Rationale
por: Gai, Xiaotang, et al.
Publicado: (2024)
por: Gai, Xiaotang, et al.
Publicado: (2024)
ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering
por: Wu, Zhaodong, et al.
Publicado: (2026)
por: Wu, Zhaodong, et al.
Publicado: (2026)
Targeted Visual Prompting for Medical Visual Question Answering
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
por: Tascon-Morales, Sergio, et al.
Publicado: (2024)
Visual Robustness Benchmark for Visual Question Answering (VQA)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
por: Ishmam, Md Farhan, et al.
Publicado: (2024)
Visually Interpretable Subtask Reasoning for Visual Question Answering
por: Cheng, Yu, et al.
Publicado: (2025)
por: Cheng, Yu, et al.
Publicado: (2025)
Question-Aware Gaussian Experts for Audio-Visual Question Answering
por: Kim, Hongyeob, et al.
Publicado: (2025)
por: Kim, Hongyeob, et al.
Publicado: (2025)
FVOS for MOSE Track of 4th PVUW Challenge: 3rd Place Solution
por: Wang, Mengjiao, et al.
Publicado: (2025)
por: Wang, Mengjiao, et al.
Publicado: (2025)
MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
3rd Place Solution for PVUW Challenge 2024: Video Panoptic Segmentation
por: Wu, Ruipu, et al.
Publicado: (2024)
por: Wu, Ruipu, et al.
Publicado: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
por: Lee, Jusung, et al.
Publicado: (2024)
por: Lee, Jusung, et al.
Publicado: (2024)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
por: Yang, Cheng-Yen, et al.
Publicado: (2025)
DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
por: Al-Mohannadi, Aisha, et al.
Publicado: (2026)
VoQA: Visual-only Question Answering
por: An, Jianing, et al.
Publicado: (2025)
por: An, Jianing, et al.
Publicado: (2025)
Evaluating Variance in Visual Question Answering Benchmarks
por: SR, Nikitha
Publicado: (2025)
por: SR, Nikitha
Publicado: (2025)
Fully Authentic Visual Question Answering Dataset from Online Communities
por: Chen, Chongyan, et al.
Publicado: (2023)
por: Chen, Chongyan, et al.
Publicado: (2023)
Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering
por: Li, Kun, et al.
Publicado: (2026)
por: Li, Kun, et al.
Publicado: (2026)
3rd Place Solution for VisDA 2021 Challenge -- Universally Domain Adaptive Image Recognition
por: Liao, Haojin, et al.
Publicado: (2021)
por: Liao, Haojin, et al.
Publicado: (2021)
Saliency Guided Longitudinal Medical Visual Question Answering
por: Wu, Jialin, et al.
Publicado: (2025)
por: Wu, Jialin, et al.
Publicado: (2025)
Ejemplares similares
-
Solution for OOD-CV UNICORN Challenge 2024 Object Detection Assistance LLM Counting Ability Improvement
por: Chi, Zhouyang, et al.
Publicado: (2024) -
The Solution for the CVPR2023 NICE Image Captioning Challenge
por: Wu, Xiangyu, et al.
Publicado: (2023) -
The Solution for Temporal Sound Localisation Task of ICCV 1st Perception Test Challenge 2023
por: Huang, Yurui, et al.
Publicado: (2024) -
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
por: Wu, Xiangyu, et al.
Publicado: (2025) -
Multimodal Classification via Total Correlation Maximization
por: Yu, Feng, et al.
Publicado: (2026)