Synthesize, Diagnose, and Optimize: Towards Fine-Grained Vision-Language Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Peng, Wujian, Xie, Sicheng, You, Zuyao, Lan, Shiyi, Wu, Zuxuan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
por: Liu, Zhuohan, et al.
Publicado: (2026)
por: Liu, Zhuohan, et al.
Publicado: (2026)
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026)
por: Shi, Jiapeng, et al.
Publicado: (2026)
Learning Accurate Segmentation Purely from Self-Supervision
por: You, Zuyao, et al.
Publicado: (2026)
por: You, Zuyao, et al.
Publicado: (2026)
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)
por: Chen, Yitong, et al.
Publicado: (2025)
FOCUS: Towards Universal Foreground Segmentation
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
BEVNeXt: Reviving Dense BEV Frameworks for 3D Object Detection
por: Li, Zhenxin, et al.
Publicado: (2023)
por: Li, Zhenxin, et al.
Publicado: (2023)
INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
por: Peng, Wujian, et al.
Publicado: (2024)
por: Peng, Wujian, et al.
Publicado: (2024)
Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning
por: You, Zuyao, et al.
Publicado: (2025)
por: You, Zuyao, et al.
Publicado: (2025)
Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection
por: Fan, Yuanting, et al.
Publicado: (2025)
por: Fan, Yuanting, et al.
Publicado: (2025)
HandVQA: Diagnosing and Improving Fine-Grained Spatial Reasoning about Hands in Vision-Language Models
por: Sayem, MD Khalequzzaman Chowdhury, et al.
Publicado: (2026)
por: Sayem, MD Khalequzzaman Chowdhury, et al.
Publicado: (2026)
GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives
por: Chen, Zuyao, et al.
Publicado: (2023)
por: Chen, Zuyao, et al.
Publicado: (2023)
MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding
por: Cao, Yue, et al.
Publicado: (2024)
por: Cao, Yue, et al.
Publicado: (2024)
SEGIC: Unleashing the Emergent Correspondence for In-Context Segmentation
por: Meng, Lingchen, et al.
Publicado: (2023)
por: Meng, Lingchen, et al.
Publicado: (2023)
Hydra-NeXt: Robust Closed-Loop Driving with Open-Loop Training
por: Li, Zhenxin, et al.
Publicado: (2025)
por: Li, Zhenxin, et al.
Publicado: (2025)
UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models
por: Pan, Hewen, et al.
Publicado: (2025)
por: Pan, Hewen, et al.
Publicado: (2025)
Generating Vision-Language Navigation Instructions Incorporated Fine-Grained Alignment Annotations
por: Cui, Yibo, et al.
Publicado: (2025)
por: Cui, Yibo, et al.
Publicado: (2025)
DriveSuprim: Towards Precise Trajectory Selection for End-to-End Planning
por: Yao, Wenhao, et al.
Publicado: (2025)
por: Yao, Wenhao, et al.
Publicado: (2025)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models
por: Maack, Lennart, et al.
Publicado: (2026)
por: Maack, Lennart, et al.
Publicado: (2026)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
por: Guo, Zhenhao, et al.
Publicado: (2025)
por: Guo, Zhenhao, et al.
Publicado: (2025)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
por: Jiang, Jiachen, et al.
Publicado: (2025)
por: Jiang, Jiachen, et al.
Publicado: (2025)
Hydra-MDP++: Advancing End-to-End Driving via Expert-Guided Hydra-Distillation
por: Li, Kailin, et al.
Publicado: (2025)
por: Li, Kailin, et al.
Publicado: (2025)
MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding
por: Zhu, Fengbin, et al.
Publicado: (2024)
por: Zhu, Fengbin, et al.
Publicado: (2024)
On Learning Discriminative Features from Synthesized Data for Self-Supervised Fine-Grained Visual Recognition
por: Wang, Zihu, et al.
Publicado: (2024)
por: Wang, Zihu, et al.
Publicado: (2024)
Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
por: Hai, Jia-Wei, et al.
Publicado: (2026)
por: Hai, Jia-Wei, et al.
Publicado: (2026)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
por: Yu, Hong-Tao, et al.
Publicado: (2025)
por: Yu, Hong-Tao, et al.
Publicado: (2025)
HAD: Combining Hierarchical Diffusion with Metric-Decoupled RL for End-to-End Driving
por: Yao, Wenhao, et al.
Publicado: (2026)
por: Yao, Wenhao, et al.
Publicado: (2026)
SketchVL: Policy Optimization via Fine-Grained Credit Assignment for Chart Understanding and More
por: Huang, Muye, et al.
Publicado: (2026)
por: Huang, Muye, et al.
Publicado: (2026)
Preference Score Distillation: Leveraging 2D Rewards to Align Text-to-3D Generation with Human Preference
por: Leng, Jiaqi, et al.
Publicado: (2026)
por: Leng, Jiaqi, et al.
Publicado: (2026)
Efficient Prompt Tuning of Large Vision-Language Model for Fine-Grained Ship Classification
por: Lan, Long, et al.
Publicado: (2024)
por: Lan, Long, et al.
Publicado: (2024)
Detail Reinforcement Diffusion Model: Augmentation Fine-Grained Visual Categorization in Few-Shot Conditions
por: Wu, Tianxu, et al.
Publicado: (2023)
por: Wu, Tianxu, et al.
Publicado: (2023)
Repeating Words for Video-Language Retrieval with Coarse-to-Fine Objectives
por: Zhao, Haoyu, et al.
Publicado: (2025)
por: Zhao, Haoyu, et al.
Publicado: (2025)
Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization
por: Song, Yuhang, et al.
Publicado: (2024)
por: Song, Yuhang, et al.
Publicado: (2024)
Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation
por: Liu, Yaohua, et al.
Publicado: (2025)
por: Liu, Yaohua, et al.
Publicado: (2025)
Diagnosing Bottlenecks in Data Visualization Understanding by Vision-Language Models
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
por: Tartaglini, Alexa R., et al.
Publicado: (2025)
Enhancing Fine-Grained Vision-Language Pretraining with Negative Augmented Samples
por: Wang, Yeyuan, et al.
Publicado: (2024)
por: Wang, Yeyuan, et al.
Publicado: (2024)
Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models
por: Ghosh, Dhruba, et al.
Publicado: (2026)
por: Ghosh, Dhruba, et al.
Publicado: (2026)
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2024)
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2024)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
por: Zeng, Quan-Sheng, et al.
Publicado: (2025)
por: Zeng, Quan-Sheng, et al.
Publicado: (2025)
Ejemplares similares
-
Seg-R1: Segmentation Can Be Surprisingly Simple with Reinforcement Learning
por: You, Zuyao, et al.
Publicado: (2025) -
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
por: Liu, Zhuohan, et al.
Publicado: (2026) -
VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding
por: Shi, Jiapeng, et al.
Publicado: (2026) -
Learning Accurate Segmentation Purely from Self-Supervision
por: You, Zuyao, et al.
Publicado: (2026) -
CoMP: Continual Multimodal Pre-training for Vision Foundation Models
por: Chen, Yitong, et al.
Publicado: (2025)