UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Zhecan, Sun, Rui, You, Haoxuan, Codella, Noel, Chang, Kai-Wei, Chang, Shih-Fu |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
by: You, Haoxuan, et al.
Published: (2023)
by: You, Haoxuan, et al.
Published: (2023)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
by: Faure, Gueter Josmy, et al.
Published: (2026)
by: Faure, Gueter Josmy, et al.
Published: (2026)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
by: Liu, Junzhang, et al.
Published: (2024)
by: Liu, Junzhang, et al.
Published: (2024)
Understanding Zero-shot Rare Word Recognition Improvements Through LLM Integration
by: Wang, Haoxuan
Published: (2025)
by: Wang, Haoxuan
Published: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
by: Wang, Zhecan, et al.
Published: (2024)
by: Wang, Zhecan, et al.
Published: (2024)
Large Margin Prototypical Network for Few-shot Relation Classification with Fine-grained Features
by: Fan, Miao, et al.
Published: (2024)
by: Fan, Miao, et al.
Published: (2024)
KPEval: Towards Fine-Grained Semantic-Based Keyphrase Evaluation
by: Wu, Di, et al.
Published: (2023)
by: Wu, Di, et al.
Published: (2023)
Distilling Fine-grained Sentiment Understanding from Large Language Models
by: Zhang, Yice, et al.
Published: (2024)
by: Zhang, Yice, et al.
Published: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
by: Sun, Qi, et al.
Published: (2024)
by: Sun, Qi, et al.
Published: (2024)
Understanding Fine-grained Distortions in Reports of Scientific Findings
by: Wührl, Amelie, et al.
Published: (2024)
by: Wührl, Amelie, et al.
Published: (2024)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
by: Lu, Yu-Chen, et al.
Published: (2025)
by: Lu, Yu-Chen, et al.
Published: (2025)
Rephrase and Contrast: Fine-Tuning Language Models for Enhanced Understanding of Communication and Computer Networks
by: Wang, Liujianfu, et al.
Published: (2024)
by: Wang, Liujianfu, et al.
Published: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
by: Jing, Liqiang, et al.
Published: (2024)
by: Jing, Liqiang, et al.
Published: (2024)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
by: Wan, Yixin, et al.
Published: (2025)
by: Wan, Yixin, et al.
Published: (2025)
Navigating the Nuances: A Fine-grained Evaluation of Vision-Language Navigation
by: Wang, Zehao, et al.
Published: (2024)
by: Wang, Zehao, et al.
Published: (2024)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
by: Wang, Xingqi, et al.
Published: (2025)
by: Wang, Xingqi, et al.
Published: (2025)
IFShip: Interpretable Fine-grained Ship Classification with Domain Knowledge-Enhanced Vision-Language Models
by: Guo, Mingning, et al.
Published: (2024)
by: Guo, Mingning, et al.
Published: (2024)
Fine-grained Hallucination Detection and Editing for Language Models
by: Mishra, Abhika, et al.
Published: (2024)
by: Mishra, Abhika, et al.
Published: (2024)
MM-MATH: Advancing Multimodal Math Evaluation with Process Evaluation and Fine-grained Classification
by: Sun, Kai, et al.
Published: (2024)
by: Sun, Kai, et al.
Published: (2024)
UniEDU: A Unified Language and Vision Assistant for Education Applications
by: Chu, Zhendong, et al.
Published: (2025)
by: Chu, Zhendong, et al.
Published: (2025)
Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
by: Lu, Junyu, et al.
Published: (2023)
by: Lu, Junyu, et al.
Published: (2023)
Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs
by: Gu, Yuzhe, et al.
Published: (2025)
by: Gu, Yuzhe, et al.
Published: (2025)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
by: Balauca, Ada-Astrid, et al.
Published: (2024)
by: Balauca, Ada-Astrid, et al.
Published: (2024)
Improving Fine-grained Visual Understanding in VLMs through Text-Only Training
by: Choi, Dasol, et al.
Published: (2024)
by: Choi, Dasol, et al.
Published: (2024)
Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
by: Jiang, Chaoya, et al.
Published: (2024)
by: Jiang, Chaoya, et al.
Published: (2024)
BlockPruner: Fine-grained Pruning for Large Language Models
by: Zhong, Longguang, et al.
Published: (2024)
by: Zhong, Longguang, et al.
Published: (2024)
SciPrompt: Knowledge-augmented Prompting for Fine-grained Categorization of Scientific Topics
by: You, Zhiwen, et al.
Published: (2024)
by: You, Zhiwen, et al.
Published: (2024)
Fine-Refine: Iterative Fine-grained Refinement for Mitigating Dialogue Hallucination
by: Chen, Xiangyan, et al.
Published: (2026)
by: Chen, Xiangyan, et al.
Published: (2026)
Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification
by: Meng, Tao, et al.
Published: (2024)
by: Meng, Tao, et al.
Published: (2024)
CroPrompt: Cross-task Interactive Prompting for Zero-shot Spoken Language Understanding
by: Qin, Libo, et al.
Published: (2024)
by: Qin, Libo, et al.
Published: (2024)
Systematic Analysis for Pretrained Language Model Priming for Parameter-Efficient Fine-tuning
by: Huang, Shih-Cheng, et al.
Published: (2022)
by: Huang, Shih-Cheng, et al.
Published: (2022)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
by: Lee, Yuho, et al.
Published: (2024)
by: Lee, Yuho, et al.
Published: (2024)
FineDialFact: A benchmark for Fine-grained Dialogue Fact Verification
by: Chen, Xiangyan, et al.
Published: (2025)
by: Chen, Xiangyan, et al.
Published: (2025)
Multimodal Fine-grained Context Interaction Graph Modeling for Conversational Speech Synthesis
by: Jia, Zhenqi, et al.
Published: (2025)
by: Jia, Zhenqi, et al.
Published: (2025)
Enhancing Fine-Grained Image Classifications via Cascaded Vision Language Models
by: Wei, Canshi
Published: (2024)
by: Wei, Canshi
Published: (2024)
Fine-grained Gender Control in Machine Translation with Large Language Models
by: Lee, Minwoo, et al.
Published: (2024)
by: Lee, Minwoo, et al.
Published: (2024)
UniEdit: A Unified Knowledge Editing Benchmark for Large Language Models
by: Chen, Qizhou, et al.
Published: (2025)
by: Chen, Qizhou, et al.
Published: (2025)
UniVIE: A Unified Label Space Approach to Visual Information Extraction from Form-like Documents
by: Hu, Kai, et al.
Published: (2024)
by: Hu, Kai, et al.
Published: (2024)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
by: Jiang, Houcheng, et al.
Published: (2026)
by: Jiang, Houcheng, et al.
Published: (2026)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
by: Cai, Mu, et al.
Published: (2024)
by: Cai, Mu, et al.
Published: (2024)
Similar Items
-
IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
by: You, Haoxuan, et al.
Published: (2023) -
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
by: Faure, Gueter Josmy, et al.
Published: (2026) -
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
by: Liu, Junzhang, et al.
Published: (2024) -
Understanding Zero-shot Rare Word Recognition Improvements Through LLM Integration
by: Wang, Haoxuan
Published: (2025) -
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
by: Wang, Zhecan, et al.
Published: (2024)