IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | You, Haoxuan, Wang, Zhecan, Sun, Rui, Chen, Long, Wang, Gengyu, Ayyubi, Hammad A., Chang, Kai-Wei, Chang, Shih-Fu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
di: Wang, Zhecan, et al.
Pubblicazione: (2023)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
di: Liu, Junzhang, et al.
Pubblicazione: (2024)
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
di: Wang, Zhecan, et al.
Pubblicazione: (2024)
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
di: Zare, Ali, et al.
Pubblicazione: (2024)
di: Zare, Ali, et al.
Pubblicazione: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
di: Deng, Yihe, et al.
Pubblicazione: (2025)
di: Deng, Yihe, et al.
Pubblicazione: (2025)
ENTER: Event Based Interpretable Reasoning for VideoQA
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025)
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
di: Yoon, Hee Suk, et al.
Pubblicazione: (2026)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
di: Wu, Xueqing, et al.
Pubblicazione: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
di: Zhou, Gengze, et al.
Pubblicazione: (2024)
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
di: Mei, Hefei, et al.
Pubblicazione: (2025)
di: Mei, Hefei, et al.
Pubblicazione: (2025)
Video Summarization: Towards Entity-Aware Captions
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
di: Ayyubi, Hammad A., et al.
Pubblicazione: (2023)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
di: Deng, Yihe, et al.
Pubblicazione: (2024)
di: Deng, Yihe, et al.
Pubblicazione: (2024)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
di: Kamath, Amita, et al.
Pubblicazione: (2026)
di: Kamath, Amita, et al.
Pubblicazione: (2026)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
di: Wei, Yanbin, et al.
Pubblicazione: (2026)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
di: Hou, Bairu, et al.
Pubblicazione: (2023)
di: Hou, Bairu, et al.
Pubblicazione: (2023)
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
di: Huang, You-Liang, et al.
Pubblicazione: (2026)
di: Huang, You-Liang, et al.
Pubblicazione: (2026)
Matryoshka Query Transformer for Large Vision-Language Models
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
di: Hu, Wenbo, et al.
Pubblicazione: (2024)
SciGPT: A Large Language Model for Scientific Literature Understanding and Knowledge Discovery
di: She, Fengyu, et al.
Pubblicazione: (2025)
di: She, Fengyu, et al.
Pubblicazione: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
The Hard Positive Truth about Vision-Language Compositionality
di: Kamath, Amita, et al.
Pubblicazione: (2024)
di: Kamath, Amita, et al.
Pubblicazione: (2024)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
di: Kuo, Chia-Wen, et al.
Pubblicazione: (2025)
di: Kuo, Chia-Wen, et al.
Pubblicazione: (2025)
Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
di: Lin, Zheng-Lin, et al.
Pubblicazione: (2025)
Control Large Language Models via Divide and Conquer
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
di: Li, Bingxuan, et al.
Pubblicazione: (2024)
Unraveling Arithmetic in Large Language Models: The Role of Algebraic Structures
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
di: Chang, Fu-Chieh, et al.
Pubblicazione: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
di: Sun, Haoyuan, et al.
Pubblicazione: (2025)
HoneyBee: Data Recipes for Vision-Language Reasoners
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
di: Bansal, Hritik, et al.
Pubblicazione: (2025)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
di: Wu, Da, et al.
Pubblicazione: (2023)
di: Wu, Da, et al.
Pubblicazione: (2023)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
di: Meng, Silin, et al.
Pubblicazione: (2024)
di: Meng, Silin, et al.
Pubblicazione: (2024)
D2LLM: Decomposed and Distilled Large Language Models for Semantic Search
di: Liao, Zihan, et al.
Pubblicazione: (2024)
di: Liao, Zihan, et al.
Pubblicazione: (2024)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
di: Yin, Fan, et al.
Pubblicazione: (2024)
di: Yin, Fan, et al.
Pubblicazione: (2024)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
di: Wang, Yu, et al.
Pubblicazione: (2026)
di: Wang, Yu, et al.
Pubblicazione: (2026)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
di: Zhang, Jipeng, et al.
Pubblicazione: (2025)
di: Zhang, Jipeng, et al.
Pubblicazione: (2025)
Enhancing Large Language Model with Decomposed Reasoning for Emotion Cause Pair Extraction
di: Wu, Jialiang, et al.
Pubblicazione: (2024)
di: Wu, Jialiang, et al.
Pubblicazione: (2024)
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
di: Zhang, Congzhi, et al.
Pubblicazione: (2025)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
di: Chang, Aofei, et al.
Pubblicazione: (2025)
di: Chang, Aofei, et al.
Pubblicazione: (2025)
What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning
di: Weng, Zhaotian, et al.
Pubblicazione: (2025)
di: Weng, Zhaotian, et al.
Pubblicazione: (2025)
Functional Abstraction of Knowledge Recall in Large Language Models
di: Wang, Zijian, et al.
Pubblicazione: (2025)
di: Wang, Zijian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
di: Wang, Zhecan, et al.
Pubblicazione: (2023) -
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
di: Liu, Junzhang, et al.
Pubblicazione: (2024) -
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
di: Ayyubi, Hammad, et al.
Pubblicazione: (2025) -
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
di: Wang, Zhecan, et al.
Pubblicazione: (2024) -
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
di: Zare, Ali, et al.
Pubblicazione: (2024)