IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | You, Haoxuan, Wang, Zhecan, Sun, Rui, Chen, Long, Wang, Gengyu, Ayyubi, Hammad A., Chang, Kai-Wei, Chang, Shih-Fu |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023)
por: Wang, Zhecan, et al.
Publicado: (2023)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
por: Liu, Junzhang, et al.
Publicado: (2024)
por: Liu, Junzhang, et al.
Publicado: (2024)
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
por: Ayyubi, Hammad, et al.
Publicado: (2025)
por: Ayyubi, Hammad, et al.
Publicado: (2025)
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
por: Wang, Zhecan, et al.
Publicado: (2024)
por: Wang, Zhecan, et al.
Publicado: (2024)
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
por: Zare, Ali, et al.
Publicado: (2024)
por: Zare, Ali, et al.
Publicado: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
por: Deng, Yihe, et al.
Publicado: (2025)
por: Deng, Yihe, et al.
Publicado: (2025)
ENTER: Event Based Interpretable Reasoning for VideoQA
por: Ayyubi, Hammad, et al.
Publicado: (2025)
por: Ayyubi, Hammad, et al.
Publicado: (2025)
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding
por: Yoon, Hee Suk, et al.
Publicado: (2026)
por: Yoon, Hee Suk, et al.
Publicado: (2026)
Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models
por: Zhang, Haotian, et al.
Publicado: (2024)
por: Zhang, Haotian, et al.
Publicado: (2024)
On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training
por: Wu, Xueqing, et al.
Publicado: (2026)
por: Wu, Xueqing, et al.
Publicado: (2026)
NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models
por: Zhou, Gengze, et al.
Publicado: (2024)
por: Zhou, Gengze, et al.
Publicado: (2024)
VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models
por: Mei, Hefei, et al.
Publicado: (2025)
por: Mei, Hefei, et al.
Publicado: (2025)
Video Summarization: Towards Entity-Aware Captions
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
por: Ayyubi, Hammad A., et al.
Publicado: (2023)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
por: Deng, Yihe, et al.
Publicado: (2024)
por: Deng, Yihe, et al.
Publicado: (2024)
Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning
por: Kamath, Amita, et al.
Publicado: (2026)
por: Kamath, Amita, et al.
Publicado: (2026)
HyperGVL: Benchmarking and Improving Large Vision-Language Models in Hypergraph Understanding and Reasoning
por: Wei, Yanbin, et al.
Publicado: (2026)
por: Wei, Yanbin, et al.
Publicado: (2026)
Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling
por: Hou, Bairu, et al.
Publicado: (2023)
por: Hou, Bairu, et al.
Publicado: (2023)
DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models
por: Huang, You-Liang, et al.
Publicado: (2026)
por: Huang, You-Liang, et al.
Publicado: (2026)
Matryoshka Query Transformer for Large Vision-Language Models
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
SciGPT: A Large Language Model for Scientific Literature Understanding and Knowledge Discovery
por: She, Fengyu, et al.
Publicado: (2025)
por: She, Fengyu, et al.
Publicado: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
por: Yuan, Zhengqing, et al.
Publicado: (2023)
por: Yuan, Zhengqing, et al.
Publicado: (2023)
The Hard Positive Truth about Vision-Language Compositionality
por: Kamath, Amita, et al.
Publicado: (2024)
por: Kamath, Amita, et al.
Publicado: (2024)
D-Attn: Decomposed Attention for Large Vision-and-Language Models
por: Kuo, Chia-Wen, et al.
Publicado: (2025)
por: Kuo, Chia-Wen, et al.
Publicado: (2025)
Probing Large Language Models in Reasoning and Translating Complex Linguistic Puzzles
por: Lin, Zheng-Lin, et al.
Publicado: (2025)
por: Lin, Zheng-Lin, et al.
Publicado: (2025)
Control Large Language Models via Divide and Conquer
por: Li, Bingxuan, et al.
Publicado: (2024)
por: Li, Bingxuan, et al.
Publicado: (2024)
Unraveling Arithmetic in Large Language Models: The Role of Algebraic Structures
por: Chang, Fu-Chieh, et al.
Publicado: (2024)
por: Chang, Fu-Chieh, et al.
Publicado: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
por: Sun, Haoyuan, et al.
Publicado: (2025)
por: Sun, Haoyuan, et al.
Publicado: (2025)
HoneyBee: Data Recipes for Vision-Language Reasoners
por: Bansal, Hritik, et al.
Publicado: (2025)
por: Bansal, Hritik, et al.
Publicado: (2025)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
por: Wu, Da, et al.
Publicado: (2023)
por: Wu, Da, et al.
Publicado: (2023)
LLM-A*: Large Language Model Enhanced Incremental Heuristic Search on Path Planning
por: Meng, Silin, et al.
Publicado: (2024)
por: Meng, Silin, et al.
Publicado: (2024)
D2LLM: Decomposed and Distilled Large Language Models for Semantic Search
por: Liao, Zihan, et al.
Publicado: (2024)
por: Liao, Zihan, et al.
Publicado: (2024)
Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension
por: Yin, Fan, et al.
Publicado: (2024)
por: Yin, Fan, et al.
Publicado: (2024)
Urban Socio-Semantic Segmentation with Vision-Language Reasoning
por: Wang, Yu, et al.
Publicado: (2026)
por: Wang, Yu, et al.
Publicado: (2026)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
por: Zhang, Jipeng, et al.
Publicado: (2025)
por: Zhang, Jipeng, et al.
Publicado: (2025)
Enhancing Large Language Model with Decomposed Reasoning for Emotion Cause Pair Extraction
por: Wu, Jialiang, et al.
Publicado: (2024)
por: Wu, Jialiang, et al.
Publicado: (2024)
VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism
por: Zhang, Congzhi, et al.
Publicado: (2025)
por: Zhang, Congzhi, et al.
Publicado: (2025)
Enhancing Medical Large Vision-Language Models via Alignment Distillation
por: Chang, Aofei, et al.
Publicado: (2025)
por: Chang, Aofei, et al.
Publicado: (2025)
What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning
por: Weng, Zhaotian, et al.
Publicado: (2025)
por: Weng, Zhaotian, et al.
Publicado: (2025)
Functional Abstraction of Knowledge Recall in Large Language Models
por: Wang, Zijian, et al.
Publicado: (2025)
por: Wang, Zijian, et al.
Publicado: (2025)
Ejemplares similares
-
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
por: Wang, Zhecan, et al.
Publicado: (2023) -
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
por: Liu, Junzhang, et al.
Publicado: (2024) -
PuzzleGPT: Emulating Human Puzzle-Solving Ability for Time and Location Prediction
por: Ayyubi, Hammad, et al.
Publicado: (2025) -
JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
por: Wang, Zhecan, et al.
Publicado: (2024) -
RAP: Retrieval-Augmented Planner for Adaptive Procedure Planning in Instructional Videos
por: Zare, Ali, et al.
Publicado: (2024)