CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xinyu, Dong, Yuxuan, Zhang, Lingling, Jia, Chengyou, Dang, Zhuohang, Fernando, Basura, Liu, Jun, Shou, Mike Zheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
Why Settle for One? Text-to-ImageSet Generation and Evaluation
por: Jia, Chengyou, et al.
Publicado: (2025)
por: Jia, Chengyou, et al.
Publicado: (2025)
PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
por: Ping, Bowen, et al.
Publicado: (2025)
por: Ping, Bowen, et al.
Publicado: (2025)
From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios
por: Xia, Changliang, et al.
Publicado: (2025)
por: Xia, Changliang, et al.
Publicado: (2025)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
por: Jia, Chengyou, et al.
Publicado: (2023)
por: Jia, Chengyou, et al.
Publicado: (2023)
$\mathrm{D}^\mathrm{3}$-Predictor: Noise-Free Deterministic Diffusion for Dense Prediction
por: Xia, Changliang, et al.
Publicado: (2025)
por: Xia, Changliang, et al.
Publicado: (2025)
ChatGen: Automatic Text-to-Image Generation From FreeStyle Chatting
por: Jia, Chengyou, et al.
Publicado: (2024)
por: Jia, Chengyou, et al.
Publicado: (2024)
Multi-Modal Dataset Distillation in the Wild
por: Dang, Zhuohang, et al.
Publicado: (2025)
por: Dang, Zhuohang, et al.
Publicado: (2025)
RCA: Region Conditioned Adaptation for Visual Abductive Reasoning
por: Zhang, Hao, et al.
Publicado: (2023)
por: Zhang, Hao, et al.
Publicado: (2023)
Disentangled Representation Learning with Transmitted Information Bottleneck
por: Dang, Zhuohang, et al.
Publicado: (2023)
por: Dang, Zhuohang, et al.
Publicado: (2023)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
por: Jia, Chengyou, et al.
Publicado: (2023)
por: Jia, Chengyou, et al.
Publicado: (2023)
Diagram-Driven Course Questions Generation
por: Zhang, Xinyu, et al.
Publicado: (2024)
por: Zhang, Xinyu, et al.
Publicado: (2024)
P-Flow: Prompting Visual Effects Generation
por: Zhao, Rui, et al.
Publicado: (2026)
por: Zhao, Rui, et al.
Publicado: (2026)
Interaction Region Visual Transformer for Egocentric Action Anticipation
por: Roy, Debaditya, et al.
Publicado: (2022)
por: Roy, Debaditya, et al.
Publicado: (2022)
ReFocus: Visual Editing as a Chain of Thought for Structured Image Understanding
por: Fu, Xingyu, et al.
Publicado: (2025)
por: Fu, Xingyu, et al.
Publicado: (2025)
ChainReaction: Causal Chain-Guided Reasoning for Modular and Explainable Causal-Why Video Question Answering
por: Parmar, Paritosh, et al.
Publicado: (2025)
por: Parmar, Paritosh, et al.
Publicado: (2025)
Learning to Visually Connect Actions and their Effects
por: Parmar, Paritosh, et al.
Publicado: (2024)
por: Parmar, Paritosh, et al.
Publicado: (2024)
Ego-centric Predictive Model Conditioned on Hand Trajectories
por: Zhang, Binjie, et al.
Publicado: (2025)
por: Zhang, Binjie, et al.
Publicado: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning
por: Chen, Xinyan, et al.
Publicado: (2025)
por: Chen, Xinyan, et al.
Publicado: (2025)
FocusUI: Efficient UI Grounding via Position-Preserving Visual Token Selection
por: Ouyang, Mingyu, et al.
Publicado: (2026)
por: Ouyang, Mingyu, et al.
Publicado: (2026)
Generative Visual Chain-of-Thought for Image Editing
por: Yin, Zijin, et al.
Publicado: (2026)
por: Yin, Zijin, et al.
Publicado: (2026)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
por: Li, Chen, et al.
Publicado: (2025)
por: Li, Chen, et al.
Publicado: (2025)
Automated Movie Generation via Multi-Agent CoT Planning
por: Wu, Weijia, et al.
Publicado: (2025)
por: Wu, Weijia, et al.
Publicado: (2025)
Mitigating Easy Option Bias in Multiple-Choice Question Answering
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
DiffSim: Taming Diffusion Models for Evaluating Visual Similarity
por: Song, Yiren, et al.
Publicado: (2024)
por: Song, Yiren, et al.
Publicado: (2024)
Disentangled Noisy Correspondence Learning
por: Dang, Zhuohang, et al.
Publicado: (2024)
por: Dang, Zhuohang, et al.
Publicado: (2024)
ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models
por: Liu, Xiwei, et al.
Publicado: (2026)
por: Liu, Xiwei, et al.
Publicado: (2026)
Predicting the Next Action by Modeling the Abstract Goal
por: Roy, Debaditya, et al.
Publicado: (2022)
por: Roy, Debaditya, et al.
Publicado: (2022)
CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks
por: Qi, Yu, et al.
Publicado: (2025)
por: Qi, Yu, et al.
Publicado: (2025)
MathCanvas: Intrinsic Visual Chain-of-Thought for Multimodal Mathematical Reasoning
por: Shi, Weikang, et al.
Publicado: (2025)
por: Shi, Weikang, et al.
Publicado: (2025)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
AutoGPS: Automated Geometry Problem Solving via Multimodal Formalization and Deductive Reasoning
por: Ping, Bowen, et al.
Publicado: (2025)
por: Ping, Bowen, et al.
Publicado: (2025)
Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought
por: Huo, Yu, et al.
Publicado: (2026)
por: Huo, Yu, et al.
Publicado: (2026)
Towards Unified World Models for Visual Navigation via Memory-Augmented Planning and Foresight
por: Dong, Yifei, et al.
Publicado: (2025)
por: Dong, Yifei, et al.
Publicado: (2025)
Learning to Reason Iteratively and Parallelly for Complex Visual Reasoning Scenarios
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
por: Jaiswal, Shantanu, et al.
Publicado: (2024)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
por: Zhang, Jusheng, et al.
Publicado: (2025)
por: Zhang, Jusheng, et al.
Publicado: (2025)
VProChart: Answering Chart Question through Visual Perception Alignment Agent and Programmatic Solution Reasoning
por: Huang, Muye, et al.
Publicado: (2024)
por: Huang, Muye, et al.
Publicado: (2024)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
por: Zhao, Kesen, et al.
Publicado: (2025)
por: Zhao, Kesen, et al.
Publicado: (2025)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
Ejemplares similares
-
PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning
por: Zhang, Xinyu, et al.
Publicado: (2025) -
Why Settle for One? Text-to-ImageSet Generation and Evaluation
por: Jia, Chengyou, et al.
Publicado: (2025) -
PaCo-RL: Advancing Reinforcement Learning for Consistent Image Generation with Pairwise Reward Modeling
por: Ping, Bowen, et al.
Publicado: (2025) -
From Ideal to Real: Unified and Data-Efficient Dense Prediction for Real-World Scenarios
por: Xia, Changliang, et al.
Publicado: (2025) -
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
por: Jia, Chengyou, et al.
Publicado: (2023)