Thought Flow Nets: From Single Predictions to Trains of Model Thought
Fuente:
arXiv
Guardado en:
| Autores principales: | Schuff, Hendrik, Adel, Heike, Vu, Ngoc Thang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2021
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023)
por: Mitra, Chancharik, et al.
Publicado: (2023)
Rethinking Chain-of-Thought Reasoning for Videos
por: Zhong, Yiwu, et al.
Publicado: (2025)
por: Zhong, Yiwu, et al.
Publicado: (2025)
Explaining Pre-Trained Language Models with Attribution Scores: An Analysis in Low-Resource Settings
por: Zhou, Wei, et al.
Publicado: (2024)
por: Zhou, Wei, et al.
Publicado: (2024)
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
por: Möller, Lucas, et al.
Publicado: (2024)
por: Möller, Lucas, et al.
Publicado: (2024)
Interleaved-Modal Chain-of-Thought
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Multimodal Chain-of-Thought Reasoning in Language Models
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
por: Zhang, Zhuosheng, et al.
Publicado: (2023)
GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning
por: Yerramilli, Sahiti, et al.
Publicado: (2025)
por: Yerramilli, Sahiti, et al.
Publicado: (2025)
Rationale-Enhanced Decoding for Multi-modal Chain-of-Thought
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
por: Yamaguchi, Shin'ya, et al.
Publicado: (2025)
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
por: Chen, Leon Liangyu, et al.
Publicado: (2026)
Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training
por: Wan, David, et al.
Publicado: (2024)
por: Wan, David, et al.
Publicado: (2024)
Measuring and Improving Chain-of-Thought Reasoning in Vision-Language Models
por: Chen, Yangyi, et al.
Publicado: (2023)
por: Chen, Yangyi, et al.
Publicado: (2023)
VLM Agents Generate Their Own Memories: Distilling Experience into Embodied Programs of Thought
por: Sarch, Gabriel, et al.
Publicado: (2024)
por: Sarch, Gabriel, et al.
Publicado: (2024)
ReasoningTrack: Chain-of-Thought Reasoning for Long-term Vision-Language Tracking
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
GFlowVLM: Enhancing Multi-step Reasoning in Vision-Language Models with Generative Flow Networks
por: Kang, Haoqiang, et al.
Publicado: (2025)
por: Kang, Haoqiang, et al.
Publicado: (2025)
Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models
por: Zhou, Qiji, et al.
Publicado: (2024)
por: Zhou, Qiji, et al.
Publicado: (2024)
Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities
por: Menon, Sachit, et al.
Publicado: (2024)
por: Menon, Sachit, et al.
Publicado: (2024)
Improving Chain-of-Thought Efficiency for Autoregressive Image Generation
por: Gu, Zeqi, et al.
Publicado: (2025)
por: Gu, Zeqi, et al.
Publicado: (2025)
CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models
por: Zhao, Qingqing, et al.
Publicado: (2025)
por: Zhao, Qingqing, et al.
Publicado: (2025)
Efficiently Integrate Large Language Models with Visual Perception: A Survey from the Training Paradigm Perspective
por: Ma, Xiaorui, et al.
Publicado: (2025)
por: Ma, Xiaorui, et al.
Publicado: (2025)
Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
por: Filvantorkaman, Melika, et al.
Publicado: (2026)
Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
por: Qin, Yiming, et al.
Publicado: (2025)
por: Qin, Yiming, et al.
Publicado: (2025)
FairCoT: Enhancing Fairness in Text-to-Image Generation via Chain of Thought Reasoning with Multimodal Large Language Models
por: Sahili, Zahraa Al, et al.
Publicado: (2024)
por: Sahili, Zahraa Al, et al.
Publicado: (2024)
BitNet b1.58 Reloaded: State-of-the-art Performance Also on Smaller Networks
por: Nielsen, Jacob, et al.
Publicado: (2024)
por: Nielsen, Jacob, et al.
Publicado: (2024)
FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging
por: Fan, Ziyang, et al.
Publicado: (2026)
por: Fan, Ziyang, et al.
Publicado: (2026)
Diving into Self-Evolving Training for Multimodal Reasoning
por: Liu, Wei, et al.
Publicado: (2024)
por: Liu, Wei, et al.
Publicado: (2024)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
por: Dönmez, Esra, et al.
Publicado: (2026)
por: Dönmez, Esra, et al.
Publicado: (2026)
Stable and Efficient Single-Rollout RL for Multimodal Reasoning
por: Liu, Rui, et al.
Publicado: (2025)
por: Liu, Rui, et al.
Publicado: (2025)
CPA-Enhancer: Chain-of-Thought Prompted Adaptive Enhancer for Object Detection under Unknown Degradations
por: Zhang, Yuwei, et al.
Publicado: (2024)
por: Zhang, Yuwei, et al.
Publicado: (2024)
Explaining Black-box Model Predictions via Two-level Nested Feature Attributions with Consistency Property
por: Yoshikawa, Yuya, et al.
Publicado: (2024)
por: Yoshikawa, Yuya, et al.
Publicado: (2024)
VideoGEM: Training-free Action Grounding in Videos
por: Vogel, Felix, et al.
Publicado: (2025)
por: Vogel, Felix, et al.
Publicado: (2025)
Rethinking Training Dynamics in Scale-wise Autoregressive Generation
por: Zhou, Gengze, et al.
Publicado: (2025)
por: Zhou, Gengze, et al.
Publicado: (2025)
RewardHarness: Self-Evolving Agentic Post-Training
por: Zhang, Yuxuan, et al.
Publicado: (2026)
por: Zhang, Yuxuan, et al.
Publicado: (2026)
Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
por: Siddique, Md. Abu Bakor, et al.
Publicado: (2026)
SPD-Faith Bench: Diagnosing and Improving Faithfulness in Chain-of-Thought for Multimodal Large Language Models
por: Lv, Weijiang, et al.
Publicado: (2026)
por: Lv, Weijiang, et al.
Publicado: (2026)
MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency
por: Jiang, Dongzhi, et al.
Publicado: (2025)
por: Jiang, Dongzhi, et al.
Publicado: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
por: Li, Chengzu, et al.
Publicado: (2025)
por: Li, Chengzu, et al.
Publicado: (2025)
MobileCLIP2: Improving Multi-Modal Reinforced Training
por: Faghri, Fartash, et al.
Publicado: (2025)
por: Faghri, Fartash, et al.
Publicado: (2025)
OpenClaw-RL: Train Any Agent Simply by Talking
por: Wang, Yinjie, et al.
Publicado: (2026)
por: Wang, Yinjie, et al.
Publicado: (2026)
COAP: Memory-Efficient Training with Correlation-Aware Gradient Projection
por: Xiao, Jinqi, et al.
Publicado: (2024)
por: Xiao, Jinqi, et al.
Publicado: (2024)
A General and Efficient Training for Transformer via Token Expansion
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
Ejemplares similares
-
Compositional Chain-of-Thought Prompting for Large Multimodal Models
por: Mitra, Chancharik, et al.
Publicado: (2023) -
Rethinking Chain-of-Thought Reasoning for Videos
por: Zhong, Yiwu, et al.
Publicado: (2025) -
Explaining Pre-Trained Language Models with Attribution Scores: An Analysis in Low-Resource Settings
por: Zhou, Wei, et al.
Publicado: (2024) -
Explaining Caption-Image Interactions in CLIP Models with Second-Order Attributions
por: Möller, Lucas, et al.
Publicado: (2024) -
Interleaved-Modal Chain-of-Thought
por: Gao, Jun, et al.
Publicado: (2024)