Imagination Helps Visual Reasoning, But Not Yet in Latent Space
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, You, Chen, Chi, Li, Yanghao, Zeng, Fanhu, Huang, Kaiyu, Xu, Jinan, Sun, Maosong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
por: Lou, Xinyue, et al.
Publicado: (2025)
por: Lou, Xinyue, et al.
Publicado: (2025)
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
por: Zeng, Fanhu, et al.
Publicado: (2026)
por: Zeng, Fanhu, et al.
Publicado: (2026)
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
por: Li, You, et al.
Publicado: (2025)
por: Li, You, et al.
Publicado: (2025)
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
por: Qi, Rui, et al.
Publicado: (2025)
por: Qi, Rui, et al.
Publicado: (2025)
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
por: Li, Chengzu, et al.
Publicado: (2025)
por: Li, Chengzu, et al.
Publicado: (2025)
Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning
por: Zhang, Xue, et al.
Publicado: (2025)
por: Zhang, Xue, et al.
Publicado: (2025)
Multi-Aspect Knowledge Distillation for Language Model with Low-rank Factorization
por: Liu, Zihe, et al.
Publicado: (2026)
por: Liu, Zihe, et al.
Publicado: (2026)
Latent Visual Reasoning
por: Li, Bangzheng, et al.
Publicado: (2025)
por: Li, Bangzheng, et al.
Publicado: (2025)
Multilingual Collaborative Defense for Large Language Models
por: Li, Hongliang, et al.
Publicado: (2025)
por: Li, Hongliang, et al.
Publicado: (2025)
DoRA: Enhancing Parameter-Efficient Fine-Tuning with Dynamic Rank Distribution
por: Mao, Yulong, et al.
Publicado: (2024)
por: Mao, Yulong, et al.
Publicado: (2024)
Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration
por: Huang, Langlin, et al.
Publicado: (2026)
por: Huang, Langlin, et al.
Publicado: (2026)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
por: Sun, Yubo, et al.
Publicado: (2025)
por: Sun, Yubo, et al.
Publicado: (2025)
Dual-Space Knowledge Distillation for Large Language Models
por: Zhang, Songming, et al.
Publicado: (2024)
por: Zhang, Songming, et al.
Publicado: (2024)
ChartEdit: How Far Are MLLMs From Automating Chart Analysis? Evaluating MLLMs' Capability via Chart Editing
por: Zhao, Xuanle, et al.
Publicado: (2025)
por: Zhao, Xuanle, et al.
Publicado: (2025)
FastFiD: Improve Inference Efficiency of Open Domain Question Answering via Sentence Selection
por: Huang, Yufei, et al.
Publicado: (2024)
por: Huang, Yufei, et al.
Publicado: (2024)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
por: Chen, Chao, et al.
Publicado: (2025)
por: Chen, Chao, et al.
Publicado: (2025)
KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Grounding
por: Ma, Xinyu, et al.
Publicado: (2025)
por: Ma, Xinyu, et al.
Publicado: (2025)
Language-Coupled Reinforcement Learning for Multilingual Retrieval-Augmented Generation
por: Qi, Rui, et al.
Publicado: (2026)
por: Qi, Rui, et al.
Publicado: (2026)
Latent-Condensed Transformer for Efficient Long Context Modeling
por: You, Zeng, et al.
Publicado: (2026)
por: You, Zeng, et al.
Publicado: (2026)
Make Imagination Clearer! Stable Diffusion-based Visual Imagination for Multimodal Machine Translation
por: Chen, Andong, et al.
Publicado: (2024)
por: Chen, Andong, et al.
Publicado: (2024)
Latent Chain-of-Thought for Visual Reasoning
por: Sun, Guohao, et al.
Publicado: (2025)
por: Sun, Guohao, et al.
Publicado: (2025)
Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases
por: Huang, Hui, et al.
Publicado: (2026)
por: Huang, Hui, et al.
Publicado: (2026)
Telling Speculative Stories to Help Humans Imagine the Harms of Healthcare AI
por: Zhao, Xingmeng, et al.
Publicado: (2025)
por: Zhao, Xingmeng, et al.
Publicado: (2025)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
por: Zhang, Huanyu, et al.
Publicado: (2025)
por: Zhang, Huanyu, et al.
Publicado: (2025)
Outdated Issue Aware Decoding for Reasoning Questions on Edited Knowledge
por: Sun, Zengkui, et al.
Publicado: (2024)
por: Sun, Zengkui, et al.
Publicado: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
por: Huang, Jie, et al.
Publicado: (2023)
por: Huang, Jie, et al.
Publicado: (2023)
Interleaved Latent Visual Reasoning with Selective Perceptual Modeling
por: Dong, Shuai, et al.
Publicado: (2025)
por: Dong, Shuai, et al.
Publicado: (2025)
Mixed Distillation Helps Smaller Language Model Better Reasoning
por: Li, Chenglin, et al.
Publicado: (2023)
por: Li, Chenglin, et al.
Publicado: (2023)
Good Arguments Against the People Pleasers: How Reasoning Mitigates (Yet Masks) LLM Sycophancy
por: Feng, Zhaoxin, et al.
Publicado: (2026)
por: Feng, Zhaoxin, et al.
Publicado: (2026)
Training Large Language Models to Reason in a Continuous Latent Space
por: Hao, Shibo, et al.
Publicado: (2024)
por: Hao, Shibo, et al.
Publicado: (2024)
From Reasoning to Learning: A Survey on Hypothesis Discovery and Rule Learning with Large Language Models
por: He, Kaiyu, et al.
Publicado: (2025)
por: He, Kaiyu, et al.
Publicado: (2025)
A Survey on Large Language Models with Multilingualism: Recent Advances and New Frontiers
por: Huang, Kaiyu, et al.
Publicado: (2024)
por: Huang, Kaiyu, et al.
Publicado: (2024)
Textualized Agent-Style Reasoning for Complex Tasks by Multiple Round LLM Generation
por: Liang, Chen, et al.
Publicado: (2024)
por: Liang, Chen, et al.
Publicado: (2024)
Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction
por: Liu, Dairu, et al.
Publicado: (2025)
por: Liu, Dairu, et al.
Publicado: (2025)
Holistic Capability Preservation: Towards Compact Yet Comprehensive Reasoning Models
por: Ling Team, et al.
Publicado: (2025)
por: Ling Team, et al.
Publicado: (2025)
A*-Thought: Efficient Reasoning via Bidirectional Compression for Low-Resource Settings
por: Xu, Xiaoang, et al.
Publicado: (2025)
por: Xu, Xiaoang, et al.
Publicado: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
por: Dai, Yifan, et al.
Publicado: (2026)
por: Dai, Yifan, et al.
Publicado: (2026)
Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning
por: Wang, Yifan, et al.
Publicado: (2026)
por: Wang, Yifan, et al.
Publicado: (2026)
UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs
por: Jiang, Houcheng, et al.
Publicado: (2026)
por: Jiang, Houcheng, et al.
Publicado: (2026)
Ejemplares similares
-
Think in Safety: Unveiling and Mitigating Safety Alignment Collapse in Multimodal Large Reasoning Model
por: Lou, Xinyue, et al.
Publicado: (2025) -
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning
por: Zeng, Fanhu, et al.
Publicado: (2026) -
Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models
por: Li, You, et al.
Publicado: (2025) -
SoT: Structured-of-Thought Prompting Guides Multilingual Reasoning in Large Language Models
por: Qi, Rui, et al.
Publicado: (2025) -
Imagine while Reasoning in Space: Multimodal Visualization-of-Thought
por: Li, Chengzu, et al.
Publicado: (2025)