Can Atomic Step Decomposition Enhance the Self-structured Reasoning of Multimodal Large Models?
Fuente:
arXiv
Guardado en:
| Autores principales: | Xiang, Kun, Liu, Zhili, Jiang, Zihao, Nie, Yunshuang, Cai, Kaixin, Yin, Yiyang, Huang, Runhui, Fan, Haoxiang, Li, Hanhui, Huang, Weiran, Zeng, Yihan, Yuan, Yu-Jie, Han, Jianhua, Hong, Lanqing, Xu, Hang, Liang, Xiaodan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
por: Xiang, Kun, et al.
Publicado: (2024)
por: Xiang, Kun, et al.
Publicado: (2024)
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
por: Nie, Yunshuang, et al.
Publicado: (2026)
por: Nie, Yunshuang, et al.
Publicado: (2026)
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
por: Chen, Xiuwei, et al.
Publicado: (2025)
por: Chen, Xiuwei, et al.
Publicado: (2025)
LayerDiff: Exploring Text-guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
por: Huang, Runhui, et al.
Publicado: (2024)
por: Huang, Runhui, et al.
Publicado: (2024)
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
por: Lin, Bingqian, et al.
Publicado: (2024)
por: Lin, Bingqian, et al.
Publicado: (2024)
SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation
por: Chen, Zisheng, et al.
Publicado: (2025)
por: Chen, Zisheng, et al.
Publicado: (2025)
Getting More Juice Out of Your Data: Hard Pair Refinement Enhances Visual-Language Models Without Extra Data
por: Wang, Haonan, et al.
Publicado: (2023)
por: Wang, Haonan, et al.
Publicado: (2023)
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
por: Huang, Runhui, et al.
Publicado: (2026)
por: Huang, Runhui, et al.
Publicado: (2026)
Unseen from Seen: Rewriting Observation-Instruction Using Foundation Models for Augmenting Vision-Language Navigation
por: Wei, Ziming, et al.
Publicado: (2025)
por: Wei, Ziming, et al.
Publicado: (2025)
Task-customized Masked AutoEncoder via Mixture of Cluster-conditional Experts
por: Liu, Zhili, et al.
Publicado: (2024)
por: Liu, Zhili, et al.
Publicado: (2024)
SeePhys: Does Seeing Help Thinking? -- Benchmarking Vision-Based Physics Reasoning
por: Xiang, Kun, et al.
Publicado: (2025)
por: Xiang, Kun, et al.
Publicado: (2025)
Disentanglement of Variations with Multimodal Generative Modeling
por: Zhang, Yijie, et al.
Publicado: (2025)
por: Zhang, Yijie, et al.
Publicado: (2025)
AlignCap: Aligning Speech Emotion Captioning to Human Preferences
por: Liang, Ziqi, et al.
Publicado: (2024)
por: Liang, Ziqi, et al.
Publicado: (2024)
Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI
por: Xiang, Kun, et al.
Publicado: (2025)
por: Xiang, Kun, et al.
Publicado: (2025)
ILLUME+: Illuminating Unified MLLM with Dual Visual Tokenization and Diffusion Refinement
por: Huang, Runhui, et al.
Publicado: (2025)
por: Huang, Runhui, et al.
Publicado: (2025)
Correctable Landmark Discovery via Large Models for Vision-Language Navigation
por: Lin, Bingqian, et al.
Publicado: (2024)
por: Lin, Bingqian, et al.
Publicado: (2024)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
por: Huang, Runhui, et al.
Publicado: (2024)
por: Huang, Runhui, et al.
Publicado: (2024)
Done Is Better than Perfect: Unlocking Efficient Reasoning by Structured Multi-Turn Decomposition
por: Zeng, Zihao, et al.
Publicado: (2025)
por: Zeng, Zihao, et al.
Publicado: (2025)
3D Visibility-aware Generalizable Neural Radiance Fields for Interacting Hands
por: Huang, Xuan, et al.
Publicado: (2024)
por: Huang, Xuan, et al.
Publicado: (2024)
Thinking with Geometry: Active Geometry Integration for Spatial Reasoning
por: Li, Haoyuan, et al.
Publicado: (2026)
por: Li, Haoyuan, et al.
Publicado: (2026)
Learning Geometry-Aware Nonprehensile Pushing and Pulling with Dexterous Hands
por: Li, Yunshuang, et al.
Publicado: (2025)
por: Li, Yunshuang, et al.
Publicado: (2025)
A Semi-supervised Generative Model for Incomplete Multi-view Data Integration with Missing Labels
por: Shen, Yiyang, et al.
Publicado: (2025)
por: Shen, Yiyang, et al.
Publicado: (2025)
GS-CLIP: Gaussian Splatting for Contrastive Language-Image-3D Pretraining from Real-World Data
por: Li, Haoyuan, et al.
Publicado: (2024)
por: Li, Haoyuan, et al.
Publicado: (2024)
MagicSeg: Open-World Segmentation Pretraining via Counterfactural Diffusion-Based Auto-Generation
por: Cai, Kaixin, et al.
Publicado: (2026)
por: Cai, Kaixin, et al.
Publicado: (2026)
Task-Oriented Hierarchical Object Decomposition for Visuomotor Control
por: Qian, Jianing, et al.
Publicado: (2024)
por: Qian, Jianing, et al.
Publicado: (2024)
Atomic-SNLI: Fine-Grained Natural Language Inference through Atomic Fact Decomposition
por: Huang, Minghui
Publicado: (2026)
por: Huang, Minghui
Publicado: (2026)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
por: Lin, Bingqian, et al.
Publicado: (2025)
por: Lin, Bingqian, et al.
Publicado: (2025)
Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation
por: Gou, Yunhao, et al.
Publicado: (2024)
por: Gou, Yunhao, et al.
Publicado: (2024)
ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance
por: Wang, Chunwei, et al.
Publicado: (2024)
por: Wang, Chunwei, et al.
Publicado: (2024)
Implicit Concept Removal of Diffusion Models
por: Liu, Zhili, et al.
Publicado: (2023)
por: Liu, Zhili, et al.
Publicado: (2023)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
por: Gou, Yunhao, et al.
Publicado: (2025)
por: Gou, Yunhao, et al.
Publicado: (2025)
EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions
por: Chen, Kai, et al.
Publicado: (2024)
por: Chen, Kai, et al.
Publicado: (2024)
Mixed Autoencoder for Self-supervised Visual Representation Learning
por: Chen, Kai, et al.
Publicado: (2023)
por: Chen, Kai, et al.
Publicado: (2023)
Can MLLMs Absorb Math Reasoning Abilities from LLMs as Free Lunch?
por: Hu, Yijie, et al.
Publicado: (2025)
por: Hu, Yijie, et al.
Publicado: (2025)
AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots
por: Zhang, Likui, et al.
Publicado: (2026)
por: Zhang, Likui, et al.
Publicado: (2026)
Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
por: Nie, Ming, et al.
Publicado: (2026)
por: Nie, Ming, et al.
Publicado: (2026)
MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
por: Wei, Ziming, et al.
Publicado: (2025)
por: Wei, Ziming, et al.
Publicado: (2025)
MIRA: Multimodal Iterative Reasoning Agent for Image Editing
por: Zeng, Ziyun, et al.
Publicado: (2025)
por: Zeng, Ziyun, et al.
Publicado: (2025)
Reinforcement Learning-based Knowledge Distillation with LLM-as-a-Judge
por: Shen, Yiyang, et al.
Publicado: (2026)
por: Shen, Yiyang, et al.
Publicado: (2026)
Ejemplares similares
-
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
por: Xiang, Kun, et al.
Publicado: (2024) -
RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training
por: Nie, Yunshuang, et al.
Publicado: (2026) -
C2-Evo: Co-Evolving Multimodal Data and Model for Self-Improving Reasoning
por: Chen, Xiuwei, et al.
Publicado: (2025) -
LayerDiff: Exploring Text-guided Multi-layered Composable Image Synthesis via Layer-Collaborative Diffusion Model
por: Huang, Runhui, et al.
Publicado: (2024) -
NavCoT: Boosting LLM-Based Vision-and-Language Navigation via Learning Disentangled Reasoning
por: Lin, Bingqian, et al.
Publicado: (2024)