AStar: Boosting Multimodal Reasoning with Automated Structured Thinking
Fuente:
arXiv
Saved in:
| Main Authors: | Wu, Jinyang, Feng, Mingkuan, Zhai, Guocheng, Zhang, Shuai, Lian, Zheng, Lv, Fangrui, Shao, Pengpeng, Jin, Ruihan, Wen, Zhengqi, Tao, Jianhua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
by: Jin, Ruihan, et al.
Published: (2025)
by: Jin, Ruihan, et al.
Published: (2025)
DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
by: Feng, Mingkuan, et al.
Published: (2025)
by: Feng, Mingkuan, et al.
Published: (2025)
Two-Stage Regularization-Based Structured Pruning for LLMs
by: Feng, Mingkuan, et al.
Published: (2025)
by: Feng, Mingkuan, et al.
Published: (2025)
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs
by: Jin, Ruihan, et al.
Published: (2026)
by: Jin, Ruihan, et al.
Published: (2026)
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
by: Wu, Jinyang, et al.
Published: (2026)
by: Wu, Jinyang, et al.
Published: (2026)
TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning
by: Wu, Jinyang, et al.
Published: (2025)
by: Wu, Jinyang, et al.
Published: (2025)
Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles
by: Wu, Jinyang, et al.
Published: (2026)
by: Wu, Jinyang, et al.
Published: (2026)
Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS
by: Wu, Jinyang, et al.
Published: (2024)
by: Wu, Jinyang, et al.
Published: (2024)
Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models
by: Wu, Jinyang, et al.
Published: (2024)
by: Wu, Jinyang, et al.
Published: (2024)
Can large language models understand uncommon meanings of common words?
by: Wu, Jinyang, et al.
Published: (2024)
by: Wu, Jinyang, et al.
Published: (2024)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
by: Jin, Ruihan, et al.
Published: (2024)
by: Jin, Ruihan, et al.
Published: (2024)
Spark: Strategic Policy-Aware Exploration via Dynamic Branching for Long-Horizon Agentic Learning
by: Wu, Jinyang, et al.
Published: (2026)
by: Wu, Jinyang, et al.
Published: (2026)
Debunk and Infer: Multimodal Fake News Detection via Diffusion-Generated Evidence and LLM Reasoning
by: Yan, Kaiying, et al.
Published: (2025)
by: Yan, Kaiying, et al.
Published: (2025)
DashFusion: Dual-stream Alignment with Hierarchical Bottleneck Fusion for Multimodal Sentiment Analysis
by: Wen, Yuhua, et al.
Published: (2025)
by: Wen, Yuhua, et al.
Published: (2025)
Exploring the Role of Audio in Multimodal Misinformation Detection
by: Liu, Moyang, et al.
Published: (2024)
by: Liu, Moyang, et al.
Published: (2024)
Edit Content, Preserve Acoustics: Imperceptible Text-Based Speech Editing via Self-Consistency Rewards
by: Ren, Yong, et al.
Published: (2026)
by: Ren, Yong, et al.
Published: (2026)
Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification
by: Lv, Shuai, et al.
Published: (2026)
by: Lv, Shuai, et al.
Published: (2026)
PSA-MF: Personality-Sentiment Aligned Multi-Level Fusion for Multimodal Sentiment Analysis
by: Xie, Heng, et al.
Published: (2025)
by: Xie, Heng, et al.
Published: (2025)
KS-LLM: Knowledge Selection of Large Language Models with Evidence Document for Question Answering
by: Zheng, Xinxin, et al.
Published: (2024)
by: Zheng, Xinxin, et al.
Published: (2024)
I Think, Therefore I Diffuse: Enabling Multimodal In-Context Reasoning in Diffusion Models
by: Mi, Zhenxing, et al.
Published: (2025)
by: Mi, Zhenxing, et al.
Published: (2025)
Dual-Branch Knowledge Distillation for Noise-Robust Synthetic Speech Detection
by: Fan, Cunhang, et al.
Published: (2023)
by: Fan, Cunhang, et al.
Published: (2023)
EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking
by: Zhu, Fangrui, et al.
Published: (2026)
by: Zhu, Fangrui, et al.
Published: (2026)
Integrated Sensing and Communication: Rate-Distortion Fundamental Limits of State Estimator
by: Feng, Lugaoze, et al.
Published: (2025)
by: Feng, Lugaoze, et al.
Published: (2025)
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
by: Xiang, Kun, et al.
Published: (2024)
by: Xiang, Kun, et al.
Published: (2024)
ALLM4ADD: Unlocking the Capabilities of Audio Large Language Models for Audio Deepfake Detection
by: Gu, Hao, et al.
Published: (2025)
by: Gu, Hao, et al.
Published: (2025)
Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation
by: Zhang, Haojie, et al.
Published: (2024)
by: Zhang, Haojie, et al.
Published: (2024)
P2Mark: Plug-and-play Parameter-level Watermarking for Neural Speech Generation
by: Ren, Yong, et al.
Published: (2025)
by: Ren, Yong, et al.
Published: (2025)
AffectGPT: Dataset and Framework for Explainable Multimodal Emotion Recognition
by: Lian, Zheng, et al.
Published: (2024)
by: Lian, Zheng, et al.
Published: (2024)
Deep Learning Approaches for Multimodal Intent Recognition: A Survey
by: Zhao, Jingwei, et al.
Published: (2025)
by: Zhao, Jingwei, et al.
Published: (2025)
Residual Speaker Representation for One-Shot Voice Conversion
by: Xu, Le, et al.
Published: (2023)
by: Xu, Le, et al.
Published: (2023)
Deconfounded Reasoning for Multimodal Fake News Detection via Causal Intervention
by: Liu, Moyang, et al.
Published: (2025)
by: Liu, Moyang, et al.
Published: (2025)
Realizing Immersive Volumetric Video: A Multimodal Framework for 6-DoF VR Engagement
by: Yang, Zhengxian, et al.
Published: (2026)
by: Yang, Zhengxian, et al.
Published: (2026)
Multimodal Sentiment Analysis Based on Causal Reasoning
by: Chen, Fuhai, et al.
Published: (2024)
by: Chen, Fuhai, et al.
Published: (2024)
Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling
by: Chen, Andong, et al.
Published: (2026)
by: Chen, Andong, et al.
Published: (2026)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
by: Liu, Jiazhen, et al.
Published: (2025)
by: Liu, Jiazhen, et al.
Published: (2025)
New Channel Coding Lower Bounds for Noisy Permutation Channels
by: Feng, Lugaoze, et al.
Published: (2024)
by: Feng, Lugaoze, et al.
Published: (2024)
HiCMAE: Hierarchical Contrastive Masked Autoencoder for Self-Supervised Audio-Visual Emotion Recognition
by: Sun, Licai, et al.
Published: (2024)
by: Sun, Licai, et al.
Published: (2024)
Multimodal Fusion with Pre-Trained Model Features in Affective Behaviour Analysis In-the-wild
by: Wen, Zhuofan, et al.
Published: (2024)
by: Wen, Zhuofan, et al.
Published: (2024)
VisuoThink: Empowering LVLM Reasoning with Multimodal Tree Search
by: Wang, Yikun, et al.
Published: (2025)
by: Wang, Yikun, et al.
Published: (2025)
Photoinduced Electron Donor–Acceptor Complex‐Enabled Tandem Perfluoroalkylation/Cyclization of Internal Alkenes Toward Ring‐Fused Quinazolinones
by: Sheng Yu, et al.
Published: (2026)
by: Sheng Yu, et al.
Published: (2026)
Similar Items
-
RadialRouter: Structured Representation for Efficient and Robust Large Language Models Routing
by: Jin, Ruihan, et al.
Published: (2025) -
DReSS: Data-driven Regularized Structured Streamlining for Large Language Models
by: Feng, Mingkuan, et al.
Published: (2025) -
Two-Stage Regularization-Based Structured Pruning for LLMs
by: Feng, Mingkuan, et al.
Published: (2025) -
Exploring Knowledge Purification in Multi-Teacher Knowledge Distillation for LLMs
by: Jin, Ruihan, et al.
Published: (2026) -
Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning
by: Wu, Jinyang, et al.
Published: (2026)