Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency Training
Fuente:
arXiv
Saved in:
| Main Authors: | Tan, Cheng, Wei, Jingxuan, Gao, Zhangyang, Sun, Linzhuang, Li, Siyuan, Guo, Ruifeng, Yu, Bihui, Li, Stan Z. |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
by: Tan, Cheng, et al.
Published: (2024)
by: Tan, Cheng, et al.
Published: (2024)
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
by: Wei, Jingxuan, et al.
Published: (2024)
by: Wei, Jingxuan, et al.
Published: (2024)
SketchAgent: Generating Structured Diagrams from Hand-Drawn Sketches
by: Tan, Cheng, et al.
Published: (2025)
by: Tan, Cheng, et al.
Published: (2025)
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
by: Wei, Jingxuan, et al.
Published: (2025)
by: Wei, Jingxuan, et al.
Published: (2025)
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
by: Wei, Jingxuan, et al.
Published: (2024)
by: Wei, Jingxuan, et al.
Published: (2024)
SimVPv2: Towards Simple yet Powerful Spatiotemporal Predictive Learning
by: Tan, Cheng, et al.
Published: (2022)
by: Tan, Cheng, et al.
Published: (2022)
A Survey on Image-text Multimodal Models
by: Guo, Ruifeng, et al.
Published: (2023)
by: Guo, Ruifeng, et al.
Published: (2023)
MM-Verify: Enhancing Multimodal Reasoning with Chain-of-Thought Verification
by: Sun, Linzhuang, et al.
Published: (2025)
by: Sun, Linzhuang, et al.
Published: (2025)
Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions
by: Wei, Jingxuan, et al.
Published: (2025)
by: Wei, Jingxuan, et al.
Published: (2025)
FoldToken2: Learning compact, invariant and generative protein structure language
by: Gao, Zhangyang, et al.
Published: (2024)
by: Gao, Zhangyang, et al.
Published: (2024)
USTEP: Spatio-Temporal Predictive Learning under A Unified View
by: Tan, Cheng, et al.
Published: (2023)
by: Tan, Cheng, et al.
Published: (2023)
Rational Sensibility: LLM Enhanced Empathetic Response Generation Guided by Self-presentation Theory
by: Sun, Linzhuang, et al.
Published: (2023)
by: Sun, Linzhuang, et al.
Published: (2023)
Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions
by: Tan, Cheng, et al.
Published: (2024)
by: Tan, Cheng, et al.
Published: (2024)
How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning
by: Zhang, Xiangxiang, et al.
Published: (2026)
by: Zhang, Xiangxiang, et al.
Published: (2026)
AlphaFold Database Debiasing for Robust Inverse Folding
by: Tan, Cheng, et al.
Published: (2025)
by: Tan, Cheng, et al.
Published: (2025)
MeToken: Uniform Micro-environment Token Boosts Post-Translational Modification Prediction
by: Tan, Cheng, et al.
Published: (2024)
by: Tan, Cheng, et al.
Published: (2024)
Brain-inspired Computing Based on Deep Learning for Human-computer Interaction: A Review
by: Yu, Bihui, et al.
Published: (2023)
by: Yu, Bihui, et al.
Published: (2023)
PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control
by: Wei, Jingxuan, et al.
Published: (2026)
by: Wei, Jingxuan, et al.
Published: (2026)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
by: Wei, Jingxuan, et al.
Published: (2025)
by: Wei, Jingxuan, et al.
Published: (2025)
RDesign: Hierarchical Data-efficient Representation Learning for Tertiary Structure-based RNA Design
by: Tan, Cheng, et al.
Published: (2023)
by: Tan, Cheng, et al.
Published: (2023)
Efficient-Empathy: Towards Efficient and Effective Selection of Empathy Data
by: Sun, Linzhuang, et al.
Published: (2024)
by: Sun, Linzhuang, et al.
Published: (2024)
Thinking with Drafting: Optical Decompression via Logical Reconstruction
by: Wei, Jingxuan, et al.
Published: (2026)
by: Wei, Jingxuan, et al.
Published: (2026)
BEATS: Optimizing LLM Mathematical Capabilities with BackVerify and Adaptive Disambiguate based Efficient Tree Search
by: Sun, Linzhuang, et al.
Published: (2024)
by: Sun, Linzhuang, et al.
Published: (2024)
Re-Dock: Towards Flexible and Realistic Molecular Docking with Diffusion Bridge
by: Huang, Yufei, et al.
Published: (2024)
by: Huang, Yufei, et al.
Published: (2024)
UniIF: Unified Molecule Inverse Folding
by: Gao, Zhangyang, et al.
Published: (2024)
by: Gao, Zhangyang, et al.
Published: (2024)
Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning
by: Li, Tingyu, et al.
Published: (2025)
by: Li, Tingyu, et al.
Published: (2025)
Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration
by: Sun, Linzhuang, et al.
Published: (2025)
by: Sun, Linzhuang, et al.
Published: (2025)
A Teacher-Free Graph Knowledge Distillation Framework with Dual Self-Distillation
by: Wu, Lirong, et al.
Published: (2024)
by: Wu, Lirong, et al.
Published: (2024)
VQDNA: Unleashing the Power of Vector Quantization for Multi-Species Genomic Sequence Modeling
by: Li, Siyuan, et al.
Published: (2024)
by: Li, Siyuan, et al.
Published: (2024)
Synth-Empathy: Towards High-Quality Synthetic Empathy Data
by: Liang, Hao, et al.
Published: (2024)
by: Liang, Hao, et al.
Published: (2024)
FoldToken: Learning Protein Language via Vector Quantization and Beyond
by: Gao, Zhangyang, et al.
Published: (2024)
by: Gao, Zhangyang, et al.
Published: (2024)
A Graph is Worth $K$ Words: Euclideanizing Graph using Pure Transformer
by: Gao, Zhangyang, et al.
Published: (2024)
by: Gao, Zhangyang, et al.
Published: (2024)
An Empirical Study: Extensive Deep Temporal Point Process
by: Lin, Haitao, et al.
Published: (2021)
by: Lin, Haitao, et al.
Published: (2021)
The Trinity of Consistency as a Defining Principle for General World Models
by: Wei, Jingxuan, et al.
Published: (2026)
by: Wei, Jingxuan, et al.
Published: (2026)
Deciphering RNA Secondary Structure Prediction: A Probabilistic K-Rook Matching Perspective
by: Tan, Cheng, et al.
Published: (2022)
by: Tan, Cheng, et al.
Published: (2022)
dyAb: Flow Matching for Flexible Antibody Design with AlphaFold-driven Pre-binding Antigen
by: Tan, Cheng, et al.
Published: (2025)
by: Tan, Cheng, et al.
Published: (2025)
Multimodal Regression for Enzyme Turnover Rates Prediction
by: Hu, Bozhen, et al.
Published: (2025)
by: Hu, Bozhen, et al.
Published: (2025)
PFMBench: Protein Foundation Model Benchmark
by: Gao, Zhangyang, et al.
Published: (2025)
by: Gao, Zhangyang, et al.
Published: (2025)
MLIP: Enhancing Medical Visual Representation with Divergence Encoder and Knowledge-guided Contrastive Learning
by: Li, Zhe, et al.
Published: (2024)
by: Li, Zhe, et al.
Published: (2024)
Learning to Model Graph Structural Information on MLPs via Graph Structure Self-Contrasting
by: Wu, Lirong, et al.
Published: (2024)
by: Wu, Lirong, et al.
Published: (2024)
Similar Items
-
Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning
by: Tan, Cheng, et al.
Published: (2024) -
From Words to Structured Visuals: A Benchmark and Framework for Text-to-Diagram Generation and Editing
by: Wei, Jingxuan, et al.
Published: (2024) -
SketchAgent: Generating Structured Diagrams from Hand-Drawn Sketches
by: Tan, Cheng, et al.
Published: (2025) -
GGBench: A Geometric Generative Reasoning Benchmark for Unified Multimodal Models
by: Wei, Jingxuan, et al.
Published: (2025) -
Sentence-Level or Token-Level? A Comprehensive Study on Knowledge Distillation
by: Wei, Jingxuan, et al.
Published: (2024)