SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Ren, Yanwei, Zhang, Haotian, Wu, Fuxiang, Qiu, Jiayan, Huang, Jiaxing, Yu, Baosheng, Liu, Liu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
by: Ren, Yanwei, et al.
Published: (2026)
by: Ren, Yanwei, et al.
Published: (2026)
LARGO: Low-Rank Regulated Gradient Projection for Robust Parameter Efficient Fine-Tuning
by: Zhang, Haotian, et al.
Published: (2025)
by: Zhang, Haotian, et al.
Published: (2025)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
by: Li, Chenghao, et al.
Published: (2025)
by: Li, Chenghao, et al.
Published: (2025)
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
by: Ren, Yanwei, et al.
Published: (2025)
by: Ren, Yanwei, et al.
Published: (2025)
ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
by: Zhang, Haotian, et al.
Published: (2025)
by: Zhang, Haotian, et al.
Published: (2025)
Remodeling Semantic Relationships in Vision-Language Fine-Tuning
by: Wu, Xiangyang, et al.
Published: (2025)
by: Wu, Xiangyang, et al.
Published: (2025)
IVR-R1: Refining Trajectories through Iterative Visual-Grounded Reasoning in Reinforcement Learning
by: Li, Chenghao, et al.
Published: (2026)
by: Li, Chenghao, et al.
Published: (2026)
SPOGW: a Score-based Preference Optimization method via Group-Wise comparison for workflows
by: Cui, Yitong, et al.
Published: (2025)
by: Cui, Yitong, et al.
Published: (2025)
Interpretable Contrastive Monte Carlo Tree Search Reasoning
by: Gao, Zitian, et al.
Published: (2024)
by: Gao, Zitian, et al.
Published: (2024)
HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models
by: Liu, Yuyu, et al.
Published: (2026)
by: Liu, Yuyu, et al.
Published: (2026)
SIGMA: Search-Augmented On-Demand Knowledge Integration for Agentic Mathematical Reasoning
by: Asgarov, Ali, et al.
Published: (2025)
by: Asgarov, Ali, et al.
Published: (2025)
A Large Language Model Guided Topic Refinement Mechanism for Short Text Modeling
by: Chang, Shuyu, et al.
Published: (2024)
by: Chang, Shuyu, et al.
Published: (2024)
Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models
by: Cui, Yingqian, et al.
Published: (2025)
by: Cui, Yingqian, et al.
Published: (2025)
Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
by: Yao, Huanjin, et al.
Published: (2024)
by: Yao, Huanjin, et al.
Published: (2024)
Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
by: Wang, Yibo, et al.
Published: (2025)
by: Wang, Yibo, et al.
Published: (2025)
Monte Carlo Tree Search with Reasoning Path Refinement for Small Language Models in Conversational Text-to-NoSQL
by: Xiong, Xubang, et al.
Published: (2026)
by: Xiong, Xubang, et al.
Published: (2026)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
by: Yu, Huimu, et al.
Published: (2024)
by: Yu, Huimu, et al.
Published: (2024)
Generating Code World Models with Large Language Models Guided by Monte Carlo Tree Search
by: Dainese, Nicola, et al.
Published: (2024)
by: Dainese, Nicola, et al.
Published: (2024)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
by: Xi, Zhiheng, et al.
Published: (2023)
by: Xi, Zhiheng, et al.
Published: (2023)
SSR: Socratic Self-Refine for Large Language Model Reasoning
by: Shi, Haizhou, et al.
Published: (2025)
by: Shi, Haizhou, et al.
Published: (2025)
Partial Reasoning in Language Models: Search and Refinement Guided by Uncertainty
by: da Luz, Murilo, et al.
Published: (2026)
by: da Luz, Murilo, et al.
Published: (2026)
CogMCTS: A Novel Cognitive-Guided Monte Carlo Tree Search Framework for Iterative Heuristic Evolution with Large Language Models
by: Wang, Hui, et al.
Published: (2025)
by: Wang, Hui, et al.
Published: (2025)
Guiding Clinical Reasoning with Large Language Models via Knowledge Seeds
by: WU, Jiageng, et al.
Published: (2024)
by: WU, Jiageng, et al.
Published: (2024)
Generating Symbolic World Models via Test-time Scaling of Large Language Models
by: Yu, Zhouliang, et al.
Published: (2025)
by: Yu, Zhouliang, et al.
Published: (2025)
Syntactic and Semantic Control of Large Language Models via Sequential Monte Carlo
by: Loula, João, et al.
Published: (2025)
by: Loula, João, et al.
Published: (2025)
TabTracer: Monte Carlo Tree Search for Complex Table Reasoning with Large Language Models
by: Luo, Zhizhao, et al.
Published: (2026)
by: Luo, Zhizhao, et al.
Published: (2026)
ReasonEdit: Editing Vision-Language Models using Human Reasoning
by: Qiu, Jiaxing, et al.
Published: (2026)
by: Qiu, Jiaxing, et al.
Published: (2026)
Efficient Post-Training Refinement of Latent Reasoning in Large Language Models
by: Wang, Xinyuan, et al.
Published: (2025)
by: Wang, Xinyuan, et al.
Published: (2025)
SIGMA: Selective Gated Mamba for Sequential Recommendation
by: Liu, Ziwei, et al.
Published: (2024)
by: Liu, Ziwei, et al.
Published: (2024)
A Survey on Evaluation of Multimodal Large Language Models
by: Huang, Jiaxing, et al.
Published: (2024)
by: Huang, Jiaxing, et al.
Published: (2024)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
by: Shi, Yaorui, et al.
Published: (2025)
by: Shi, Yaorui, et al.
Published: (2025)
R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO
by: Yao, Huanjin, et al.
Published: (2025)
by: Yao, Huanjin, et al.
Published: (2025)
Efficient Reasoning for Large Reasoning Language Models via Certainty-Guided Reflection Suppression
by: Huang, Jiameng, et al.
Published: (2025)
by: Huang, Jiameng, et al.
Published: (2025)
SiblingRepair: Sibling-Based Multi-Hunk Repair with Large Language Models
by: Liu, Xinyu, et al.
Published: (2026)
by: Liu, Xinyu, et al.
Published: (2026)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
by: Chu, Zheng, et al.
Published: (2023)
by: Chu, Zheng, et al.
Published: (2023)
R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization
by: Zhang, Jingyi, et al.
Published: (2025)
by: Zhang, Jingyi, et al.
Published: (2025)
Refine Knowledge of Large Language Models via Adaptive Contrastive Learning
by: Li, Yinghui, et al.
Published: (2025)
by: Li, Yinghui, et al.
Published: (2025)
Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models
by: Xie, Yingsha, et al.
Published: (2026)
by: Xie, Yingsha, et al.
Published: (2026)
Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation
by: Xu, Shicheng, et al.
Published: (2024)
by: Xu, Shicheng, et al.
Published: (2024)
Deliberation in Latent Space via Differentiable Cache Augmentation
by: Liu, Luyang, et al.
Published: (2024)
by: Liu, Luyang, et al.
Published: (2024)
Similar Items
-
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
by: Ren, Yanwei, et al.
Published: (2026) -
LARGO: Low-Rank Regulated Gradient Projection for Robust Parameter Efficient Fine-Tuning
by: Zhang, Haotian, et al.
Published: (2025) -
Re-Initialization Token Learning for Tool-Augmented Large Language Models
by: Li, Chenghao, et al.
Published: (2025) -
Instruction Learning Paradigms: A Dual Perspective on White-box and Black-box LLMs
by: Ren, Yanwei, et al.
Published: (2025) -
ContextPRM: Leveraging Contextual Coherence for multi-domain Test-Time Scaling
by: Zhang, Haotian, et al.
Published: (2025)