Learning to Rank Chain-of-Thought: Using a Small Model
Fuente:
arXiv
Guardado en:
| Autores principales: | Jiang, Eric Hanchen, Luo, Haozheng, Pang, Shengyuan, Li, Xiaomin, Qi, Zhenting, Li, Hengli, Yang, Cheng-Fu, Lin, Zongyu, Li, Xinfeng, Xu, Hao, Chang, Kai-Wei, Wu, Ying Nian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
por: Jiang, Eric Hanchen, et al.
Publicado: (2026)
por: Jiang, Eric Hanchen, et al.
Publicado: (2026)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning
por: Liu, Dong, et al.
Publicado: (2026)
por: Liu, Dong, et al.
Publicado: (2026)
Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
por: Jiang, Eric Hanchen, et al.
Publicado: (2025)
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
Symbolic Chain-of-Thought Distillation: Small Models Can Also "Think" Step-by-Step
por: Li, Liunian Harold, et al.
Publicado: (2023)
por: Li, Liunian Harold, et al.
Publicado: (2023)
NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking
por: Chen, Kang, et al.
Publicado: (2026)
por: Chen, Kang, et al.
Publicado: (2026)
Discrete Markov Bridge
por: Li, Hengli, et al.
Publicado: (2025)
por: Li, Hengli, et al.
Publicado: (2025)
Conv-CoA: Improving Open-domain Question Answering in Large Language Models via Conversational Chain-of-Action
por: Pan, Zhenyu, et al.
Publicado: (2024)
por: Pan, Zhenyu, et al.
Publicado: (2024)
Seek in the Dark: Reasoning via Test-Time Instance-Level Policy Gradient in Latent Space
por: Li, Hengli, et al.
Publicado: (2025)
por: Li, Hengli, et al.
Publicado: (2025)
From Local to Cluster: A Unified Framework for Causal Discovery with Latent Variables
por: Li, Zongyu
Publicado: (2026)
por: Li, Zongyu
Publicado: (2026)
RankCoT: Refining Knowledge for Retrieval-Augmented Generation through Ranking Chain-of-Thoughts
por: Wu, Mingyan, et al.
Publicado: (2025)
por: Wu, Mingyan, et al.
Publicado: (2025)
Ehrenfeucht-Haussler Rank and Chain of Thought
por: Barceló, Pablo, et al.
Publicado: (2025)
por: Barceló, Pablo, et al.
Publicado: (2025)
RecCoT: Enhancing Recommendation via Chain-of-Thought
por: Yang, Shuo, et al.
Publicado: (2025)
por: Yang, Shuo, et al.
Publicado: (2025)
ENCORE: Entropy-guided Reward Composition for Multi-head Safety Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
Understanding Galaxy Morphology Evolution Through Cosmic Time via Redshift Conditioned Diffusion Models
por: Lizarraga, Andrew, et al.
Publicado: (2024)
por: Lizarraga, Andrew, et al.
Publicado: (2024)
Legilimens: Practical and Unified Content Moderation for Large Language Model Services
por: Wu, Jialin, et al.
Publicado: (2024)
por: Wu, Jialin, et al.
Publicado: (2024)
Enhancing Automatic Chord Recognition through LLM Chain-of-Thought Reasoning
por: Chang, Chih-Cheng, et al.
Publicado: (2025)
por: Chang, Chih-Cheng, et al.
Publicado: (2025)
Interleaved-Modal Chain-of-Thought
por: Gao, Jun, et al.
Publicado: (2024)
por: Gao, Jun, et al.
Publicado: (2024)
Stepwise Penalization for Length-Efficient Chain-of-Thought Reasoning
por: Li, Xintong, et al.
Publicado: (2026)
por: Li, Xintong, et al.
Publicado: (2026)
CoT-BERT: Enhancing Unsupervised Sentence Representation through Chain-of-Thought
por: Zhang, Bowen, et al.
Publicado: (2023)
por: Zhang, Bowen, et al.
Publicado: (2023)
Chain-of-Thought in Large Language Models: Decoding, Projection, and Activation
por: Yang, Hao, et al.
Publicado: (2024)
por: Yang, Hao, et al.
Publicado: (2024)
Efficient Reasoning via Chain of Unconscious Thought
por: Gong, Ruihan, et al.
Publicado: (2025)
por: Gong, Ruihan, et al.
Publicado: (2025)
A Study on the Ancient theater of official house in The Taihang mountain area of North Henan Province in China
por: Hengli Peng
Publicado: (2023)
por: Hengli Peng
Publicado: (2023)
What Makes a Good Reasoning Chain? Uncovering Structural Patterns in Long Chain-of-Thought Reasoning
por: Jiang, Gangwei, et al.
Publicado: (2025)
por: Jiang, Gangwei, et al.
Publicado: (2025)
ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
por: Cheng, Xiaoxue, et al.
Publicado: (2024)
Unlocking the Potential of Text-to-Image Diffusion with PAC-Bayesian Theory
por: Jiang, Eric Hanchen, et al.
Publicado: (2024)
por: Jiang, Eric Hanchen, et al.
Publicado: (2024)
CaRDiff: Video Salient Object Ranking Chain of Thought Reasoning for Saliency Prediction with Diffusion
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
por: Tang, Yolo Yunlong, et al.
Publicado: (2024)
Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search
por: Shen, Maohao, et al.
Publicado: (2025)
por: Shen, Maohao, et al.
Publicado: (2025)
MILR: Improving Multimodal Image Generation via Test-Time Latent Reasoning
por: Mi, Yapeng, et al.
Publicado: (2025)
por: Mi, Yapeng, et al.
Publicado: (2025)
THINK-Bench: Evaluating Thinking Efficiency and Chain-of-Thought Quality of Large Reasoning Models
por: Li, Zhiyuan, et al.
Publicado: (2025)
por: Li, Zhiyuan, et al.
Publicado: (2025)
ProLLM: Protein Chain-of-Thoughts Enhanced LLM for Protein-Protein Interaction Prediction
por: Jin, Mingyu, et al.
Publicado: (2024)
por: Jin, Mingyu, et al.
Publicado: (2024)
Can Small Language Models Help Large Language Models Reason Better?: LM-Guided Chain-of-Thought
por: Lee, Jooyoung, et al.
Publicado: (2024)
por: Lee, Jooyoung, et al.
Publicado: (2024)
ST-MoE-BERT: A Spatial-Temporal Mixture-of-Experts Framework for Long-Term Cross-City Mobility Prediction
por: He, Haoyu, et al.
Publicado: (2024)
por: He, Haoyu, et al.
Publicado: (2024)
Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
por: Li, Xinfeng, et al.
Publicado: (2025)
por: Li, Xinfeng, et al.
Publicado: (2025)
SliceGraph: Mapping Process Isomers in Multi-Run Chain-of-Thought Reasoning
por: Chen, Kang, et al.
Publicado: (2026)
por: Chen, Kang, et al.
Publicado: (2026)
Generative Visual Chain-of-Thought for Image Editing
por: Yin, Zijin, et al.
Publicado: (2026)
por: Yin, Zijin, et al.
Publicado: (2026)
Chain-of-Thought Hijacking
por: Zhao, Jianli, et al.
Publicado: (2025)
por: Zhao, Jianli, et al.
Publicado: (2025)
Upfront Chain-of-Thought: A Cooperative Framework for Chain-of-Thought Compression
por: Li, Chengzhengxu, et al.
Publicado: (2025)
por: Li, Chengzhengxu, et al.
Publicado: (2025)
Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models
por: Yao, Yao, et al.
Publicado: (2023)
por: Yao, Yao, et al.
Publicado: (2023)
Ejemplares similares
-
Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learning
por: Jiang, Eric Hanchen, et al.
Publicado: (2026) -
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
por: Jiang, Eric Hanchen, et al.
Publicado: (2025) -
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning
por: Liu, Dong, et al.
Publicado: (2026) -
Dynamic Generation of Multi-LLM Agents Communication Topologies with Graph Diffusion Models
por: Jiang, Eric Hanchen, et al.
Publicado: (2025) -
Chain-of-Action: Faithful and Multimodal Question Answering through Large Language Models
por: Pan, Zhenyu, et al.
Publicado: (2024)