Rho-1: Not All Tokens Are What You Need
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Zhenghao, Gou, Zhibin, Gong, Yeyun, Liu, Xiao, Shen, Yelong, Xu, Ruochen, Lin, Chen, Yang, Yujiu, Jiao, Jian, Duan, Nan, Chen, Weizhu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Exploring the Mystery of Influential Data for Mathematical Reasoning
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
di: Ni, Xinzhe, et al.
Pubblicazione: (2024)
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
di: Gou, Zhibin, et al.
Pubblicazione: (2023)
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024)
di: Huang, Yiming, et al.
Pubblicazione: (2024)
Competition-Level Problems are Effective LLM Evaluators
di: Huang, Yiming, et al.
Pubblicazione: (2023)
di: Huang, Yiming, et al.
Pubblicazione: (2023)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
di: Sun, Jiashuo, et al.
Pubblicazione: (2023)
AnnoLLM: Making Large Language Models to Be Better Crowdsourced Annotators
di: He, Xingwei, et al.
Pubblicazione: (2023)
di: He, Xingwei, et al.
Pubblicazione: (2023)
Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Not All Tokens Are What You Need In Thinking
di: Yuan, Hang, et al.
Pubblicazione: (2025)
di: Yuan, Hang, et al.
Pubblicazione: (2025)
Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability
di: Liang, Xiao, et al.
Pubblicazione: (2026)
di: Liang, Xiao, et al.
Pubblicazione: (2026)
Ensuring Safe and High-Quality Outputs: A Guideline Library Approach for Language Models
di: Luo, Yi, et al.
Pubblicazione: (2024)
di: Luo, Yi, et al.
Pubblicazione: (2024)
SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning
di: Liang, Xiao, et al.
Pubblicazione: (2025)
di: Liang, Xiao, et al.
Pubblicazione: (2025)
Mixture of Neuron Experts
di: Cheng, Runxi, et al.
Pubblicazione: (2025)
di: Cheng, Runxi, et al.
Pubblicazione: (2025)
SciAgent: Tool-augmented Language Models for Scientific Reasoning
di: Ma, Yubo, et al.
Pubblicazione: (2024)
di: Ma, Yubo, et al.
Pubblicazione: (2024)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
di: Chen, Zijie, et al.
Pubblicazione: (2026)
di: Chen, Zijie, et al.
Pubblicazione: (2026)
Beyond Length: Quantifying Long-Range Information for Long-Context LLM Pretraining Data
di: Deng, Haoran, et al.
Pubblicazione: (2025)
di: Deng, Haoran, et al.
Pubblicazione: (2025)
Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation
di: Li, Zichong, et al.
Pubblicazione: (2026)
di: Li, Zichong, et al.
Pubblicazione: (2026)
Training Matryoshka Mixture-of-Experts for Elastic Inference-Time Expert Utilization
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
di: Wang, Yaoxiang, et al.
Pubblicazione: (2025)
LayerNorm Induces Recency Bias in Transformer Decoders
di: Kim, Junu, et al.
Pubblicazione: (2025)
di: Kim, Junu, et al.
Pubblicazione: (2025)
Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling
di: Ren, Liliang, et al.
Pubblicazione: (2024)
di: Ren, Liliang, et al.
Pubblicazione: (2024)
Adapting LLM Agents with Universal Feedback in Communication
di: Wang, Kuan, et al.
Pubblicazione: (2023)
di: Wang, Kuan, et al.
Pubblicazione: (2023)
Greed is All You Need: An Evaluation of Tokenizer Inference Methods
di: Uzan, Omri, et al.
Pubblicazione: (2024)
di: Uzan, Omri, et al.
Pubblicazione: (2024)
DeepThink: Aligning Language Models with Domain-Specific User Intents
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
Block Rotation is All You Need for MXFP4 Quantization
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
di: Shao, Yuantian, et al.
Pubblicazione: (2025)
CriticBench: Benchmarking LLMs for Critique-Correct Reasoning
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
di: Lin, Zicheng, et al.
Pubblicazione: (2024)
HiCaM: A Hierarchical-Causal Modification Framework for Long-Form Text Modification
di: Shi, Yuntao, et al.
Pubblicazione: (2025)
di: Shi, Yuntao, et al.
Pubblicazione: (2025)
PROM: A Phrase-level Copying Mechanism with Pre-training for Abstractive Summarization
di: Ma, Xinbei, et al.
Pubblicazione: (2023)
di: Ma, Xinbei, et al.
Pubblicazione: (2023)
Continual Pre-Training is (not) What You Need in Domain Adaption
di: Chen, Pin-Er, et al.
Pubblicazione: (2025)
di: Chen, Pin-Er, et al.
Pubblicazione: (2025)
The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models
di: Ji, Ke, et al.
Pubblicazione: (2025)
di: Ji, Ke, et al.
Pubblicazione: (2025)
Arabic Text Diacritization In The Age Of Transfer Learning: Token Classification Is All You Need
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2024)
di: Skiredj, Abderrahman, et al.
Pubblicazione: (2024)
APOLLO: An Optimized Training Approach for Long-form Numerical Reasoning
di: Sun, Jiashuo, et al.
Pubblicazione: (2022)
di: Sun, Jiashuo, et al.
Pubblicazione: (2022)
Not All Documents Are What You Need for Extracting Instruction Tuning Data
di: Zhang, Chi, et al.
Pubblicazione: (2025)
di: Zhang, Chi, et al.
Pubblicazione: (2025)
Training on the Benchmark Is Not All You Need
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
di: Ni, Shiwen, et al.
Pubblicazione: (2024)
Test-time Recursive Thinking: Self-Improvement without External Feedback
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
di: Zhuang, Yufan, et al.
Pubblicazione: (2026)
Contrast Is All You Need
di: Kilic, Burak, et al.
Pubblicazione: (2023)
di: Kilic, Burak, et al.
Pubblicazione: (2023)
Selected Languages are All You Need for Cross-lingual Truthfulness Transfer
di: Liu, Weihao, et al.
Pubblicazione: (2024)
di: Liu, Weihao, et al.
Pubblicazione: (2024)
Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
di: Tyukin, Georgy, et al.
Pubblicazione: (2024)
Grimoire is All You Need for Enhancing Large Language Models
di: Chen, Ding, et al.
Pubblicazione: (2024)
di: Chen, Ding, et al.
Pubblicazione: (2024)
Evaluation is All You Need: Strategic Overclaiming of LLM Reasoning Capabilities Through Evaluation Design
di: Sun, Lin, et al.
Pubblicazione: (2025)
di: Sun, Lin, et al.
Pubblicazione: (2025)
Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection
di: He, Hongyi, et al.
Pubblicazione: (2025)
di: He, Hongyi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Exploring the Mystery of Influential Data for Mathematical Reasoning
di: Ni, Xinzhe, et al.
Pubblicazione: (2024) -
CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing
di: Gou, Zhibin, et al.
Pubblicazione: (2023) -
ToRA: A Tool-Integrated Reasoning Agent for Mathematical Problem Solving
di: Gou, Zhibin, et al.
Pubblicazione: (2023) -
Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning
di: Huang, Yiming, et al.
Pubblicazione: (2024) -
Competition-Level Problems are Effective LLM Evaluators
di: Huang, Yiming, et al.
Pubblicazione: (2023)