Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Jiacheng, Cohen, Andrew, Pasunuru, Ramakanth, Choi, Yejin, Hajishirzi, Hannaneh, Celikyilmaz, Asli |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
by: Xu, Hao, et al.
Published: (2025)
by: Xu, Hao, et al.
Published: (2025)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
by: Liu, Jiacheng, et al.
Published: (2024)
by: Liu, Jiacheng, et al.
Published: (2024)
Don't let the information slip away
by: Li, Taozhe, et al.
Published: (2026)
by: Li, Taozhe, et al.
Published: (2026)
Efficient Tool Use with Chain-of-Abstraction Reasoning
by: Gao, Silin, et al.
Published: (2024)
by: Gao, Silin, et al.
Published: (2024)
Don't throw the baby out with the bathwater: How and why deep learning for ARC
by: Cole, Jack, et al.
Published: (2025)
by: Cole, Jack, et al.
Published: (2025)
Don't Look Away
by: Cohen, Brianne
Published: (2023)
by: Cohen, Brianne
Published: (2023)
HREF: Human Response-Guided Evaluation of Instruction Following in Language Models
by: Lyu, Xinxi, et al.
Published: (2024)
by: Lyu, Xinxi, et al.
Published: (2024)
Don't Forget your Inverse DDIM for Image Editing
by: Gomez-Trenado, Guillermo, et al.
Published: (2025)
by: Gomez-Trenado, Guillermo, et al.
Published: (2025)
Don't throw the baby out with the bathwater: Protecting children against CSAM deepfakes without banning ai technology
by: Jasmine Ende
Published: (2025)
by: Jasmine Ende
Published: (2025)
Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback
by: Ivison, Hamish, et al.
Published: (2024)
by: Ivison, Hamish, et al.
Published: (2024)
Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning
by: Sclar, Melanie, et al.
Published: (2024)
by: Sclar, Melanie, et al.
Published: (2024)
The crucial discovery of thermonuclear X-ray bursts: never throw away old data!
by: Kuulkers, Erik
Published: (2024)
by: Kuulkers, Erik
Published: (2024)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
by: Zhao, Bowen, et al.
Published: (2024)
by: Zhao, Bowen, et al.
Published: (2024)
Don't trust your eyes: on the (un)reliability of feature visualizations
by: Geirhos, Robert, et al.
Published: (2023)
by: Geirhos, Robert, et al.
Published: (2023)
Designing a Future-Proof Cryptography Strategy for Quantum Computing
by: Sreekanth Pasunuru
Published: (2024)
by: Sreekanth Pasunuru
Published: (2024)
ActionAtlas: A VideoQA Benchmark for Domain-specialized Action Recognition
by: Salehi, Mohammadreza, et al.
Published: (2024)
by: Salehi, Mohammadreza, et al.
Published: (2024)
DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search
by: Wu, Fang, et al.
Published: (2025)
by: Wu, Fang, et al.
Published: (2025)
Don't drop your samples! Coherence-aware training benefits Conditional diffusion
by: Dufour, Nicolas, et al.
Published: (2024)
by: Dufour, Nicolas, et al.
Published: (2024)
reWordBench: Benchmarking and Improving the Robustness of Reward Models with Transformed Inputs
by: Wu, Zhaofeng, et al.
Published: (2025)
by: Wu, Zhaofeng, et al.
Published: (2025)
s3: You Don't Need That Much Data to Train a Search Agent via RL
by: Jiang, Pengcheng, et al.
Published: (2025)
by: Jiang, Pengcheng, et al.
Published: (2025)
Critical Batch Size Revisited: A Simple Empirical Approach to Large-Batch Language Model Training
by: Merrill, William, et al.
Published: (2025)
by: Merrill, William, et al.
Published: (2025)
Husky: A Unified, Open-Source Language Agent for Multi-Step Reasoning
by: Kim, Joongwon, et al.
Published: (2024)
by: Kim, Joongwon, et al.
Published: (2024)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
by: Wang, Yike, et al.
Published: (2025)
by: Wang, Yike, et al.
Published: (2025)
BTR: Binary Token Representations for Efficient Retrieval Augmented Language Models
by: Cao, Qingqing, et al.
Published: (2023)
by: Cao, Qingqing, et al.
Published: (2023)
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
by: Yadav, Tanush, et al.
Published: (2026)
by: Yadav, Tanush, et al.
Published: (2026)
CopyBench: Measuring Literal and Non-Literal Reproduction of Copyright-Protected Text in Language Model Generation
by: Chen, Tong, et al.
Published: (2024)
by: Chen, Tong, et al.
Published: (2024)
Don't be salesmen
Published: (1997)
Published: (1997)
Don't lie to your friends: Learning what you know from collaborative self-play
by: Eisenstein, Jacob, et al.
Published: (2025)
by: Eisenstein, Jacob, et al.
Published: (2025)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
by: Zeng, Zhiyuan, et al.
Published: (2025)
by: Zeng, Zhiyuan, et al.
Published: (2025)
Do Membership Inference Attacks Work on Large Language Models?
by: Duan, Michael, et al.
Published: (2024)
by: Duan, Michael, et al.
Published: (2024)
I Don't Know: Explicit Modeling of Uncertainty with an [IDK] Token
by: Cohen, Roi, et al.
Published: (2024)
by: Cohen, Roi, et al.
Published: (2024)
Don't Measure Once: Measuring Visibility in AI Search (GEO)
by: Schulte, Julius, et al.
Published: (2026)
by: Schulte, Julius, et al.
Published: (2026)
Don't Splat your Gaussians: Volumetric Ray-Traced Primitives for Modeling and Rendering Scattering and Emissive Media
by: Condor, Jorge, et al.
Published: (2024)
by: Condor, Jorge, et al.
Published: (2024)
Extreme Value Monte Carlo Tree Search for Classical Planning
by: Asai, Masataro, et al.
Published: (2024)
by: Asai, Masataro, et al.
Published: (2024)
RLCD: Reinforcement Learning from Contrastive Distillation for Language Model Alignment
by: Yang, Kevin, et al.
Published: (2023)
by: Yang, Kevin, et al.
Published: (2023)
Open-Domain Text Evaluation via Contrastive Distribution Methods
by: Lu, Sidi, et al.
Published: (2023)
by: Lu, Sidi, et al.
Published: (2023)
Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming
by: Kavumba, Pride, et al.
Published: (2026)
by: Kavumba, Pride, et al.
Published: (2026)
Don’t Burn it Here
by: Walsh, Ed, et al.
Published: (2026)
by: Walsh, Ed, et al.
Published: (2026)
Don't Forget Imagination!
by: Vityaev, Evgenii E., et al.
Published: (2025)
by: Vityaev, Evgenii E., et al.
Published: (2025)
Don't Pay Attention
by: Hammoud, Mohammad, et al.
Published: (2025)
by: Hammoud, Mohammad, et al.
Published: (2025)
Similar Items
-
Infini-gram mini: Exact n-gram Search at the Internet Scale with FM-Index
by: Xu, Hao, et al.
Published: (2025) -
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
by: Liu, Jiacheng, et al.
Published: (2024) -
Don't let the information slip away
by: Li, Taozhe, et al.
Published: (2026) -
Efficient Tool Use with Chain-of-Abstraction Reasoning
by: Gao, Silin, et al.
Published: (2024) -
Don't throw the baby out with the bathwater: How and why deep learning for ARC
by: Cole, Jack, et al.
Published: (2025)