VersaPRM: Multi-Domain Process Reward Model via Synthetic Reasoning Data
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zeng, Thomas, Zhang, Shuibai, Wu, Shutong, Classen, Christian, Chae, Daewon, Ewer, Ethan, Lee, Minjae, Kim, Heeju, Kang, Wonjun, Kunde, Jackson, Fan, Ying, Kim, Jungtaek, Koo, Hyung Il, Ramchandran, Kannan, Papailiopoulos, Dimitris, Lee, Kangwook |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning
par: Zeng, Yuchen, et autres
Publié: (2025)
par: Zeng, Yuchen, et autres
Publié: (2025)
Draft-based Approximate Inference for LLMs
par: Galim, Kevin, et autres
Publié: (2025)
par: Galim, Kevin, et autres
Publié: (2025)
ENTP: Encoder-only Next Token Prediction
par: Ewer, Ethan, et autres
Publié: (2024)
par: Ewer, Ethan, et autres
Publié: (2024)
Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback
par: Kim, Jungtaek, et autres
Publié: (2026)
par: Kim, Jungtaek, et autres
Publié: (2026)
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
par: Lee, Minjae, et autres
Publié: (2026)
par: Lee, Minjae, et autres
Publié: (2026)
Not All Bits Are Equal: Scale-Dependent Memory Optimization Strategies for Reasoning Models
par: Kim, Junhyuck, et autres
Publié: (2025)
par: Kim, Junhyuck, et autres
Publié: (2025)
Parameter-Efficient Fine-Tuning of State Space Models
par: Galim, Kevin, et autres
Publié: (2024)
par: Galim, Kevin, et autres
Publié: (2024)
Can MLLMs Perform Text-to-Image In-Context Learning?
par: Zeng, Yuchen, et autres
Publié: (2024)
par: Zeng, Yuchen, et autres
Publié: (2024)
ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs
par: Kang, Wonjun, et autres
Publié: (2025)
par: Kang, Wonjun, et autres
Publié: (2025)
TAPE: Tool-Guided Adaptive Planning and Constrained Execution in Language Model Agents
par: Jeong, Jongwon, et autres
Publié: (2026)
par: Jeong, Jongwon, et autres
Publié: (2026)
Looped Transformers for Length Generalization
par: Fan, Ying, et autres
Publié: (2024)
par: Fan, Ying, et autres
Publié: (2024)
Looped Transformers are Better at Learning Learning Algorithms
par: Yang, Liu, et autres
Publié: (2023)
par: Yang, Liu, et autres
Publié: (2023)
From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data
par: Xiong, Zheyang, et autres
Publié: (2024)
par: Xiong, Zheyang, et autres
Publié: (2024)
Fine-tuning a vision-language model for fracture-surface morphology recognition
par: Liu, Quanliang, et autres
Publié: (2026)
par: Liu, Quanliang, et autres
Publié: (2026)
Predictive Pipelined Decoding: A Compute-Latency Trade-off for Exact LLM Decoding
par: Yang, Seongjun, et autres
Publié: (2023)
par: Yang, Seongjun, et autres
Publié: (2023)
Self-Improving Transformers Overcome Easy-to-Hard and Length Generalization Challenges
par: Lee, Nayoung, et autres
Publié: (2025)
par: Lee, Nayoung, et autres
Publié: (2025)
State-offset Tuning: State-based Parameter-Efficient Fine-Tuning for State Space Models
par: Kang, Wonjun, et autres
Publié: (2025)
par: Kang, Wonjun, et autres
Publié: (2025)
Task Vectors in In-Context Learning: Emergence, Formation, and Benefit
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
Eta Inversion: Designing an Optimal Eta Function for Diffusion-based Real Image Editing
par: Kang, Wonjun, et autres
Publié: (2024)
par: Kang, Wonjun, et autres
Publié: (2024)
Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion
par: Jang, Jaehyuk, et autres
Publié: (2026)
par: Jang, Jaehyuk, et autres
Publié: (2026)
UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation
par: Kang, Wonjun, et autres
Publié: (2025)
par: Kang, Wonjun, et autres
Publié: (2025)
Multi-Bin Batching for Increasing LLM Inference Throughput
par: Guldogan, Ozgur, et autres
Publié: (2024)
par: Guldogan, Ozgur, et autres
Publié: (2024)
Exploration and Exploitation Errors Are Measurable for Language Model Agents
par: Park, Jaden, et autres
Publié: (2026)
par: Park, Jaden, et autres
Publié: (2026)
InstructBooth: Instruction-following Personalized Text-to-Image Generation
par: Chae, Daewon, et autres
Publié: (2023)
par: Chae, Daewon, et autres
Publié: (2023)
Density Ratio Estimation-based Bayesian Optimization with Semi-Supervised Learning
par: Kim, Jungtaek
Publié: (2023)
par: Kim, Jungtaek
Publié: (2023)
Beyond Regrets: Geometric Metrics for Bayesian Optimization
par: Kim, Jungtaek
Publié: (2024)
par: Kim, Jungtaek
Publié: (2024)
Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks
par: Park, Jongho, et autres
Publié: (2024)
par: Park, Jongho, et autres
Publié: (2024)
Counting Guidance for High Fidelity Text-to-Image Synthesis
par: Kang, Wonjun, et autres
Publié: (2023)
par: Kang, Wonjun, et autres
Publié: (2023)
SAGE: A Realistic Benchmark for Semantic Understanding
par: Goel, Samarth, et autres
Publié: (2025)
par: Goel, Samarth, et autres
Publié: (2025)
Quantifying Positional Biases in Text Embedding Models
par: Lee, Reagan J., et autres
Publié: (2024)
par: Lee, Reagan J., et autres
Publié: (2024)
DiffExp: Efficient Exploration in Reward Fine-tuning for Text-to-Image Diffusion Models
par: Chae, Daewon, et autres
Publié: (2025)
par: Chae, Daewon, et autres
Publié: (2025)
SemanticControl: A Training-Free Approach for Handling Loosely Aligned Visual Conditions in ControlNet
par: Joung, Woosung, et autres
Publié: (2025)
par: Joung, Woosung, et autres
Publié: (2025)
Dynamic Modulation of Electronic and Optical Properties in GaN Bilayers by Interlayer Sliding
par: Kim, Heeju, et autres
Publié: (2025)
par: Kim, Heeju, et autres
Publié: (2025)
Model Fusion through Bayesian Optimization in Language Model Fine-Tuning
par: Jang, Chaeyun, et autres
Publié: (2024)
par: Jang, Chaeyun, et autres
Publié: (2024)
Lexico: Extreme KV Cache Compression via Sparse Coding over Universal Dictionaries
par: Kim, Junhyuck, et autres
Publié: (2024)
par: Kim, Junhyuck, et autres
Publié: (2024)
Advanced Facial Mask Using Roll‐to‐Roll Processed Superhydrophobic Vertically Aligned Carbon Nanotubes for Enhanced Antiviral Effects and Reusability
par: Il Hyun Lee, et autres
Publié: (2025)
par: Il Hyun Lee, et autres
Publié: (2025)
Super-Polynomial Growth of the Generalized Persistence Diagram
par: Kim, Donghan, et autres
Publié: (2024)
par: Kim, Donghan, et autres
Publié: (2024)
General relativistic self-gravitating equilibrium disks around rotating neutron stars
par: Kim, Yoonsoo, et autres
Publié: (2024)
par: Kim, Yoonsoo, et autres
Publié: (2024)
Microscopic origin of the spin-splitting in altermagnets
par: Lee, Suyoung, et autres
Publié: (2025)
par: Lee, Suyoung, et autres
Publié: (2025)
Effective 10‐bit OLED driver IC with 11‐bit DAC, double capacitor‐coupled adder, and offset calibration for enhanced panel driving
par: Changwhan Kim, et autres
Publié: (2025)
par: Changwhan Kim, et autres
Publié: (2025)
Documents similaires
-
ReJump: A Tree-Jump Representation for Analyzing and Improving LLM Reasoning
par: Zeng, Yuchen, et autres
Publié: (2025) -
Draft-based Approximate Inference for LLMs
par: Galim, Kevin, et autres
Publié: (2025) -
ENTP: Encoder-only Next Token Prediction
par: Ewer, Ethan, et autres
Publié: (2024) -
Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback
par: Kim, Jungtaek, et autres
Publié: (2026) -
TABED: Test-Time Adaptive Ensemble Drafting for Robust Speculative Decoding in LVLMs
par: Lee, Minjae, et autres
Publié: (2026)