RefineBench: Evaluating Refinement Capability of Language Models via Checklists
Fuente:
arXiv
Saved in:
| Main Authors: | Lee, Young-Jun, Kim, Seungone, Lee, Byung-Kwan, Moon, Minkyeong, Hwang, Yechan, Kim, Jong Myoung, Neubig, Graham, Welleck, Sean, Choi, Ho-Jin |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
PAD: Towards Efficient Data Generation for Transfer Learning Using Phrase Alignment
by: Kim, Jong Myoung, et al.
Published: (2025)
by: Kim, Jong Myoung, et al.
Published: (2025)
LANGALIGN: Enhancing Non-English Language Models via Cross-Lingual Embedding Alignment
by: Kim, Jong Myoung, et al.
Published: (2025)
by: Kim, Jong Myoung, et al.
Published: (2025)
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
by: Kim, Seungone, et al.
Published: (2025)
by: Kim, Seungone, et al.
Published: (2025)
Gym-Anything: Turn any Software into an Agent Environment
by: Aggarwal, Pranjal, et al.
Published: (2026)
by: Aggarwal, Pranjal, et al.
Published: (2026)
Intriguing Properties of Large Language and Vision Models
by: Lee, Young-Jun, et al.
Published: (2024)
by: Lee, Young-Jun, et al.
Published: (2024)
Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
The CoT Encyclopedia: Analyzing, Predicting, and Controlling how a Reasoning Model will Think
by: Lee, Seongyun, et al.
Published: (2025)
by: Lee, Seongyun, et al.
Published: (2025)
Evaluating Language Models as Synthetic Data Generators
by: Kim, Seungone, et al.
Published: (2024)
by: Kim, Seungone, et al.
Published: (2024)
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
by: Aggarwal, Pranjal, et al.
Published: (2025)
by: Aggarwal, Pranjal, et al.
Published: (2025)
Does Incomplete Syntax Influence Korean Language Model? Focusing on Word Order and Case Markers
by: Kim, Jong Myoung, et al.
Published: (2024)
by: Kim, Jong Myoung, et al.
Published: (2024)
Refined approaches in second leptogenesis for the baryon-lepton asymmetry discrepancy
by: ChoeJo, YeolLin, et al.
Published: (2024)
by: ChoeJo, YeolLin, et al.
Published: (2024)
MultiVerse: A Multi-Turn Conversation Benchmark for Evaluating Large Vision and Language Models
by: Lee, Young-Jun, et al.
Published: (2025)
by: Lee, Young-Jun, et al.
Published: (2025)
Iterative Prompt Refinement for Safer Text-to-Image Generation
by: Jeon, Jinwoo, et al.
Published: (2025)
by: Jeon, Jinwoo, et al.
Published: (2025)
Imagined Speech State Classification for Robust Brain-Computer Interface
by: Ko, Byung-Kwan, et al.
Published: (2024)
by: Ko, Byung-Kwan, et al.
Published: (2024)
Refining Multiscale Heterogeneity in Perovskite Solar Cells via Interfacial Chemistry Homogenization
by: Hochan Song, et al.
Published: (2025)
by: Hochan Song, et al.
Published: (2025)
Adaptive Trajectory Refinement for Optimization-based Local Planning in Narrow Passages
by: Lee, Hahjin, et al.
Published: (2025)
by: Lee, Hahjin, et al.
Published: (2025)
In-Place Feedback: Reliable Refinement for Multi-Turn Expert-LLM Collaboration
by: Choi, Youngbin, et al.
Published: (2025)
by: Choi, Youngbin, et al.
Published: (2025)
K/DA: Automated Data Generation Pipeline for Detoxifying Implicitly Offensive Language in Korean
by: Jeon, Minkyeong, et al.
Published: (2025)
by: Jeon, Minkyeong, et al.
Published: (2025)
RefineVAD: Semantic-Guided Feature Recalibration for Weakly Supervised Video Anomaly Detection
by: Lee, Junhee, et al.
Published: (2025)
by: Lee, Junhee, et al.
Published: (2025)
WINE: Wavelet-Guided GAN Inversion and Editing for High-Fidelity Refinement
by: Kim, Chaewon, et al.
Published: (2022)
by: Kim, Chaewon, et al.
Published: (2022)
Digital SERS Nanoprobe Immunoassay With Single‐Particle Sensing Resolution for Detection of Pancreatic Cancer Biomarkers From Clinical Blood Samples
by: Chanhee Choi, et al.
Published: (2026)
by: Chanhee Choi, et al.
Published: (2026)
Neural Speech Embeddings for Speech Synthesis Based on Deep Generative Networks
by: Lee, Seo-Hyun, et al.
Published: (2023)
by: Lee, Seo-Hyun, et al.
Published: (2023)
Refinement of Primary Si Phase in Hypereutectic Al–Si Alloy by Electrically Assisted Solidification with P Addition
by: Su‐Ji Jin, et al.
Published: (2024)
by: Su‐Ji Jin, et al.
Published: (2024)
Refinement of Primary Si Phase in Hypereutectic Al–Si Alloy by Electrically Assisted Solidification with P Addition
by: Su‐Ji Jin, et al.
Published: (2024)
by: Su‐Ji Jin, et al.
Published: (2024)
Anti‐Inflammatory and Antibacterial Properties of Curcuma longa Extract Against Helicobacter pylori
by: Jeongsook Kim, et al.
Published: (2025)
by: Jeongsook Kim, et al.
Published: (2025)
Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning
by: Huan, Maggie, et al.
Published: (2025)
by: Huan, Maggie, et al.
Published: (2025)
Refined canonical stable Grothendieck polynomials and their duals, Part 1
by: Hwang, Byung-Hak, et al.
Published: (2021)
by: Hwang, Byung-Hak, et al.
Published: (2021)
Refined canonical stable Grothendieck polynomials and their duals, Part 2
by: Hwang, Byung-Hak, et al.
Published: (2024)
by: Hwang, Byung-Hak, et al.
Published: (2024)
Better Instruction-Following Through Minimum Bayes Risk
by: Wu, Ian, et al.
Published: (2024)
by: Wu, Ian, et al.
Published: (2024)
Wave-envelope dark matter beyond the monochromatic paradigm
by: Kim, Yechan, et al.
Published: (2026)
by: Kim, Yechan, et al.
Published: (2026)
Oscillating scalar potential and its implications for cosmic neutrino background searches
by: Kim, Yechan, et al.
Published: (2025)
by: Kim, Yechan, et al.
Published: (2025)
Refinement of Hikita's $e$-positivity theorem via Abreu--Nigro's $g$-functions and restricted modular law
by: Huh, JiSun, et al.
Published: (2025)
by: Huh, JiSun, et al.
Published: (2025)
Constraint-Aware Mesh Refinement Method by Reachability Set Envelope of Curvature Bounded Paths
by: Bae, Juho, et al.
Published: (2024)
by: Bae, Juho, et al.
Published: (2024)
Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions
by: Kim, Taehyeon, et al.
Published: (2023)
by: Kim, Taehyeon, et al.
Published: (2023)
Masked Spatial Propagation Network for Sparsity-Adaptive Depth Refinement
by: Jun, Jinyoung, et al.
Published: (2024)
by: Jun, Jinyoung, et al.
Published: (2024)
Ever-Evolving Memory by Blending and Refining the Past
by: Kim, Seo Hyun, et al.
Published: (2024)
by: Kim, Seo Hyun, et al.
Published: (2024)
PR-MaGIC: Prompt Refinement Via Mask Decoder Gradient Flow For In-Context Segmentation
by: Lee, Minjae, et al.
Published: (2026)
by: Lee, Minjae, et al.
Published: (2026)
Refined 3D index
by: Gang, Dongmin, et al.
Published: (2026)
by: Gang, Dongmin, et al.
Published: (2026)
Semi-gradient DICE for Offline Constrained Reinforcement Learning
by: Kim, Woosung, et al.
Published: (2025)
by: Kim, Woosung, et al.
Published: (2025)
Training Flow Matching Models with Reliable Labels via Self-Purification
by: Kim, Hyeongju, et al.
Published: (2025)
by: Kim, Hyeongju, et al.
Published: (2025)
Similar Items
-
PAD: Towards Efficient Data Generation for Transfer Learning Using Phrase Alignment
by: Kim, Jong Myoung, et al.
Published: (2025) -
LANGALIGN: Enhancing Non-English Language Models via Cross-Lingual Embedding Alignment
by: Kim, Jong Myoung, et al.
Published: (2025) -
Scaling Evaluation-time Compute with Reasoning Models as Evaluators
by: Kim, Seungone, et al.
Published: (2025) -
Gym-Anything: Turn any Software into an Agent Environment
by: Aggarwal, Pranjal, et al.
Published: (2026) -
Intriguing Properties of Large Language and Vision Models
by: Lee, Young-Jun, et al.
Published: (2024)