Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning
Fuente:
arXiv
Salvato in:
| Autori principali: | Son, Guijin, Hong, Jiwoo, Ko, Hyunwoo, Thorne, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025)
Multi-Step Reasoning in Korean and the Emergent Mirage
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
ResearchMath-14K: Scaling Research-Level Mathematics via Agents
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
KAIO: A Collection of More Challenging Korean Questions
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
Controlling Language Confusion in Multilingual LLMs
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
di: Lee, Nahyun, et al.
Pubblicazione: (2025)
LLM-as-a-Judge & Reward Model: What They Can and Cannot Do
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
On the Robustness of Reward Models for Language Model Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
di: Hong, Jiwoo, et al.
Pubblicazione: (2025)
Evaluating the Consistency of LLM Evaluators
di: Lee, Noah, et al.
Pubblicazione: (2024)
di: Lee, Noah, et al.
Pubblicazione: (2024)
When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
ORPO: Monolithic Preference Optimization without Reference Model
di: Hong, Jiwoo, et al.
Pubblicazione: (2024)
di: Hong, Jiwoo, et al.
Pubblicazione: (2024)
Ko-PIQA: A Korean Physical Commonsense Reasoning Dataset with Cultural Context
di: Choi, Dasol, et al.
Pubblicazione: (2025)
di: Choi, Dasol, et al.
Pubblicazione: (2025)
Revisiting the UID Hypothesis in LLM Reasoning Traces
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
Revisiting the Uniform Information Density Hypothesis in LLM Reasoning
di: Gwak, Minju, et al.
Pubblicazione: (2025)
di: Gwak, Minju, et al.
Pubblicazione: (2025)
Pushing the Boundaries of Multiple Choice Evaluation to One Hundred Options
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Bayesian Preference Learning for Test-Time Steerable Reward Models
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
di: Hong, Jiwoo, et al.
Pubblicazione: (2026)
Judging What We Cannot Solve: A Consequence-Based Approach for Oracle-Free Evaluation of Research-Level Math
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
Pushing on Multilingual Reasoning Models with Language-Mixed Chain-of-Thought
di: Son, Guijin, et al.
Pubblicazione: (2025)
di: Son, Guijin, et al.
Pubblicazione: (2025)
Stable Language Model Pre-training by Reducing Embedding Variability
di: Chung, Woojin, et al.
Pubblicazione: (2024)
di: Chung, Woojin, et al.
Pubblicazione: (2024)
From Mathematical Reasoning to Code: Generalization of Process Reward Models in Test-Time Scaling
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
di: Chen, Zhengyu, et al.
Pubblicazione: (2025)
Cross-lingual Transfer of Reward Models in Multilingual Alignment
di: Hong, Jiwoo, et al.
Pubblicazione: (2024)
di: Hong, Jiwoo, et al.
Pubblicazione: (2024)
Improving Fine-grained Visual Understanding in VLMs through Text-Only Training
di: Choi, Dasol, et al.
Pubblicazione: (2024)
di: Choi, Dasol, et al.
Pubblicazione: (2024)
From KMMLU-Redux to KMMLU-Pro: A Professional Korean Benchmark Suite for LLM Evaluation
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
di: Hong, Seokhee, et al.
Pubblicazione: (2025)
SAGE:Specification-Aware Grammar Extraction for Automated Test Case Generation with LLMs
di: Aditi, et al.
Pubblicazione: (2025)
di: Aditi, et al.
Pubblicazione: (2025)
Learning to Insert [PAUSE] Tokens for Better Reasoning
di: Kim, Eunki, et al.
Pubblicazione: (2025)
di: Kim, Eunki, et al.
Pubblicazione: (2025)
Multi-Task Inference: Can Large Language Models Follow Multiple Instructions at Once?
di: Son, Guijin, et al.
Pubblicazione: (2024)
di: Son, Guijin, et al.
Pubblicazione: (2024)
Socratic-MCTS: Test-Time Visual Reasoning by Asking the Right Questions
di: Acuna, David, et al.
Pubblicazione: (2025)
di: Acuna, David, et al.
Pubblicazione: (2025)
CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean
di: Kim, Eunsu, et al.
Pubblicazione: (2024)
di: Kim, Eunsu, et al.
Pubblicazione: (2024)
Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoning
di: Zhou, Cai, et al.
Pubblicazione: (2026)
di: Zhou, Cai, et al.
Pubblicazione: (2026)
Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback
di: Son, Guijin, et al.
Pubblicazione: (2026)
di: Son, Guijin, et al.
Pubblicazione: (2026)
ESG Classification by Implicit Rule Learning via GPT-4
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
di: Yun, Hyo Jeong, et al.
Pubblicazione: (2024)
MathRobust-LV: Evaluation of Large Language Models' Robustness to Linguistic Variations in Mathematical Reasoning
di: Kirtane, Neeraja, et al.
Pubblicazione: (2025)
di: Kirtane, Neeraja, et al.
Pubblicazione: (2025)
SoftCoT++: Test-Time Scaling with Soft Chain-of-Thought Reasoning
di: Xu, Yige, et al.
Pubblicazione: (2025)
di: Xu, Yige, et al.
Pubblicazione: (2025)
Evaluating the Role of Verifiers in Test-Time Scaling for Legal Reasoning Tasks
di: Romano, Davide, et al.
Pubblicazione: (2025)
di: Romano, Davide, et al.
Pubblicazione: (2025)
Chronos: Learning Temporal Dynamics of Reasoning Chains for Test-Time Scaling
di: Zhang, Kai, et al.
Pubblicazione: (2026)
di: Zhang, Kai, et al.
Pubblicazione: (2026)
Scaling Flaws of Verifier-Guided Search in Mathematical Reasoning
di: Yu, Fei, et al.
Pubblicazione: (2025)
di: Yu, Fei, et al.
Pubblicazione: (2025)
Stepwise Reasoning Checkpoint Analysis: A Test Time Scaling Method to Enhance LLMs' Reasoning
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
di: Wang, Zezhong, et al.
Pubblicazione: (2025)
modeLing: A Novel Dataset for Testing Linguistic Reasoning in Language Models
di: Chi, Nathan A., et al.
Pubblicazione: (2024)
di: Chi, Nathan A., et al.
Pubblicazione: (2024)
Crosslingual Reasoning through Test-Time Scaling
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
di: Yong, Zheng-Xin, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
di: Ko, Hyunwoo, et al.
Pubblicazione: (2025) -
Multi-Step Reasoning in Korean and the Emergent Mirage
di: Son, Guijin, et al.
Pubblicazione: (2025) -
ResearchMath-14K: Scaling Research-Level Mathematics via Agents
di: Son, Guijin, et al.
Pubblicazione: (2026) -
Won: Establishing Best Practices for Korean Financial NLP
di: Son, Guijin, et al.
Pubblicazione: (2025) -
KAIO: A Collection of More Challenging Korean Questions
di: Lee, Nahyun, et al.
Pubblicazione: (2025)