Rewarding Structural Conformance of Reasoning using Process Mining
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Lee, Yongjae, Park, Taekhyun, Sim, Sunghyun, Bae, Hyerim |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models
par: Park, Taekhyun, et autres
Publié: (2026)
par: Park, Taekhyun, et autres
Publié: (2026)
Correlation recurrent units: A novel neural architecture for improving the predictive performance of time-series data
par: Sim, Sunghyun, et autres
Publié: (2022)
par: Sim, Sunghyun, et autres
Publié: (2022)
JustDense: Just using Dense instead of Sequence Mixer for Time Series analysis
par: Park, TaekHyun, et autres
Publié: (2025)
par: Park, TaekHyun, et autres
Publié: (2025)
LAST-RAG: Literature-Anchored Stochastic Trajectory Retrieval-Augmented Generation for Knowledge-Conditioned Degradation Model Selection
par: Park, Hanbyeol, et autres
Publié: (2026)
par: Park, Hanbyeol, et autres
Publié: (2026)
Domain-Adaptive Health Indicator Learning with Degradation-Stage Synchronized Sampling and Cross-Domain Autoencoder
par: Choo, Jungho, et autres
Publié: (2026)
par: Choo, Jungho, et autres
Publié: (2026)
Artificial Intelligence-based Smart Port Logistics Metaverse for Enhancing Productivity, Environment, and Safety in Port Logistics: A Case Study of Busan Port
par: Sim, Sunghyun, et autres
Publié: (2024)
par: Sim, Sunghyun, et autres
Publié: (2024)
IConv: Focusing on Local Variation with Channel Independent Convolution for Multivariate Time Series Forecasting
par: Lee, Gawon, et autres
Publié: (2025)
par: Lee, Gawon, et autres
Publié: (2025)
Return Prediction for Mean-Variance Portfolio Selection: How Decision-Focused Learning Shapes Forecasting Models
par: Lee, Junhyeong, et autres
Publié: (2024)
par: Lee, Junhyeong, et autres
Publié: (2024)
Generative AI and Machine Learning Collaboration for Container Dwell Time Prediction via Data Standardization
par: Kim, Minseop, et autres
Publié: (2026)
par: Kim, Minseop, et autres
Publié: (2026)
FEATHer: Fourier-Efficient Adaptive Temporal Hierarchy Forecaster for Time-Series Forecasting
par: Lee, Jaehoon, et autres
Publié: (2026)
par: Lee, Jaehoon, et autres
Publié: (2026)
Verifiable Process Rewards for Agentic Reasoning
par: Yuan, Huining, et autres
Publié: (2026)
par: Yuan, Huining, et autres
Publié: (2026)
Process-Aware Procurement Lead Time Prediction for Shipyard Delay Mitigation
par: Lee, Yongjae, et autres
Publié: (2026)
par: Lee, Yongjae, et autres
Publié: (2026)
Application of Large Language Models for Container Throughput Forecasting: Incorporating Contextual Information in Port Logistics
par: Kim, Minseop, et autres
Publié: (2026)
par: Kim, Minseop, et autres
Publié: (2026)
Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning
par: Pronesti, Massimiliano, et autres
Publié: (2026)
par: Pronesti, Massimiliano, et autres
Publié: (2026)
Coarse-to-Fine Process Reward Modeling for Mathematical Reasoning
par: Hu, Yulan, et autres
Publié: (2025)
par: Hu, Yulan, et autres
Publié: (2025)
Process Reward Agents for Steering Knowledge-Intensive Reasoning
par: Sohn, Jiwoong, et autres
Publié: (2026)
par: Sohn, Jiwoong, et autres
Publié: (2026)
GuruAgents: Emulating Wise Investors with Prompt-Guided LLM Agents
par: Kim, Yejin, et autres
Publié: (2025)
par: Kim, Yejin, et autres
Publié: (2025)
Reward Sharpness-Aware Fine-Tuning for Diffusion Models
par: Kim, Kwanyoung, et autres
Publié: (2026)
par: Kim, Kwanyoung, et autres
Publié: (2026)
Penalizing Infeasible Actions and Reward Scaling in Reinforcement Learning with Offline Data
par: Kim, Jeonghye, et autres
Publié: (2025)
par: Kim, Jeonghye, et autres
Publié: (2025)
Advancing Reasoning in Diffusion Language Models with Denoising Process Rewards
par: Xie, Shaoan, et autres
Publié: (2025)
par: Xie, Shaoan, et autres
Publié: (2025)
BitAbuse: A Dataset of Visually Perturbed Texts for Defending Phishing Attacks
par: Lee, Hanyong, et autres
Publié: (2025)
par: Lee, Hanyong, et autres
Publié: (2025)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
Estimating Covariance for Global Minimum Variance Portfolio: A Decision-Focused Learning Approach
par: Kim, Juchan, et autres
Publié: (2025)
par: Kim, Juchan, et autres
Publié: (2025)
Temporal Representation Learning for Stock Similarities and Its Applications in Investment Management
par: Hwang, Yoontae, et autres
Publié: (2024)
par: Hwang, Yoontae, et autres
Publié: (2024)
Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection
par: Lee, Kyungjae, et autres
Publié: (2024)
par: Lee, Kyungjae, et autres
Publié: (2024)
When Model Meets New Normals: Test-time Adaptation for Unsupervised Time-series Anomaly Detection
par: Kim, Dongmin, et autres
Publié: (2023)
par: Kim, Dongmin, et autres
Publié: (2023)
INEXA: Interactive and Explainable Process Model Abstraction Through Object-Centric Process Mining
par: Benzin, Janik-Vasily, et autres
Publié: (2024)
par: Benzin, Janik-Vasily, et autres
Publié: (2024)
A Temporal Graph Network Framework for Dynamic Recommendation
par: Kim, Yejin, et autres
Publié: (2024)
par: Kim, Yejin, et autres
Publié: (2024)
Reasoning Structure Matters for Safety Alignment of Reasoning Models
par: In, Yeonjun, et autres
Publié: (2026)
par: In, Yeonjun, et autres
Publié: (2026)
Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning
par: Yang, Zhaohui, et autres
Publié: (2025)
par: Yang, Zhaohui, et autres
Publié: (2025)
YTCommentQA: Video Question Answerability in Instructional Videos
par: Yang, Saelyne, et autres
Publié: (2024)
par: Yang, Saelyne, et autres
Publié: (2024)
LLM Reasoning with Process Rewards for Outcome-Guided Steps
par: Rezaei, Mohammad, et autres
Publié: (2026)
par: Rezaei, Mohammad, et autres
Publié: (2026)
Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning
par: Bhattarai, Manish, et autres
Publié: (2026)
par: Bhattarai, Manish, et autres
Publié: (2026)
Flow Matching with Injected Noise for Offline-to-Online Reinforcement Learning
par: Shin, Yongjae, et autres
Publié: (2026)
par: Shin, Yongjae, et autres
Publié: (2026)
Structured Debate Improves Corporate Credit Reasoning in Financial AI
par: Lee, Yoonjin, et autres
Publié: (2025)
par: Lee, Yoonjin, et autres
Publié: (2025)
LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition
par: Chen, Yanyu, et autres
Publié: (2026)
par: Chen, Yanyu, et autres
Publié: (2026)
GeLoc3r: Enhancing Relative Camera Pose Regression with Geometric Consistency Regularization
par: Li, Jingxing, et autres
Publié: (2025)
par: Li, Jingxing, et autres
Publié: (2025)
StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models
par: Zhang, Xiangxiang, et autres
Publié: (2025)
par: Zhang, Xiangxiang, et autres
Publié: (2025)
Retrieval-Augmented Process Reward Model for Generalizable Mathematical Reasoning
par: Zhu, Jiachen, et autres
Publié: (2025)
par: Zhu, Jiachen, et autres
Publié: (2025)
Enhancing Analogical Reasoning in the Abstraction and Reasoning Corpus via Model-Based RL
par: Lee, Jihwan, et autres
Publié: (2024)
par: Lee, Jihwan, et autres
Publié: (2024)
Documents similaires
-
LoopUS: Recasting Pretrained LLMs into Looped Latent Refinement Models
par: Park, Taekhyun, et autres
Publié: (2026) -
Correlation recurrent units: A novel neural architecture for improving the predictive performance of time-series data
par: Sim, Sunghyun, et autres
Publié: (2022) -
JustDense: Just using Dense instead of Sequence Mixer for Time Series analysis
par: Park, TaekHyun, et autres
Publié: (2025) -
LAST-RAG: Literature-Anchored Stochastic Trajectory Retrieval-Augmented Generation for Knowledge-Conditioned Degradation Model Selection
par: Park, Hanbyeol, et autres
Publié: (2026) -
Domain-Adaptive Health Indicator Learning with Degradation-Stage Synchronized Sampling and Cross-Domain Autoencoder
par: Choo, Jungho, et autres
Publié: (2026)