BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation
Fuente:
arXiv
Guardado en:
| Autores principales: | Sun, Peng, Zhang, Xiangyu, Wu, Duan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
por: Cho, Yousang, et al.
Publicado: (2025)
por: Cho, Yousang, et al.
Publicado: (2025)
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
por: Fayyaz, Mohsen, et al.
Publicado: (2024)
por: Fayyaz, Mohsen, et al.
Publicado: (2024)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
por: Veysi, Marjan, et al.
Publicado: (2026)
por: Veysi, Marjan, et al.
Publicado: (2026)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
por: Li, Zongjie, et al.
Publicado: (2023)
por: Li, Zongjie, et al.
Publicado: (2023)
Bootstrapping LLM-based Task-Oriented Dialogue Agents via Self-Talk
por: Ulmer, Dennis, et al.
Publicado: (2024)
por: Ulmer, Dennis, et al.
Publicado: (2024)
Aligning to Illusions: Choice Blindness in Human and AI Feedback
por: Wu, Wenbin
Publicado: (2026)
por: Wu, Wenbin
Publicado: (2026)
Enhancing Chain-of-Thoughts Prompting with Iterative Bootstrapping in Large Language Models
por: Sun, Jiashuo, et al.
Publicado: (2023)
por: Sun, Jiashuo, et al.
Publicado: (2023)
HALF: Harm-Aware LLM Fairness Evaluation Aligned with Deployment
por: Mekky, Ali, et al.
Publicado: (2025)
por: Mekky, Ali, et al.
Publicado: (2025)
RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
por: Gao, Joshua, et al.
Publicado: (2025)
por: Gao, Joshua, et al.
Publicado: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
por: Pang, Bo, et al.
Publicado: (2025)
por: Pang, Bo, et al.
Publicado: (2025)
TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks
por: Wang, Xiangyu, et al.
Publicado: (2026)
por: Wang, Xiangyu, et al.
Publicado: (2026)
LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation
por: Yang, Gao, et al.
Publicado: (2025)
por: Yang, Gao, et al.
Publicado: (2025)
SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models
por: Daynauth, Roland, et al.
Publicado: (2025)
por: Daynauth, Roland, et al.
Publicado: (2025)
TroubleLLM: Align to Red Team Expert
por: Xu, Zhuoer, et al.
Publicado: (2024)
por: Xu, Zhuoer, et al.
Publicado: (2024)
Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows
por: Xu, Wanghan, et al.
Publicado: (2025)
por: Xu, Wanghan, et al.
Publicado: (2025)
PRISM: Probing Reasoning, Instruction, and Source Memory in LLM Hallucinations
por: Wu, Yuhe, et al.
Publicado: (2026)
por: Wu, Yuhe, et al.
Publicado: (2026)
Dissecting Human and LLM Preferences
por: Li, Junlong, et al.
Publicado: (2024)
por: Li, Junlong, et al.
Publicado: (2024)
Distribution-Aligned Decoding for Efficient LLM Task Adaptation
por: Hu, Senkang, et al.
Publicado: (2025)
por: Hu, Senkang, et al.
Publicado: (2025)
Reason-Align-Respond: Aligning LLM Reasoning with Knowledge Graphs for KGQA
por: Shen, Xiangqing, et al.
Publicado: (2025)
por: Shen, Xiangqing, et al.
Publicado: (2025)
GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning
por: Yang, Ningyuan, et al.
Publicado: (2026)
por: Yang, Ningyuan, et al.
Publicado: (2026)
TEST: Text Prototype Aligned Embedding to Activate LLM's Ability for Time Series
por: Sun, Chenxi, et al.
Publicado: (2023)
por: Sun, Chenxi, et al.
Publicado: (2023)
OneLLM: One Framework to Align All Modalities with Language
por: Han, Jiaming, et al.
Publicado: (2023)
por: Han, Jiaming, et al.
Publicado: (2023)
Rethinking Human Preference Evaluation of LLM Rationales
por: Li, Ziang, et al.
Publicado: (2025)
por: Li, Ziang, et al.
Publicado: (2025)
RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step
por: Luo, Xiaocheng, et al.
Publicado: (2026)
por: Luo, Xiaocheng, et al.
Publicado: (2026)
StoryAlign: Evaluating and Training Reward Models for Story Generation
por: Xia, Haotian, et al.
Publicado: (2026)
por: Xia, Haotian, et al.
Publicado: (2026)
Revisiting NLI: Towards Cost-Effective and Human-Aligned Metrics for Evaluating LLMs in Question Answering
por: Balamurali, Sai Shridhar, et al.
Publicado: (2025)
por: Balamurali, Sai Shridhar, et al.
Publicado: (2025)
Automated Evaluation of Classroom Instructional Support with LLMs and BoWs: Connecting Global Predictions to Specific Feedback
por: Whitehill, Jacob, et al.
Publicado: (2023)
por: Whitehill, Jacob, et al.
Publicado: (2023)
The Challenges of Evaluating LLM Applications: An Analysis of Automated, Human, and LLM-Based Approaches
por: Abeysinghe, Bhashithe, et al.
Publicado: (2024)
por: Abeysinghe, Bhashithe, et al.
Publicado: (2024)
From Prediction to Justification: Aligning Sentiment Reasoning with Human Rationale via Reinforcement Learning
por: Zhang, Shihao, et al.
Publicado: (2026)
por: Zhang, Shihao, et al.
Publicado: (2026)
Vibe Checker: Aligning Code Evaluation with Human Preference
por: Zhong, Ming, et al.
Publicado: (2025)
por: Zhong, Ming, et al.
Publicado: (2025)
Translation as a Scalable Proxy for Multilingual Evaluation
por: Issaka, Sheriff, et al.
Publicado: (2026)
por: Issaka, Sheriff, et al.
Publicado: (2026)
Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting
por: Dai, Hui, et al.
Publicado: (2026)
por: Dai, Hui, et al.
Publicado: (2026)
DARE: Aligning LLM Agents with the R Statistical Ecosystem via Distribution-Aware Retrieval
por: Sun, Maojun, et al.
Publicado: (2026)
por: Sun, Maojun, et al.
Publicado: (2026)
The Self-Improvement Paradox: Can Language Models Bootstrap Reasoning Capabilities without External Scaffolding?
por: Sun, Yutao, et al.
Publicado: (2025)
por: Sun, Yutao, et al.
Publicado: (2025)
Prompt Recursive Search: A Living Framework with Adaptive Growth in LLM Auto-Prompting
por: Zhao, Xiangyu, et al.
Publicado: (2024)
por: Zhao, Xiangyu, et al.
Publicado: (2024)
From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning
por: Wang, Shaojie, et al.
Publicado: (2026)
por: Wang, Shaojie, et al.
Publicado: (2026)
From Competition to Coordination: Market Making as a Scalable Framework for Safe and Aligned Multi-Agent LLM Systems
por: Gho, Brendan, et al.
Publicado: (2025)
por: Gho, Brendan, et al.
Publicado: (2025)
Direct Advantage Regression: Aligning LLMs with Online AI Reward
por: He, Li, et al.
Publicado: (2025)
por: He, Li, et al.
Publicado: (2025)
Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning
por: Richardson, Andrew Keenan, et al.
Publicado: (2025)
por: Richardson, Andrew Keenan, et al.
Publicado: (2025)
Muon is Scalable for LLM Training
por: Liu, Jingyuan, et al.
Publicado: (2025)
por: Liu, Jingyuan, et al.
Publicado: (2025)
Ejemplares similares
-
Evaluating Causal Explanation in Medical Reports with LLM-Based and Human-Aligned Metrics
por: Cho, Yousang, et al.
Publicado: (2025) -
Evaluating Human Alignment and Model Faithfulness of LLM Rationale
por: Fayyaz, Mohsen, et al.
Publicado: (2024) -
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
por: Veysi, Marjan, et al.
Publicado: (2026) -
Split and Merge: Aligning Position Biases in LLM-based Evaluators
por: Li, Zongjie, et al.
Publicado: (2023) -
Bootstrapping LLM-based Task-Oriented Dialogue Agents via Self-Talk
por: Ulmer, Dennis, et al.
Publicado: (2024)