Small Reward Models via Backward Inference
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yike, Brahman, Faeze, Feng, Shangbin, Xiao, Teng, Hajishirzi, Hannaneh, Tsvetkov, Yulia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
por: Wang, Haojin, et al.
Publicado: (2026)
por: Wang, Haojin, et al.
Publicado: (2026)
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
por: Wang, Yike, et al.
Publicado: (2025)
por: Wang, Yike, et al.
Publicado: (2025)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
Data Swarms: Optimizable Generation of Synthetic Evaluation Data
por: Feng, Shangbin, et al.
Publicado: (2025)
por: Feng, Shangbin, et al.
Publicado: (2025)
Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Don't Throw Away Your Pretrained Model
por: Feng, Shangbin, et al.
Publicado: (2025)
por: Feng, Shangbin, et al.
Publicado: (2025)
ComPO: Community Preferences for Language Model Personalization
por: Kumar, Sachin, et al.
Publicado: (2024)
por: Kumar, Sachin, et al.
Publicado: (2024)
Resolving Knowledge Conflicts in Large Language Models
por: Wang, Yike, et al.
Publicado: (2023)
por: Wang, Yike, et al.
Publicado: (2023)
The Single-Multi Evolution Loop for Self-Improving Model Collaboration Systems
por: Feng, Shangbin, et al.
Publicado: (2026)
por: Feng, Shangbin, et al.
Publicado: (2026)
Among Us: Measuring and Mitigating Malicious Contributions in Model Collaboration Systems
por: Yang, Ziyuan, et al.
Publicado: (2026)
por: Yang, Ziyuan, et al.
Publicado: (2026)
Fine-grained Hallucination Detection and Editing for Language Models
por: Mishra, Abhika, et al.
Publicado: (2024)
por: Mishra, Abhika, et al.
Publicado: (2024)
Meta-Reinforcement Learning with Self-Reflection for Agentic Search
por: Xiao, Teng, et al.
Publicado: (2026)
por: Xiao, Teng, et al.
Publicado: (2026)
Do Membership Inference Attacks Work on Large Language Models?
por: Duan, Michael, et al.
Publicado: (2024)
por: Duan, Michael, et al.
Publicado: (2024)
The Art of Saying No: Contextual Noncompliance in Language Models
por: Brahman, Faeze, et al.
Publicado: (2024)
por: Brahman, Faeze, et al.
Publicado: (2024)
SPARTA ALIGNMENT: Collectively Aligning Multiple Language Models through Combat
por: Jiang, Yuru, et al.
Publicado: (2025)
por: Jiang, Yuru, et al.
Publicado: (2025)
ParaPO: Aligning Language Models to Reduce Verbatim Reproduction of Pre-training Data
por: Chen, Tong, et al.
Publicado: (2025)
por: Chen, Tong, et al.
Publicado: (2025)
APT: Adaptive Pruning and Tuning Pretrained Language Models for Efficient Training and Inference
por: Zhao, Bowen, et al.
Publicado: (2024)
por: Zhao, Bowen, et al.
Publicado: (2024)
What Does the Bot Say? Opportunities and Risks of Large Language Models in Social Media Bot Detection
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Knowledge Card: Filling LLMs' Knowledge Gaps with Plug-in Specialized Language Models
por: Feng, Shangbin, et al.
Publicado: (2023)
por: Feng, Shangbin, et al.
Publicado: (2023)
Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback
por: Miranda, Lester James V., et al.
Publicado: (2024)
por: Miranda, Lester James V., et al.
Publicado: (2024)
Can Language Models Solve Graph Problems in Natural Language?
por: Wang, Heng, et al.
Publicado: (2023)
por: Wang, Heng, et al.
Publicado: (2023)
Cold-Start Personalization via Training-Free Priors from Structured World Models
por: Bose, Avinandan, et al.
Publicado: (2026)
por: Bose, Avinandan, et al.
Publicado: (2026)
Varying Shades of Wrong: Aligning LLMs with Wrong Answers Only
por: Yao, Jihan, et al.
Publicado: (2024)
por: Yao, Jihan, et al.
Publicado: (2024)
DELL: Generating Reactions and Explanations for LLM-Based Misinformation Detection
por: Wan, Herun, et al.
Publicado: (2024)
por: Wan, Herun, et al.
Publicado: (2024)
GuessBench: Sensemaking Multimodal Creativity in the Wild
por: Zhu, Zifeng, et al.
Publicado: (2025)
por: Zhu, Zifeng, et al.
Publicado: (2025)
MatFormer: Nested Transformer for Elastic Inference
por: Devvrit, et al.
Publicado: (2023)
por: Devvrit, et al.
Publicado: (2023)
RewardBench 2: Advancing Reward Model Evaluation
por: Malik, Saumya, et al.
Publicado: (2025)
por: Malik, Saumya, et al.
Publicado: (2025)
PrefDisco: Benchmarking Proactive Personalized Reasoning
por: Li, Shuyue Stella, et al.
Publicado: (2025)
por: Li, Shuyue Stella, et al.
Publicado: (2025)
David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs
por: Han, Xiaochuang, et al.
Publicado: (2023)
por: Han, Xiaochuang, et al.
Publicado: (2023)
FACTS&EVIDENCE: An Interactive Tool for Transparent Fine-Grained Factual Verification of Machine-Generated Text
por: Boonsanong, Varich, et al.
Publicado: (2025)
por: Boonsanong, Varich, et al.
Publicado: (2025)
KGQuiz: Evaluating the Generalization of Encoded Knowledge in Large Language Models
por: Bai, Yuyang, et al.
Publicado: (2023)
por: Bai, Yuyang, et al.
Publicado: (2023)
Model Swarms: Collaborative Search to Adapt LLM Experts via Swarm Intelligence
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Know Your Limits: A Survey of Abstention in Large Language Models
por: Wen, Bingbing, et al.
Publicado: (2024)
por: Wen, Bingbing, et al.
Publicado: (2024)
Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration
por: Feng, Shangbin, et al.
Publicado: (2024)
por: Feng, Shangbin, et al.
Publicado: (2024)
Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
por: Jung, Jaehun, et al.
Publicado: (2024)
por: Jung, Jaehun, et al.
Publicado: (2024)
Heterogeneous Swarms: Jointly Optimizing Model Roles and Weights for Multi-LLM Systems
por: Feng, Shangbin, et al.
Publicado: (2025)
por: Feng, Shangbin, et al.
Publicado: (2025)
EvalTree: Profiling Language Model Weaknesses via Hierarchical Capability Trees
por: Zeng, Zhiyuan, et al.
Publicado: (2025)
por: Zeng, Zhiyuan, et al.
Publicado: (2025)
Knowledge Crosswords: Geometric Knowledge Reasoning with Large Language Models
por: Ding, Wenxuan, et al.
Publicado: (2023)
por: Ding, Wenxuan, et al.
Publicado: (2023)
Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment
por: Zhang, Yizhuo, et al.
Publicado: (2025)
por: Zhang, Yizhuo, et al.
Publicado: (2025)
Ejemplares similares
-
MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning
por: Wang, Haojin, et al.
Publicado: (2026) -
ScienceMeter: Tracking Scientific Knowledge Updates in Language Models
por: Wang, Yike, et al.
Publicado: (2025) -
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
por: Chen, Tong, et al.
Publicado: (2025) -
Data Swarms: Optimizable Generation of Synthetic Evaluation Data
por: Feng, Shangbin, et al.
Publicado: (2025) -
Don't Hallucinate, Abstain: Identifying LLM Knowledge Gaps via Multi-LLM Collaboration
por: Feng, Shangbin, et al.
Publicado: (2024)