DavIR: Data Selection via Implicit Reward for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Haotian, Liu, Tingkai, Ma, Qianli, Zhang, Yufeng, Yuan, Jianbo, Liu, Pengfei, You, Yang, Yang, Hongxia |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
por: Gu, Yanggan, et al.
Publicado: (2025)
por: Gu, Yanggan, et al.
Publicado: (2025)
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
por: Wang, Xuwu, et al.
Publicado: (2024)
por: Wang, Xuwu, et al.
Publicado: (2024)
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
por: Wang, Yiqi, et al.
Publicado: (2024)
por: Wang, Yiqi, et al.
Publicado: (2024)
Bootstrapping Language Models with DPO Implicit Rewards
por: Chen, Changyu, et al.
Publicado: (2024)
por: Chen, Changyu, et al.
Publicado: (2024)
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
por: Liu, Tingkai, et al.
Publicado: (2025)
por: Liu, Tingkai, et al.
Publicado: (2025)
ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment
por: Wang, Hao, et al.
Publicado: (2026)
por: Wang, Hao, et al.
Publicado: (2026)
Self-Infilling Code Generation
por: Zheng, Lin, et al.
Publicado: (2023)
por: Zheng, Lin, et al.
Publicado: (2023)
LLMCRIT: Teaching Large Language Models to Use Criteria
por: Yuan, Weizhe, et al.
Publicado: (2024)
por: Yuan, Weizhe, et al.
Publicado: (2024)
AddrLLM: Address Rewriting via Large Language Model on Nationwide Logistics Data
por: Yang, Qinchen, et al.
Publicado: (2024)
por: Yang, Qinchen, et al.
Publicado: (2024)
Generalist Reward Models: Found Inside Large Language Models
por: Li, Yi-Chen, et al.
Publicado: (2025)
por: Li, Yi-Chen, et al.
Publicado: (2025)
Entropy-Based Data Selection for Language Models
por: Li, Hongming, et al.
Publicado: (2026)
por: Li, Hongming, et al.
Publicado: (2026)
Discriminative Finetuning of Generative Large Language Models without Reward Models and Human Preference Data
por: Guo, Siqi, et al.
Publicado: (2025)
por: Guo, Siqi, et al.
Publicado: (2025)
Understanding and Mitigating Over-refusal for Large Language Models via Safety Representation
por: Zhang, Junbo, et al.
Publicado: (2025)
por: Zhang, Junbo, et al.
Publicado: (2025)
$\mathbf{(N,K)}$-Puzzle: A Cost-Efficient Testbed for Benchmarking Reinforcement Learning Algorithms in Generative Language Model
por: Zhang, Yufeng, et al.
Publicado: (2024)
por: Zhang, Yufeng, et al.
Publicado: (2024)
Towards Lifelong Learning of Large Language Models: A Survey
por: Zheng, Junhao, et al.
Publicado: (2024)
por: Zheng, Junhao, et al.
Publicado: (2024)
Weighted-Reward Preference Optimization for Implicit Model Fusion
por: Yang, Ziyi, et al.
Publicado: (2024)
por: Yang, Ziyi, et al.
Publicado: (2024)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
por: Xiao, Yisong, et al.
Publicado: (2025)
por: Xiao, Yisong, et al.
Publicado: (2025)
Improving Data and Reward Design for Scientific Reasoning in Large Language Models
por: Chen, Zijie, et al.
Publicado: (2026)
por: Chen, Zijie, et al.
Publicado: (2026)
LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection
por: Wu, Jian, et al.
Publicado: (2025)
por: Wu, Jian, et al.
Publicado: (2025)
Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models
por: Liu, Zeyu, et al.
Publicado: (2025)
por: Liu, Zeyu, et al.
Publicado: (2025)
Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model
por: Liu, Runheng, et al.
Publicado: (2026)
por: Liu, Runheng, et al.
Publicado: (2026)
ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models
por: Yang, Bo, et al.
Publicado: (2026)
por: Yang, Bo, et al.
Publicado: (2026)
Diversity-oriented Data Augmentation with Large Language Models
por: Wang, Zaitian, et al.
Publicado: (2025)
por: Wang, Zaitian, et al.
Publicado: (2025)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
por: Qi, Xuan, et al.
Publicado: (2025)
por: Qi, Xuan, et al.
Publicado: (2025)
Let Models Speak Ciphers: Multiagent Debate through Embeddings
por: Pham, Chau, et al.
Publicado: (2023)
por: Pham, Chau, et al.
Publicado: (2023)
InfiAgent-DABench: Evaluating Agents on Data Analysis Tasks
por: Hu, Xueyu, et al.
Publicado: (2024)
por: Hu, Xueyu, et al.
Publicado: (2024)
Implicit Reasoning in Large Language Models: A Comprehensive Survey
por: Li, Jindong, et al.
Publicado: (2025)
por: Li, Jindong, et al.
Publicado: (2025)
MRO: Enhancing Reasoning in Diffusion Language Models via Multi-Reward Optimization
por: Wang, Chenglong, et al.
Publicado: (2025)
por: Wang, Chenglong, et al.
Publicado: (2025)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
por: Liu, Yihong, et al.
Publicado: (2024)
por: Liu, Yihong, et al.
Publicado: (2024)
Robust Reward Modeling for Large Language Models via Causal Decomposition
por: Lu, Yunsheng, et al.
Publicado: (2026)
por: Lu, Yunsheng, et al.
Publicado: (2026)
CAMEL: Confidence-Gated Reflection for Reward Modeling
por: Zhu, Zirui, et al.
Publicado: (2026)
por: Zhu, Zirui, et al.
Publicado: (2026)
Causal Prompting for Implicit Sentiment Analysis with Large Language Models
por: Ren, Jing, et al.
Publicado: (2025)
por: Ren, Jing, et al.
Publicado: (2025)
Neuron-Aware Data Selection In Instruction Tuning For Large Language Models
por: Chen, Xin, et al.
Publicado: (2026)
por: Chen, Xin, et al.
Publicado: (2026)
Enhancing Large Language Model Reasoning via Selective Critical Token Fine-Tuning
por: Ruan, Zhiwen, et al.
Publicado: (2025)
por: Ruan, Zhiwen, et al.
Publicado: (2025)
RewardDS: Privacy-Preserving Fine-Tuning for Large Language Models via Reward Driven Data Synthesis
por: Wang, Jianwei, et al.
Publicado: (2025)
por: Wang, Jianwei, et al.
Publicado: (2025)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
BeHonest: Benchmarking Honesty in Large Language Models
por: Chern, Steffi, et al.
Publicado: (2024)
por: Chern, Steffi, et al.
Publicado: (2024)
PASER: Post-Training Data Selection for Efficient Pruned Large Language Model Recovery
por: He, Bowei, et al.
Publicado: (2025)
por: He, Bowei, et al.
Publicado: (2025)
Learn or Recall? Revisiting Incremental Learning with Pre-trained Language Models
por: Zheng, Junhao, et al.
Publicado: (2023)
por: Zheng, Junhao, et al.
Publicado: (2023)
Latent Distance Guided Alignment Training for Large Language Models
por: Luo, Haotian
Publicado: (2024)
por: Luo, Haotian
Publicado: (2024)
Ejemplares similares
-
InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
por: Gu, Yanggan, et al.
Publicado: (2025) -
BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data
por: Wang, Xuwu, et al.
Publicado: (2024) -
Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning
por: Wang, Yiqi, et al.
Publicado: (2024) -
Bootstrapping Language Models with DPO Implicit Rewards
por: Chen, Changyu, et al.
Publicado: (2024) -
Token-Level Uncertainty-Aware Objective for Language Model Post-Training
por: Liu, Tingkai, et al.
Publicado: (2025)