Guardado en:
| Autores principales: | Chen, Changyu, Liu, Zichen, Du, Chao, Pang, Tianyu, Liu, Qian, Sinha, Arunesh, Varakantham, Pradeep, Lin, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2406.09760 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
por: Ge, Zichang, et al.
Publicado: (2025)
por: Ge, Zichang, et al.
Publicado: (2025)
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
por: Luo, Renjie, et al.
Publicado: (2025)
por: Luo, Renjie, et al.
Publicado: (2025)
Towards Neural Network based Cognitive Models of Dynamic Decision-Making by Humans
por: Chen, Changyu, et al.
Publicado: (2024)
por: Chen, Changyu, et al.
Publicado: (2024)
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024)
por: Lu, Yuxiao, et al.
Publicado: (2024)
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
por: Lu, Yuxiao, et al.
Publicado: (2023)
por: Lu, Yuxiao, et al.
Publicado: (2023)
Automatic LLM Red Teaming
por: Belaire, Roman, et al.
Publicado: (2025)
por: Belaire, Roman, et al.
Publicado: (2025)
On Minimizing Adversarial Counterfactual Error in Adversarial RL
por: Belaire, Roman, et al.
Publicado: (2024)
por: Belaire, Roman, et al.
Publicado: (2024)
Understanding R1-Zero-Like Training: A Critical Perspective
por: Liu, Zichen, et al.
Publicado: (2025)
por: Liu, Zichen, et al.
Publicado: (2025)
Sample-Efficient Alignment for LLMs
por: Liu, Zichen, et al.
Publicado: (2024)
por: Liu, Zichen, et al.
Publicado: (2024)
Variational Reasoning for Language Models
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
Purifying Large Language Models by Ensembling a Small Language Model
por: Li, Tianlin, et al.
Publicado: (2024)
por: Li, Tianlin, et al.
Publicado: (2024)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization
por: Qi, Penghui, et al.
Publicado: (2025)
por: Qi, Penghui, et al.
Publicado: (2025)
Improved Few-Shot Jailbreaking Can Circumvent Aligned Language Models and Their Defenses
por: Zheng, Xiaosen, et al.
Publicado: (2024)
por: Zheng, Xiaosen, et al.
Publicado: (2024)
Test-Time Backdoor Attacks on Multimodal Large Language Models
por: Lu, Dong, et al.
Publicado: (2024)
por: Lu, Dong, et al.
Publicado: (2024)
When Attention Sink Emerges in Language Models: An Empirical View
por: Gu, Xiangming, et al.
Publicado: (2024)
por: Gu, Xiangming, et al.
Publicado: (2024)
Induced Numerical Instability: Hidden Costs in Multimodal Large Language Models
por: Wong, Wai Tuck, et al.
Publicado: (2026)
por: Wong, Wai Tuck, et al.
Publicado: (2026)
Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs
por: Zhang, Xuan, et al.
Publicado: (2024)
por: Zhang, Xuan, et al.
Publicado: (2024)
Improving Your Model Ranking on Chatbot Arena by Vote Rigging
por: Min, Rui, et al.
Publicado: (2025)
por: Min, Rui, et al.
Publicado: (2025)
Defeating the Training-Inference Mismatch via FP16
por: Qi, Penghui, et al.
Publicado: (2025)
por: Qi, Penghui, et al.
Publicado: (2025)
A Closer Look at Machine Unlearning for Large Language Models
por: Yuan, Xiaojian, et al.
Publicado: (2024)
por: Yuan, Xiaojian, et al.
Publicado: (2024)
Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates
por: Zheng, Xiaosen, et al.
Publicado: (2024)
por: Zheng, Xiaosen, et al.
Publicado: (2024)
Reinforcing General Reasoning without Verifiers
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap
por: Qi, Xuan, et al.
Publicado: (2025)
por: Qi, Xuan, et al.
Publicado: (2025)
Implicit Reward as the Bridge: A Unified View of SFT and DPO Connections
por: Wang, Bo, et al.
Publicado: (2025)
por: Wang, Bo, et al.
Publicado: (2025)
Scaling up Masked Diffusion Models on Text
por: Nie, Shen, et al.
Publicado: (2024)
por: Nie, Shen, et al.
Publicado: (2024)
Improved Techniques for Optimization-Based Jailbreaking on Large Language Models
por: Jia, Xiaojun, et al.
Publicado: (2024)
por: Jia, Xiaojun, et al.
Publicado: (2024)
Scalable Token-Level Hallucination Detection in Large Language Models
por: Min, Rui, et al.
Publicado: (2026)
por: Min, Rui, et al.
Publicado: (2026)
Lifelong Safety Alignment for Language Models
por: Wang, Haoyu, et al.
Publicado: (2025)
por: Wang, Haoyu, et al.
Publicado: (2025)
Training Optimal Large Diffusion Language Models
por: Ni, Jinjie, et al.
Publicado: (2025)
por: Ni, Jinjie, et al.
Publicado: (2025)
UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function
por: Wang, Zhichao, et al.
Publicado: (2024)
por: Wang, Zhichao, et al.
Publicado: (2024)
LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation
por: Zhang, Xuan, et al.
Publicado: (2024)
por: Zhang, Xuan, et al.
Publicado: (2024)
Meta-Unlearning on Diffusion Models: Preventing Relearning Unlearned Concepts
por: Gao, Hongcheng, et al.
Publicado: (2024)
por: Gao, Hongcheng, et al.
Publicado: (2024)
Why is Your Language Model a Poor Implicit Reward Model?
por: Razin, Noam, et al.
Publicado: (2025)
por: Razin, Noam, et al.
Publicado: (2025)
Benchmarking Large Multimodal Models against Common Corruptions
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
DavIR: Data Selection via Implicit Reward for Large Language Models
por: Zhou, Haotian, et al.
Publicado: (2023)
por: Zhou, Haotian, et al.
Publicado: (2023)
Heterogeneous Graph Generation: A Hierarchical Approach using Node Feature Pooling
por: Ghosh, Hritaban, et al.
Publicado: (2024)
por: Ghosh, Hritaban, et al.
Publicado: (2024)
Process Reinforcement through Implicit Rewards
por: Cui, Ganqu, et al.
Publicado: (2025)
por: Cui, Ganqu, et al.
Publicado: (2025)
Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast
por: Gu, Xiangming, et al.
Publicado: (2024)
por: Gu, Xiangming, et al.
Publicado: (2024)
GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA
por: Wang, Zhichao
Publicado: (2025)
por: Wang, Zhichao
Publicado: (2025)
Self-Generated Critiques Boost Reward Modeling for Language Models
por: Yu, Yue, et al.
Publicado: (2024)
por: Yu, Yue, et al.
Publicado: (2024)
Ejemplares similares
-
On Learning Informative Trajectory Embeddings for Imitation, Classification and Regression
por: Ge, Zichang, et al.
Publicado: (2025) -
Language Models Can Learn from Verbal Feedback Without Scalar Rewards
por: Luo, Renjie, et al.
Publicado: (2025) -
Towards Neural Network based Cognitive Models of Dynamic Decision-Making by Humans
por: Chen, Changyu, et al.
Publicado: (2024) -
Semantic Loss Guided Data Efficient Supervised Fine Tuning for Safe Responses in LLMs
por: Lu, Yuxiao, et al.
Publicado: (2024) -
Handling Long and Richly Constrained Tasks through Constrained Hierarchical Reinforcement Learning
por: Lu, Yuxiao, et al.
Publicado: (2023)