Proxy-RLHF: Decoupling Generation and Alignment in Large Language Model with Proxy
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Yu, Sun, Chuxiong, Yang, Wenfei, Wei, Wenqiang, Tang, Bo, Zhang, Tianzhu, Li, Zhiyu, Zhang, Shifeng, Xiong, Feiyu, Hu, Jie, yang, Mingchuan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2025)
di: Zhang, Yang, et al.
Pubblicazione: (2025)
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
di: Tan, Chenkun, et al.
Pubblicazione: (2025)
di: Tan, Chenkun, et al.
Pubblicazione: (2025)
Attention Heads of Large Language Models: A Survey
di: Zheng, Zifan, et al.
Pubblicazione: (2024)
di: Zheng, Zifan, et al.
Pubblicazione: (2024)
Adversarial Preference Learning for Robust LLM Alignment
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
di: Wang, Yuanfu, et al.
Pubblicazione: (2025)
Learning Shape-Independent Transformation via Spherical Representations for Category-Level Object Pose Estimation
di: Ren, Huan, et al.
Pubblicazione: (2025)
di: Ren, Huan, et al.
Pubblicazione: (2025)
Federated Graph Learning with Structure Proxy Alignment
di: Fu, Xingbo, et al.
Pubblicazione: (2024)
di: Fu, Xingbo, et al.
Pubblicazione: (2024)
PACO: Proxy-Task Alignment and Online Calibration for On-the-Fly Category Discovery
di: Tang, Weidong, et al.
Pubblicazione: (2026)
di: Tang, Weidong, et al.
Pubblicazione: (2026)
Rethinking the Role of Proxy Rewards in Language Model Alignment
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
di: Kim, Sungdong, et al.
Pubblicazione: (2024)
Controlled Text Generation for Large Language Model with Dynamic Attribute Graphs
di: Liang, Xun, et al.
Pubblicazione: (2024)
di: Liang, Xun, et al.
Pubblicazione: (2024)
Structure-Aware Correspondence Learning for Relative Pose Estimation
di: Chen, Yihan, et al.
Pubblicazione: (2025)
di: Chen, Yihan, et al.
Pubblicazione: (2025)
ProxyImg: Towards Highly-Controllable Image Representation via Hierarchical Disentangled Proxy Embedding
di: Chen, Ye, et al.
Pubblicazione: (2026)
di: Chen, Ye, et al.
Pubblicazione: (2026)
TAdaRAG: Task Adaptive Retrieval-Augmented Generation via On-the-Fly Knowledge Graph Construction
di: Zhang, Jie, et al.
Pubblicazione: (2025)
di: Zhang, Jie, et al.
Pubblicazione: (2025)
Proxy Denoising for Source-Free Domain Adaptation
di: Tang, Song, et al.
Pubblicazione: (2024)
di: Tang, Song, et al.
Pubblicazione: (2024)
DiffProxy: Multi-View Human Mesh Recovery via Diffusion-Generated Dense Proxies
di: Wang, Renke, et al.
Pubblicazione: (2026)
di: Wang, Renke, et al.
Pubblicazione: (2026)
ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference
di: Li, Junjie, et al.
Pubblicazione: (2026)
di: Li, Junjie, et al.
Pubblicazione: (2026)
ProxyCLIP: Proxy Attention Improves CLIP for Open-Vocabulary Segmentation
di: Lan, Mengcheng, et al.
Pubblicazione: (2024)
di: Lan, Mengcheng, et al.
Pubblicazione: (2024)
OptiProxy-NAS: Optimization Proxy based End-to-End Neural Architecture Search
di: Lyu, Bo, et al.
Pubblicazione: (2025)
di: Lyu, Bo, et al.
Pubblicazione: (2025)
Mitigating the Alignment Tax of RLHF
di: Lin, Yong, et al.
Pubblicazione: (2023)
di: Lin, Yong, et al.
Pubblicazione: (2023)
Tuning Language Models by Proxy
di: Liu, Alisa, et al.
Pubblicazione: (2024)
di: Liu, Alisa, et al.
Pubblicazione: (2024)
Proxy Compression for Language Modeling
di: Zheng, Lin, et al.
Pubblicazione: (2026)
di: Zheng, Lin, et al.
Pubblicazione: (2026)
Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting
di: Huang, Chen, et al.
Pubblicazione: (2025)
di: Huang, Chen, et al.
Pubblicazione: (2025)
ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation
di: Mei, Zhiyu, et al.
Pubblicazione: (2024)
di: Mei, Zhiyu, et al.
Pubblicazione: (2024)
ProxyLM: Predicting Language Model Performance on Multilingual Tasks via Proxy Models
di: Anugraha, David, et al.
Pubblicazione: (2024)
di: Anugraha, David, et al.
Pubblicazione: (2024)
Proxy Robustness in Vision Language Models is Effortlessly Transferable
di: Fu, Xiaowei, et al.
Pubblicazione: (2026)
di: Fu, Xiaowei, et al.
Pubblicazione: (2026)
Unifying Visual and Vision-Language Tracking via Contrastive Learning
di: Ma, Yinchao, et al.
Pubblicazione: (2024)
di: Ma, Yinchao, et al.
Pubblicazione: (2024)
On the Rejection Criterion for Proxy-based Test-time Alignment
di: Hammal, Ayoub, et al.
Pubblicazione: (2026)
di: Hammal, Ayoub, et al.
Pubblicazione: (2026)
Grimoire is All You Need for Enhancing Large Language Models
di: Chen, Ding, et al.
Pubblicazione: (2024)
di: Chen, Ding, et al.
Pubblicazione: (2024)
Empire’s Proxy
di: Wesling, Meg
Pubblicazione: (2024)
di: Wesling, Meg
Pubblicazione: (2024)
xFinder: Large Language Models as Automated Evaluators for Reliable Evaluation
di: Yu, Qingchen, et al.
Pubblicazione: (2024)
di: Yu, Qingchen, et al.
Pubblicazione: (2024)
Talking to the brain: Using Large Language Models as Proxies to Model Brain Semantic Representation
di: Liu, Xin, et al.
Pubblicazione: (2025)
di: Liu, Xin, et al.
Pubblicazione: (2025)
Large Language Models as Proxies for Theories of Human Linguistic Cognition
di: Ziv, Imry, et al.
Pubblicazione: (2025)
di: Ziv, Imry, et al.
Pubblicazione: (2025)
Gradient-Weight Alignment as a Train-Time Proxy for Generalization in Classification Tasks
di: Hölzl, Florian A., et al.
Pubblicazione: (2025)
di: Hölzl, Florian A., et al.
Pubblicazione: (2025)
FedPT: Federated Proxy-Tuning of Large Language Models on Resource-Constrained Edge Devices
di: Gao, Zhidong, et al.
Pubblicazione: (2024)
di: Gao, Zhidong, et al.
Pubblicazione: (2024)
Synthesizing Proxy Applications for MPI Programs
di: Luo, Jiyu, et al.
Pubblicazione: (2023)
di: Luo, Jiyu, et al.
Pubblicazione: (2023)
Memory Proxy Maps for Visual Navigation
di: Johnson, Faith, et al.
Pubblicazione: (2024)
di: Johnson, Faith, et al.
Pubblicazione: (2024)
Generating In-Distribution Proxy Graphs for Explaining Graph Neural Networks
di: Chen, Zhuomin, et al.
Pubblicazione: (2024)
di: Chen, Zhuomin, et al.
Pubblicazione: (2024)
Omnimodal Dataset Distillation via High-order Proxy Alignment
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
RLHF Workflow: From Reward Modeling to Online RLHF
di: Dong, Hanze, et al.
Pubblicazione: (2024)
di: Dong, Hanze, et al.
Pubblicazione: (2024)
GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers
di: Song, Zhiye, et al.
Pubblicazione: (2025)
di: Song, Zhiye, et al.
Pubblicazione: (2025)
Multi-modal Attribute Prompting for Vision-Language Models
di: Liu, Xin, et al.
Pubblicazione: (2024)
di: Liu, Xin, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
di: Zhang, Yang, et al.
Pubblicazione: (2025) -
Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM
di: Tan, Chenkun, et al.
Pubblicazione: (2025) -
Attention Heads of Large Language Models: A Survey
di: Zheng, Zifan, et al.
Pubblicazione: (2024) -
Adversarial Preference Learning for Robust LLM Alignment
di: Wang, Yuanfu, et al.
Pubblicazione: (2025) -
Learning Shape-Independent Transformation via Spherical Representations for Category-Level Object Pose Estimation
di: Ren, Huan, et al.
Pubblicazione: (2025)