Enregistré dans:
| Auteurs principaux: | Zheng, Chen, Sun, Ke, Zhou, Xun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2406.08657 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Balancing Enhancement, Harmlessness, and General Capabilities: Enhancing Conversational LLMs with Direct RLHF
par: Zheng, Chen, et autres
Publié: (2024)
par: Zheng, Chen, et autres
Publié: (2024)
Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
par: Zheng, Chen, et autres
Publié: (2025)
par: Zheng, Chen, et autres
Publié: (2025)
C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
par: Luo, Miaosen, et autres
Publié: (2026)
par: Luo, Miaosen, et autres
Publié: (2026)
ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers
par: Zheng, Chen, et autres
Publié: (2024)
par: Zheng, Chen, et autres
Publié: (2024)
Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation
par: Kyslyi, Roman, et autres
Publié: (2025)
par: Kyslyi, Roman, et autres
Publié: (2025)
Mistral-SPLADE: LLMs for better Learned Sparse Retrieval
par: Doshi, Meet, et autres
Publié: (2024)
par: Doshi, Meet, et autres
Publié: (2024)
Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA
par: Zheng, Yuanlei, et autres
Publié: (2026)
par: Zheng, Yuanlei, et autres
Publié: (2026)
MAgICoRe: Multi-Agent, Iterative, Coarse-to-Fine Refinement for Reasoning
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
par: Chen, Justin Chih-Yao, et autres
Publié: (2024)
CFSP: An Efficient Structured Pruning Framework for LLMs with Coarse-to-Fine Activation Information
par: Wang, Yuxin, et autres
Publié: (2024)
par: Wang, Yuxin, et autres
Publié: (2024)
Taming Overconfidence in LLMs: Reward Calibration in RLHF
par: Leng, Jixuan, et autres
Publié: (2024)
par: Leng, Jixuan, et autres
Publié: (2024)
Reward-Robust RLHF in LLMs
par: Yan, Yuzi, et autres
Publié: (2024)
par: Yan, Yuzi, et autres
Publié: (2024)
Safeguard Fine-Tuned LLMs Through Pre- and Post-Tuning Model Merging
par: Farn, Hua, et autres
Publié: (2024)
par: Farn, Hua, et autres
Publié: (2024)
CFMS: A Coarse-to-Fine Multimodal Synthesis Framework for Enhanced Tabular Reasoning
par: Huang, Qixian, et autres
Publié: (2026)
par: Huang, Qixian, et autres
Publié: (2026)
The Thinking Spectrum: An Empirical Study of Tunable Reasoning in LLMs through Model Merging
par: Lan, Xiaochong, et autres
Publié: (2025)
par: Lan, Xiaochong, et autres
Publié: (2025)
Joint Enhancement of Relational Reasoning for Long-Context LLMs
par: Chen, Zhirui, et autres
Publié: (2025)
par: Chen, Zhirui, et autres
Publié: (2025)
PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference
par: Ji, Jiaming, et autres
Publié: (2024)
par: Ji, Jiaming, et autres
Publié: (2024)
Continual SFT Matches Multimodal RLHF with Negative Supervision
par: Zhu, Ke, et autres
Publié: (2024)
par: Zhu, Ke, et autres
Publié: (2024)
ReasonAny: Incorporating Reasoning Capability to Any Model via Simple and Effective Model Merging
par: Yang, Junyao, et autres
Publié: (2026)
par: Yang, Junyao, et autres
Publié: (2026)
Linq-Embed-Mistral Technical Report
par: Choi, Chanyeol, et autres
Publié: (2024)
par: Choi, Chanyeol, et autres
Publié: (2024)
MolReasoner: Toward Effective and Interpretable Reasoning for Molecular LLMs
par: Zhao, Guojiang, et autres
Publié: (2025)
par: Zhao, Guojiang, et autres
Publié: (2025)
Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution
par: Xu, Nuo, et autres
Publié: (2024)
par: Xu, Nuo, et autres
Publié: (2024)
From Bytes to Borsch: Fine-Tuning Gemma and Mistral for the Ukrainian Language Representation
par: Kiulian, Artur, et autres
Publié: (2024)
par: Kiulian, Artur, et autres
Publié: (2024)
TinyThinker: Distilling Reasoning through Coarse-to-Fine Knowledge Internalization with Self-Reflection
par: Piao, Shengmin, et autres
Publié: (2024)
par: Piao, Shengmin, et autres
Publié: (2024)
Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks
par: Wang, Zheng, et autres
Publié: (2024)
par: Wang, Zheng, et autres
Publié: (2024)
Removing RLHF Protections in GPT-4 via Fine-Tuning
par: Zhan, Qiusi, et autres
Publié: (2023)
par: Zhan, Qiusi, et autres
Publié: (2023)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
par: Yu, Tianyu, et autres
Publié: (2023)
par: Yu, Tianyu, et autres
Publié: (2023)
Putting on the Thinking Hats: A Survey on Chain of Thought Fine-tuning from the Perspective of Human Reasoning Mechanism
par: Chen, Xiaoshu, et autres
Publié: (2025)
par: Chen, Xiaoshu, et autres
Publié: (2025)
Harnessing RLHF for Robust Unanswerability Recognition and Trustworthy Response Generation in LLMs
par: Lin, Shuyuan, et autres
Publié: (2025)
par: Lin, Shuyuan, et autres
Publié: (2025)
RLHF Workflow: From Reward Modeling to Online RLHF
par: Dong, Hanze, et autres
Publié: (2024)
par: Dong, Hanze, et autres
Publié: (2024)
Towards Federated RLHF with Aggregated Client Preference for LLMs
par: Wu, Feijie, et autres
Publié: (2024)
par: Wu, Feijie, et autres
Publié: (2024)
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
par: He, Bowei, et autres
Publié: (2026)
par: He, Bowei, et autres
Publié: (2026)
Coarse-to-Fine Personalized LLM Impressions for Streamlined Radiology Reports
par: Sun, Chengbo, et autres
Publié: (2025)
par: Sun, Chengbo, et autres
Publié: (2025)
Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model
par: Yin, Yueqin, et autres
Publié: (2025)
par: Yin, Yueqin, et autres
Publié: (2025)
Actor Identification in Discourse: A Challenge for LLMs?
par: Barić, Ana, et autres
Publié: (2024)
par: Barić, Ana, et autres
Publié: (2024)
Multilevel Analysis of Cryptocurrency News using RAG Approach with Fine-Tuned Mistral Large Language Model
par: Pavlyshenko, Bohdan M.
Publié: (2025)
par: Pavlyshenko, Bohdan M.
Publié: (2025)
Reasoning Pattern Alignment Merging for Adaptive Reasoning
par: Zhong, Zhaofeng, et autres
Publié: (2026)
par: Zhong, Zhaofeng, et autres
Publié: (2026)
Effective Distillation of Table-based Reasoning Ability from LLMs
par: Yang, Bohao, et autres
Publié: (2023)
par: Yang, Bohao, et autres
Publié: (2023)
Fovea Transformer: Efficient Long-Context Modeling with Structured Fine-to-Coarse Attention
par: He, Ziwei, et autres
Publié: (2023)
par: He, Ziwei, et autres
Publié: (2023)
Document-Level Tabular Numerical Cross-Checking: A Coarse-to-Fine Approach
par: Pang, Chaoxu, et autres
Publié: (2025)
par: Pang, Chaoxu, et autres
Publié: (2025)
Adaptive Graph Refinement and Label Propagation with LLMs for Cost-Effective Entity Resolution
par: Wang, Hongtao, et autres
Publié: (2026)
par: Wang, Hongtao, et autres
Publié: (2026)
Documents similaires
-
Balancing Enhancement, Harmlessness, and General Capabilities: Enhancing Conversational LLMs with Direct RLHF
par: Zheng, Chen, et autres
Publié: (2024) -
Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models
par: Zheng, Chen, et autres
Publié: (2025) -
C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis
par: Luo, Miaosen, et autres
Publié: (2026) -
ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers
par: Zheng, Chen, et autres
Publié: (2024) -
Vuyko Mistral: Adapting LLMs for Low-Resource Dialectal Translation
par: Kyslyi, Roman, et autres
Publié: (2025)