LLMdoctor: Token-Level Flow-Guided Preference Optimization for Efficient Test-Time Alignment of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Shen, Tiesunlong, Mao, Rui, Wang, Jin, Sun, Heming, Zhang, Jian, Zhang, Xuejie, Cambria, Erik |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Affective Flow Language Model for Emotional Support Conversation
di: Zou, Chenghui, et al.
Pubblicazione: (2026)
di: Zou, Chenghui, et al.
Pubblicazione: (2026)
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
di: Zhang, Mingda, et al.
Pubblicazione: (2026)
A Systematic Analysis of Biases in Large Language Models
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
di: Zhang, Xulang, et al.
Pubblicazione: (2025)
Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
di: Liu, Wenjin, et al.
Pubblicazione: (2025)
di: Liu, Wenjin, et al.
Pubblicazione: (2025)
Token-Level Inference-Time Alignment for Vision-Language Models
di: Chen, Kejia, et al.
Pubblicazione: (2025)
di: Chen, Kejia, et al.
Pubblicazione: (2025)
Individualized Cognitive Simulation in Large Language Models: Evaluating Different Cognitive Representation Methods
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
di: Zhang, Tianyi, et al.
Pubblicazione: (2025)
LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence
di: Liu, Wenjin, et al.
Pubblicazione: (2025)
di: Liu, Wenjin, et al.
Pubblicazione: (2025)
DiffPO: Diffusion-styled Preference Optimization for Efficient Inference-Time Alignment of Large Language Models
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
di: Chen, Ruizhe, et al.
Pubblicazione: (2025)
Token-Importance Guided Direct Preference Optimization
di: Yang, Ning, et al.
Pubblicazione: (2025)
di: Yang, Ning, et al.
Pubblicazione: (2025)
T-REG: Preference Optimization with Token-Level Reward Regularization
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
di: Zhou, Wenxuan, et al.
Pubblicazione: (2024)
Logical Reasoning over Natural Language as Knowledge Representation: A Survey
di: Yang, Zonglin, et al.
Pubblicazione: (2023)
di: Yang, Zonglin, et al.
Pubblicazione: (2023)
SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
ClimaEmpact: Domain-Aligned Small Language Models and Datasets for Extreme Weather Analytics
di: Varshney, Deeksha, et al.
Pubblicazione: (2025)
di: Varshney, Deeksha, et al.
Pubblicazione: (2025)
A Comprehensive Graph Framework for Question Answering with Mode-Seeking Preference Alignment
di: Tang, Quanwei, et al.
Pubblicazione: (2025)
di: Tang, Quanwei, et al.
Pubblicazione: (2025)
Deriving Strategic Market Insights with Large Language Models: A Benchmark for Forward Counterfactual Generation
di: Ong, Keane, et al.
Pubblicazione: (2025)
di: Ong, Keane, et al.
Pubblicazione: (2025)
GPTEval: A Survey on Assessments of ChatGPT and GPT-4
di: Mao, Rui, et al.
Pubblicazione: (2023)
di: Mao, Rui, et al.
Pubblicazione: (2023)
Steerable Adversarial Scenario Generation through Test-Time Preference Alignment
di: Nie, Tong, et al.
Pubblicazione: (2025)
di: Nie, Tong, et al.
Pubblicazione: (2025)
Chinese Metaphor Recognition Using a Multi-stage Prompting Large Language Model
di: Wang, Jie, et al.
Pubblicazione: (2024)
di: Wang, Jie, et al.
Pubblicazione: (2024)
Enhancing Language Models for Robust Greenwashing Detection
di: Braun, Neil Heinrich, et al.
Pubblicazione: (2026)
di: Braun, Neil Heinrich, et al.
Pubblicazione: (2026)
A Survey of Large Language Models for Healthcare: from Data, Technology, and Applications to Accountability and Ethics
di: He, Kai, et al.
Pubblicazione: (2023)
di: He, Kai, et al.
Pubblicazione: (2023)
On-the-fly Preference Alignment via Principle-Guided Decoding
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
di: Zhang, Huatian, et al.
Pubblicazione: (2026)
Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models
di: Yeo, Wei Jie, et al.
Pubblicazione: (2024)
di: Yeo, Wei Jie, et al.
Pubblicazione: (2024)
Sample-aware Adaptive Structured Pruning for Large Language Models
di: Kong, Jun, et al.
Pubblicazione: (2025)
di: Kong, Jun, et al.
Pubblicazione: (2025)
Accelerated Preference Optimization for Large Language Model Alignment
di: He, Jiafan, et al.
Pubblicazione: (2024)
di: He, Jiafan, et al.
Pubblicazione: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
Modality-Fair Preference Optimization for Trustworthy MLLM Alignment
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
di: Jiang, Songtao, et al.
Pubblicazione: (2024)
Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs
di: Zhang, Zhaowei, et al.
Pubblicazione: (2025)
di: Zhang, Zhaowei, et al.
Pubblicazione: (2025)
Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data
di: Xia, Han, et al.
Pubblicazione: (2024)
di: Xia, Han, et al.
Pubblicazione: (2024)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
di: Luo, Xiang, et al.
Pubblicazione: (2024)
di: Luo, Xiang, et al.
Pubblicazione: (2024)
Bridging Minds and Machines: Toward an Integration of AI and Cognitive Science
di: Mao, Rui, et al.
Pubblicazione: (2025)
di: Mao, Rui, et al.
Pubblicazione: (2025)
Towards Robust ESG Analysis Against Greenwashing Risks: Aspect-Action Analysis with Cross-Category Generalization
di: Ong, Keane, et al.
Pubblicazione: (2025)
di: Ong, Keane, et al.
Pubblicazione: (2025)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
di: Pi, Renjie, et al.
Pubblicazione: (2024)
di: Pi, Renjie, et al.
Pubblicazione: (2024)
IIMedGPT: Promoting Large Language Model Capabilities of Medical Tasks by Efficient Human Preference Alignment
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
di: Zhang, Yiming, et al.
Pubblicazione: (2025)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
di: Nguyen, Truong, et al.
Pubblicazione: (2026)
di: Nguyen, Truong, et al.
Pubblicazione: (2026)
Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback
di: Li, Yafu, et al.
Pubblicazione: (2025)
di: Li, Yafu, et al.
Pubblicazione: (2025)
Large Language Models for Few-Shot Named Entity Recognition
di: Zhao, Yufei, et al.
Pubblicazione: (2018)
di: Zhao, Yufei, et al.
Pubblicazione: (2018)
Guided Speculative Inference for Efficient Test-Time Alignment of LLMs
di: Geuter, Jonathan, et al.
Pubblicazione: (2025)
di: Geuter, Jonathan, et al.
Pubblicazione: (2025)
Preference Packing: Efficient Preference Optimization for Large Language Models
di: Cho, Jaekyung
Pubblicazione: (2026)
di: Cho, Jaekyung
Pubblicazione: (2026)
Documenti analoghi
-
Affective Flow Language Model for Emotional Support Conversation
di: Zou, Chenghui, et al.
Pubblicazione: (2026) -
FlowSteer: Towards Agents Designing Agentic Workflows via Reinforced Progressive Canvas Editing
di: Zhang, Mingda, et al.
Pubblicazione: (2026) -
SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration
di: Zhang, Mingda, et al.
Pubblicazione: (2026) -
A Systematic Analysis of Biases in Large Language Models
di: Zhang, Xulang, et al.
Pubblicazione: (2025) -
Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning
di: Liu, Wenjin, et al.
Pubblicazione: (2025)