Alignment-Enhanced Decoding:Defending via Token-Level Adaptive Refining of Probability Distributions
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Quan, Zhou, Zhenhong, He, Longzhu, Liu, Yi, Zhang, Wei, Su, Sen |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
di: Zhu, Mingye, et al.
Pubblicazione: (2024)
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024)
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025)
di: Hu, Shijing, et al.
Pubblicazione: (2025)
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
di: Wu, Jialiang, et al.
Pubblicazione: (2025)
di: Wu, Jialiang, et al.
Pubblicazione: (2025)
Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings
di: Zhang, Yuanhe, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhe, et al.
Pubblicazione: (2024)
On-the-fly Preference Alignment via Principle-Guided Decoding
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
di: Zhu, Mingye, et al.
Pubblicazione: (2025)
Token-Guard: Towards Token-Level Hallucination Control via Self-Checking Decoding
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
di: Zhu, Yifan, et al.
Pubblicazione: (2026)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
di: Liu, Wei, et al.
Pubblicazione: (2025)
di: Liu, Wei, et al.
Pubblicazione: (2025)
LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models
di: Zhang, Wei, et al.
Pubblicazione: (2026)
di: Zhang, Wei, et al.
Pubblicazione: (2026)
SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
di: Xu, Zhangchen, et al.
Pubblicazione: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
di: Zhang, Songming, et al.
Pubblicazione: (2025)
di: Zhang, Songming, et al.
Pubblicazione: (2025)
Token-Driven GammaTune: Adaptive Calibration for Enhanced Speculative Decoding
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
di: Gautam, Aayush, et al.
Pubblicazione: (2025)
Condor: Enhance LLM Alignment with Knowledge-Driven Data Synthesis and Refinement
di: Cao, Maosong, et al.
Pubblicazione: (2025)
di: Cao, Maosong, et al.
Pubblicazione: (2025)
TPA: Next Token Probability Attribution for Detecting Hallucinations in RAG
di: Lu, Pengqian, et al.
Pubblicazione: (2025)
di: Lu, Pengqian, et al.
Pubblicazione: (2025)
AdaFuse: Adaptive Ensemble Decoding with Test-Time Scaling for LLMs
di: Cui, Chengming, et al.
Pubblicazione: (2026)
di: Cui, Chengming, et al.
Pubblicazione: (2026)
ProFit: Leveraging High-Value Signals in SFT via Probability-Guided Token Selection
di: Liu, Tao, et al.
Pubblicazione: (2026)
di: Liu, Tao, et al.
Pubblicazione: (2026)
Generative Sentiment Analysis via Latent Category Distribution and Constrained Decoding
di: Zhou, Jun, et al.
Pubblicazione: (2024)
di: Zhou, Jun, et al.
Pubblicazione: (2024)
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
di: Zhao, Yinzhi, et al.
Pubblicazione: (2026)
Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimization
di: Duan, Shitong, et al.
Pubblicazione: (2024)
di: Duan, Shitong, et al.
Pubblicazione: (2024)
Token Signature: Predicting Chain-of-Thought Gains with Token Decoding Feature in Large Language Models
di: Liu, Peijie, et al.
Pubblicazione: (2025)
di: Liu, Peijie, et al.
Pubblicazione: (2025)
Evolutionary Guided Decoding: Iterative Value Refinement for LLMs
di: Liu, Zhenhua, et al.
Pubblicazione: (2025)
di: Liu, Zhenhua, et al.
Pubblicazione: (2025)
SEG:Seeds-Enhanced Iterative Refinement Graph Neural Network for Entity Alignment
di: Ai, Wei, et al.
Pubblicazione: (2024)
di: Ai, Wei, et al.
Pubblicazione: (2024)
TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
di: Xiao, Sibo, et al.
Pubblicazione: (2025)
Search-R2: Enhancing Search-Integrated Reasoning via Actor-Refiner Collaboration
di: He, Bowei, et al.
Pubblicazione: (2026)
di: He, Bowei, et al.
Pubblicazione: (2026)
Probabilistic Token Alignment for Large Language Model Fusion
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
di: Zeng, Runjia, et al.
Pubblicazione: (2025)
Alirector: Alignment-Enhanced Chinese Grammatical Error Corrector
di: Yang, Haihui, et al.
Pubblicazione: (2024)
di: Yang, Haihui, et al.
Pubblicazione: (2024)
PAD: Personalized Alignment of LLMs at Decoding-Time
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
di: Chen, Ruizhe, et al.
Pubblicazione: (2024)
Course-Correction: Safety Alignment Using Synthetic Preferences
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
di: Xu, Rongwu, et al.
Pubblicazione: (2024)
Unlocking Recursive Thinking of LLMs: Alignment via Refinement
di: Zhang, Haoke, et al.
Pubblicazione: (2025)
di: Zhang, Haoke, et al.
Pubblicazione: (2025)
Persona-judge: Personalized Alignment of Large Language Models via Token-level Self-judgment
di: Zhang, Xiaotian, et al.
Pubblicazione: (2025)
di: Zhang, Xiaotian, et al.
Pubblicazione: (2025)
Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
di: Zhou, Yuxuan, et al.
Pubblicazione: (2025)
Token Alignment via Character Matching for Subword Completion
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
di: Athiwaratkun, Ben, et al.
Pubblicazione: (2024)
Direct Multi-Token Decoding
di: Luo, Xuan, et al.
Pubblicazione: (2025)
di: Luo, Xuan, et al.
Pubblicazione: (2025)
RefineCoder: Iterative Improving of Large Language Models via Adaptive Critique Refinement for Code Generation
di: Zhou, Changzhi, et al.
Pubblicazione: (2025)
di: Zhou, Changzhi, et al.
Pubblicazione: (2025)
Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models
di: Yao, Jui-Ming, et al.
Pubblicazione: (2025)
di: Yao, Jui-Ming, et al.
Pubblicazione: (2025)
StableMask: Refining Causal Masking in Decoder-only Transformer
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
di: Yin, Qingyu, et al.
Pubblicazione: (2024)
Adaptive Token Biaser: Knowledge Editing via Biasing Key Entities
di: Bi, Baolong, et al.
Pubblicazione: (2024)
di: Bi, Baolong, et al.
Pubblicazione: (2024)
Exploring Multi-Temperature Strategies for Token- and Rollout-Level Control in RLVR
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
di: Zhuang, Haomin, et al.
Pubblicazione: (2025)
TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching
di: Nguyen, Truong, et al.
Pubblicazione: (2026)
di: Nguyen, Truong, et al.
Pubblicazione: (2026)
Language Models can Evaluate Themselves via Probability Discrepancy
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
di: Xia, Tingyu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
FlipGuard: Defending Preference Alignment against Update Regression with Constrained Optimization
di: Zhu, Mingye, et al.
Pubblicazione: (2024) -
Speak Out of Turn: Safety Vulnerability of Large Language Models in Multi-turn Dialogue
di: Zhou, Zhenhong, et al.
Pubblicazione: (2024) -
GRIFFIN: Effective Token Alignment for Faster Speculative Decoding
di: Hu, Shijing, et al.
Pubblicazione: (2025) -
Improve Decoding Factuality by Token-wise Cross Layer Entropy of Large Language Models
di: Wu, Jialiang, et al.
Pubblicazione: (2025) -
Crabs: Consuming Resource via Auto-generation for LLM-DoS Attack under Black-box Settings
di: Zhang, Yuanhe, et al.
Pubblicazione: (2024)