From Lists to Emojis: How Format Bias Affects Model Alignment
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Xuanchang, Xiong, Wei, Chen, Lichang, Zhou, Tianyi, Huang, Heng, Zhang, Tong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
GLaPE: Gold Label-agnostic Prompt Evaluation and Optimization for Large Language Model
por: Zhang, Xuanchang, et al.
Publicado: (2024)
por: Zhang, Xuanchang, et al.
Publicado: (2024)
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
OPTune: Efficient Online Preference Tuning
por: Chen, Lichang, et al.
Publicado: (2024)
por: Chen, Lichang, et al.
Publicado: (2024)
ODIN: Disentangled Reward Mitigates Hacking in RLHF
por: Chen, Lichang, et al.
Publicado: (2024)
por: Chen, Lichang, et al.
Publicado: (2024)
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024)
por: Li, Ming, et al.
Publicado: (2024)
Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection
por: Wei, Zhipeng, et al.
Publicado: (2024)
por: Wei, Zhipeng, et al.
Publicado: (2024)
CodeJudge: Evaluating Code Generation with Large Language Models
por: Tong, Weixi, et al.
Publicado: (2024)
por: Tong, Weixi, et al.
Publicado: (2024)
On the Impact of Language Nuances on Sentiment Analysis with Large Language Models: Paraphrasing, Sarcasm, and Emojis
por: Bhargava, Naman, et al.
Publicado: (2025)
por: Bhargava, Naman, et al.
Publicado: (2025)
Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining
por: Liu, Chenxi, et al.
Publicado: (2025)
por: Liu, Chenxi, et al.
Publicado: (2025)
Automated Alignment of Math Items to Content Standards in Large-Scale Assessments Using Language Models
por: Xu, Qingshu, et al.
Publicado: (2025)
por: Xu, Qingshu, et al.
Publicado: (2025)
Eliminating Position Bias of Language Models: A Mechanistic Approach
por: Wang, Ziqi, et al.
Publicado: (2024)
por: Wang, Ziqi, et al.
Publicado: (2024)
RLHF Workflow: From Reward Modeling to Online RLHF
por: Dong, Hanze, et al.
Publicado: (2024)
por: Dong, Hanze, et al.
Publicado: (2024)
How Does Quantization Affect Multilingual LLMs?
por: Marchisio, Kelly, et al.
Publicado: (2024)
por: Marchisio, Kelly, et al.
Publicado: (2024)
Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
How Abilities in Large Language Models are Affected by Supervised Fine-tuning Data Composition
por: Dong, Guanting, et al.
Publicado: (2023)
por: Dong, Guanting, et al.
Publicado: (2023)
Emoji Driven Crypto Assets Market Reactions
por: Zuo, Xiaorui, et al.
Publicado: (2024)
por: Zuo, Xiaorui, et al.
Publicado: (2024)
Model Extrapolation Expedites Alignment
por: Zheng, Chujie, et al.
Publicado: (2024)
por: Zheng, Chujie, et al.
Publicado: (2024)
AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation
por: Zhang, Songming, et al.
Publicado: (2025)
por: Zhang, Songming, et al.
Publicado: (2025)
Collaborate, Deliberate, Evaluate: How LLM Alignment Affects Coordinated Multi-Agent Outcomes
por: Nath, Abhijnan, et al.
Publicado: (2025)
por: Nath, Abhijnan, et al.
Publicado: (2025)
How Quantization Shapes Bias in Large Language Models
por: Marcuzzi, Federico, et al.
Publicado: (2025)
por: Marcuzzi, Federico, et al.
Publicado: (2025)
How Does Code Pretraining Affect Language Model Task Performance?
por: Petty, Jackson, et al.
Publicado: (2024)
por: Petty, Jackson, et al.
Publicado: (2024)
Representative Social Choice: From Learning Theory to AI Alignment
por: Qiu, Tianyi
Publicado: (2024)
por: Qiu, Tianyi
Publicado: (2024)
Understanding Textual Emotion Through Emoji Prediction
por: Gordon, Ethan, et al.
Publicado: (2025)
por: Gordon, Ethan, et al.
Publicado: (2025)
Your Mixture-of-Experts LLM Is Secretly an Embedding Model For Free
por: Li, Ziyue, et al.
Publicado: (2024)
por: Li, Ziyue, et al.
Publicado: (2024)
Reward-free Alignment for Conflicting Objectives
por: Chen, Peter, et al.
Publicado: (2026)
por: Chen, Peter, et al.
Publicado: (2026)
OCEAN: Offline Chain-of-thought Evaluation and Alignment in Large Language Models
por: Wu, Junda, et al.
Publicado: (2024)
por: Wu, Junda, et al.
Publicado: (2024)
Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models
por: Zhang, Yang, et al.
Publicado: (2025)
por: Zhang, Yang, et al.
Publicado: (2025)
ComPO: Preference Alignment via Comparison Oracles
por: Chen, Peter, et al.
Publicado: (2025)
por: Chen, Peter, et al.
Publicado: (2025)
The Position Curse: LLMs Struggle to Locate the Last Few Items in a List
por: Zhang, Zhanqi, et al.
Publicado: (2026)
por: Zhang, Zhanqi, et al.
Publicado: (2026)
Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards
por: Wang, Haoxiang, et al.
Publicado: (2024)
por: Wang, Haoxiang, et al.
Publicado: (2024)
MetaRM: Shifted Distributions Alignment via Meta-Learning
por: Dou, Shihan, et al.
Publicado: (2024)
por: Dou, Shihan, et al.
Publicado: (2024)
Advancing LLM Safe Alignment with Safety Representation Ranking
por: Du, Tianqi, et al.
Publicado: (2025)
por: Du, Tianqi, et al.
Publicado: (2025)
Energy-Based Reward Models for Robust Language Model Alignment
por: Lochab, Anamika, et al.
Publicado: (2025)
por: Lochab, Anamika, et al.
Publicado: (2025)
Explaining Length Bias in LLM-Based Preference Evaluations
por: Hu, Zhengyu, et al.
Publicado: (2024)
por: Hu, Zhengyu, et al.
Publicado: (2024)
Active Layer-Contrastive Decoding Reduces Hallucination in Large Language Model Generation
por: Zhang, Hongxiang, et al.
Publicado: (2025)
por: Zhang, Hongxiang, et al.
Publicado: (2025)
Combating Confirmation Bias: A Unified Pseudo-Labeling Framework for Entity Alignment
por: Ding, Qijie, et al.
Publicado: (2023)
por: Ding, Qijie, et al.
Publicado: (2023)
How Transformers Learn Regular Language Recognition: A Theoretical Study on Training Dynamics and Implicit Bias
por: Huang, Ruiquan, et al.
Publicado: (2025)
por: Huang, Ruiquan, et al.
Publicado: (2025)
Memory Is All You Need: Testing How Model Memory Affects LLM Performance in Annotation Tasks
por: Timoneda, Joan C., et al.
Publicado: (2025)
por: Timoneda, Joan C., et al.
Publicado: (2025)
Format as a Prior: Quantifying and Analyzing Bias in LLMs for Heterogeneous Data
por: Liu, Jiacheng, et al.
Publicado: (2025)
por: Liu, Jiacheng, et al.
Publicado: (2025)
An Analysis for Reasoning Bias of Language Models with Small Initialization
por: Yao, Junjie, et al.
Publicado: (2025)
por: Yao, Junjie, et al.
Publicado: (2025)
Ejemplares similares
-
GLaPE: Gold Label-agnostic Prompt Evaluation and Optimization for Large Language Model
por: Zhang, Xuanchang, et al.
Publicado: (2024) -
Can LLMs Speak For Diverse People? Tuning LLMs via Debate to Generate Controllable Controversial Statements
por: Li, Ming, et al.
Publicado: (2024) -
OPTune: Efficient Online Preference Tuning
por: Chen, Lichang, et al.
Publicado: (2024) -
ODIN: Disentangled Reward Mitigates Hacking in RLHF
por: Chen, Lichang, et al.
Publicado: (2024) -
Selective Reflection-Tuning: Student-Selected Data Recycling for LLM Instruction-Tuning
por: Li, Ming, et al.
Publicado: (2024)