PoliticsBench: Benchmarking Political Values in Large Language Models with Multi-Turn Roleplay
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Khetan, Rohan, Khetan, Ashna |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DEFT: Data Efficient Fine-Tuning for Pre-Trained Language Models via Unsupervised Core-Set Selection
von: Das, Devleena, et al.
Veröffentlicht: (2023)
von: Das, Devleena, et al.
Veröffentlicht: (2023)
Beyond One-Size-Fits-All: Multi-Domain, Multi-Task Framework for Embedding Model Selection
von: Khetan, Vivek
Veröffentlicht: (2024)
von: Khetan, Vivek
Veröffentlicht: (2024)
Political-LLM: Large Language Models in Political Science
von: Li, Lincan, et al.
Veröffentlicht: (2024)
von: Li, Lincan, et al.
Veröffentlicht: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024)
von: Bai, Ge, et al.
Veröffentlicht: (2024)
PPLqa: An Unsupervised Information-Theoretic Quality Metric for Comparing Generative Large Language Models
von: Friedland, Gerald, et al.
Veröffentlicht: (2024)
von: Friedland, Gerald, et al.
Veröffentlicht: (2024)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
von: Liu, Junyu, et al.
Veröffentlicht: (2026)
Human-AI Collaborative Taxonomy Construction: A Case Study in Profession-Specific Writing Assistants
von: Lee, Minhwa, et al.
Veröffentlicht: (2024)
von: Lee, Minhwa, et al.
Veröffentlicht: (2024)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
Grounding Gaps in Language Model Generations
von: Shaikh, Omar, et al.
Veröffentlicht: (2023)
von: Shaikh, Omar, et al.
Veröffentlicht: (2023)
Assessing Political Bias in Large Language Models
von: Rettenberger, Luca, et al.
Veröffentlicht: (2024)
von: Rettenberger, Luca, et al.
Veröffentlicht: (2024)
Benchmarking Gender and Political Bias in Large Language Models
von: Yang, Jinrui, et al.
Veröffentlicht: (2025)
von: Yang, Jinrui, et al.
Veröffentlicht: (2025)
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
von: Cao, Hongye, et al.
Veröffentlicht: (2025)
Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language Models
von: Röttger, Paul, et al.
Veröffentlicht: (2024)
von: Röttger, Paul, et al.
Veröffentlicht: (2024)
Benchmarking Multi-National Value Alignment for Large Language Models
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
von: Shi, Weijie, et al.
Veröffentlicht: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
von: Cui, Justin, et al.
Veröffentlicht: (2024)
von: Cui, Justin, et al.
Veröffentlicht: (2024)
StoryBench: A Dynamic Benchmark for Evaluating Long-Term Memory with Multi Turns
von: Wan, Luanbo, et al.
Veröffentlicht: (2025)
von: Wan, Luanbo, et al.
Veröffentlicht: (2025)
Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models
von: Li, Yubo, et al.
Veröffentlicht: (2025)
von: Li, Yubo, et al.
Veröffentlicht: (2025)
TaskBench: Benchmarking Large Language Models for Task Automation
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
von: Shen, Yongliang, et al.
Veröffentlicht: (2023)
ChartEditBench: Evaluating Grounded Multi-Turn Chart Editing in Multimodal Language Models
von: Kapadnis, Manav Nitin, et al.
Veröffentlicht: (2026)
von: Kapadnis, Manav Nitin, et al.
Veröffentlicht: (2026)
Large Language Models in Politics and Democracy: A Comprehensive Survey
von: Aoki, Goshi
Veröffentlicht: (2024)
von: Aoki, Goshi
Veröffentlicht: (2024)
LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models
von: Meadows, Gwenyth Isobel, et al.
Veröffentlicht: (2024)
von: Meadows, Gwenyth Isobel, et al.
Veröffentlicht: (2024)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
Examining the Influence of Political Bias on Large Language Model Performance in Stance Classification
von: Ng, Lynnette Hui Xian, et al.
Veröffentlicht: (2024)
von: Ng, Lynnette Hui Xian, et al.
Veröffentlicht: (2024)
Measuring Political Bias in Large Language Models: What Is Said and How It Is Said
von: Bang, Yejin, et al.
Veröffentlicht: (2024)
von: Bang, Yejin, et al.
Veröffentlicht: (2024)
Mapping and Influencing the Political Ideology of Large Language Models using Synthetic Personas
von: Bernardelle, Pietro, et al.
Veröffentlicht: (2024)
von: Bernardelle, Pietro, et al.
Veröffentlicht: (2024)
DarkBench: Benchmarking Dark Patterns in Large Language Models
von: Kran, Esben, et al.
Veröffentlicht: (2025)
von: Kran, Esben, et al.
Veröffentlicht: (2025)
IrokoBench: A New Benchmark for African Languages in the Age of Large Language Models
von: Adelani, David Ifeoluwa, et al.
Veröffentlicht: (2024)
von: Adelani, David Ifeoluwa, et al.
Veröffentlicht: (2024)
BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting
von: Wang, Zhensheng, et al.
Veröffentlicht: (2026)
von: Wang, Zhensheng, et al.
Veröffentlicht: (2026)
SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth
von: Xing, Wenpeng, et al.
Veröffentlicht: (2025)
von: Xing, Wenpeng, et al.
Veröffentlicht: (2025)
EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models
von: Hu, He, et al.
Veröffentlicht: (2025)
von: Hu, He, et al.
Veröffentlicht: (2025)
VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
von: Yan, Yuchen, et al.
Veröffentlicht: (2025)
CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
von: Sun, Guangzhi, et al.
Veröffentlicht: (2025)
Debiasing Large Language Models in Thai Political Stance Detection via Counterfactual Calibration
von: Sermsri, Kasidit, et al.
Veröffentlicht: (2025)
von: Sermsri, Kasidit, et al.
Veröffentlicht: (2025)
Examining Alignment of Large Language Models through Representative Heuristics: The Case of Political Stereotypes
von: Jeoung, Sullam, et al.
Veröffentlicht: (2025)
von: Jeoung, Sullam, et al.
Veröffentlicht: (2025)
Fine-Grained Interpretation of Political Opinions in Large Language Models
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
von: Hu, Jingyu, et al.
Veröffentlicht: (2025)
On the Relationship between Truth and Political Bias in Language Models
von: Fulay, Suyash, et al.
Veröffentlicht: (2024)
von: Fulay, Suyash, et al.
Veröffentlicht: (2024)
VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models
von: Dong, Nguyen Tien, et al.
Veröffentlicht: (2025)
von: Dong, Nguyen Tien, et al.
Veröffentlicht: (2025)
JailBench: A Comprehensive Chinese Security Assessment Benchmark for Large Language Models
von: Liu, Shuyi, et al.
Veröffentlicht: (2025)
von: Liu, Shuyi, et al.
Veröffentlicht: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
von: Zhang, Wenjing, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
DEFT: Data Efficient Fine-Tuning for Pre-Trained Language Models via Unsupervised Core-Set Selection
von: Das, Devleena, et al.
Veröffentlicht: (2023) -
Beyond One-Size-Fits-All: Multi-Domain, Multi-Task Framework for Embedding Model Selection
von: Khetan, Vivek
Veröffentlicht: (2024) -
Political-LLM: Large Language Models in Political Science
von: Li, Lincan, et al.
Veröffentlicht: (2024) -
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
von: Bai, Ge, et al.
Veröffentlicht: (2024) -
PPLqa: An Unsupervised Information-Theoretic Quality Metric for Comparing Generative Large Language Models
von: Friedland, Gerald, et al.
Veröffentlicht: (2024)