Guardado en:
| Autores principales: | Yao, Jing, Yi, Xiaoyuan, Duan, Shitong, Wang, Jindong, Bai, Yuzhuo, Huang, Muhua, Zhang, Peng, Lu, Tun, Dou, Zhicheng, Sun, Maosong, Xie, Xing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2501.07071 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference
por: Yao, Jing, et al.
Publicado: (2025)
por: Yao, Jing, et al.
Publicado: (2025)
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
por: Bai, Yuzhuo, et al.
Publicado: (2025)
por: Bai, Yuzhuo, et al.
Publicado: (2025)
Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning
por: Duan, Shitong, et al.
Publicado: (2023)
por: Duan, Shitong, et al.
Publicado: (2023)
CAReDiO: Cultural Alignment via Representativeness and Distinctiveness Guided Data Optimization
por: Yao, Jing, et al.
Publicado: (2025)
por: Yao, Jing, et al.
Publicado: (2025)
On the Dynamics of Multi-Agent LLM Communities Driven by Value Diversity
por: Huang, Muhua, et al.
Publicado: (2025)
por: Huang, Muhua, et al.
Publicado: (2025)
CLAVE: An Adaptive Framework for Evaluating Values of LLM Generated Responses
por: Yao, Jing, et al.
Publicado: (2024)
por: Yao, Jing, et al.
Publicado: (2024)
The Road to Artificial SuperIntelligence: A Comprehensive Survey of Superalignment
por: Kim, HyunJin, et al.
Publicado: (2024)
por: Kim, HyunJin, et al.
Publicado: (2024)
Beyond Human Norms: Unveiling Unique Values of Large Language Models through Interdisciplinary Approaches
por: Biedma, Pablo, et al.
Publicado: (2024)
por: Biedma, Pablo, et al.
Publicado: (2024)
Unintended Harms of Value-Aligned LLMs: Psychological and Empirical Insights
por: Choi, Sooyung, et al.
Publicado: (2025)
por: Choi, Sooyung, et al.
Publicado: (2025)
Negating Negatives: Alignment with Human Negative Samples via Distributional Dispreference Optimization
por: Duan, Shitong, et al.
Publicado: (2024)
por: Duan, Shitong, et al.
Publicado: (2024)
MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions
por: Zhu, Yanxu, et al.
Publicado: (2025)
por: Zhu, Yanxu, et al.
Publicado: (2025)
On the Essence and Prospect: An Investigation of Alignment Approaches for Big Models
por: Wang, Xinpeng, et al.
Publicado: (2024)
por: Wang, Xinpeng, et al.
Publicado: (2024)
Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook
por: Lee, Jaehyeok, et al.
Publicado: (2026)
por: Lee, Jaehyeok, et al.
Publicado: (2026)
Counterfactual Reasoning for Steerable Pluralistic Value Alignment of Large Language Models
por: Guo, Hanze, et al.
Publicado: (2025)
por: Guo, Hanze, et al.
Publicado: (2025)
PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization
por: Jiang, Han, et al.
Publicado: (2025)
por: Jiang, Han, et al.
Publicado: (2025)
Leveraging Implicit Sentiments: Enhancing Reliability and Validity in Psychological Trait Evaluation of LLMs
por: Ma, Huanhuan, et al.
Publicado: (2025)
por: Ma, Huanhuan, et al.
Publicado: (2025)
Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment
por: Tan, Bryan Chen Zhengyu, et al.
Publicado: (2026)
por: Tan, Bryan Chen Zhengyu, et al.
Publicado: (2026)
Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization
por: Wang, Xingqi, et al.
Publicado: (2024)
por: Wang, Xingqi, et al.
Publicado: (2024)
MoVa: Towards Generalizable Classification of Human Morals and Values
por: Chen, Ziyu, et al.
Publicado: (2025)
por: Chen, Ziyu, et al.
Publicado: (2025)
Research Superalignment Should Advance Now with Alternating Competence and Conformity Optimization
por: Kim, HyunJin, et al.
Publicado: (2025)
por: Kim, HyunJin, et al.
Publicado: (2025)
ValueCompass: A Framework for Measuring Contextual Value Alignment Between Human and LLMs
por: Shen, Hua, et al.
Publicado: (2024)
por: Shen, Hua, et al.
Publicado: (2024)
DailyQA: A Benchmark to Evaluate Web Retrieval Augmented LLMs Based on Capturing Real-World Changes
por: Cheng, Jiehan, et al.
Publicado: (2025)
por: Cheng, Jiehan, et al.
Publicado: (2025)
LLM-GLOBE: A Benchmark Evaluating the Cultural Values Embedded in LLM Output
por: Karinshak, Elise, et al.
Publicado: (2024)
por: Karinshak, Elise, et al.
Publicado: (2024)
Human Values Matter: Investigating How Misalignment Shapes Collective Behaviors in LLM Agent Communities
por: Zhang, Xiangxu, et al.
Publicado: (2026)
por: Zhang, Xiangxu, et al.
Publicado: (2026)
AI Evaluation Should Require Standardized Item-Level Data Releases
por: Jiang, Han, et al.
Publicado: (2026)
por: Jiang, Han, et al.
Publicado: (2026)
Computational Multi-Agents Society Experiments: Social Modeling Framework Based on Generative Agents
por: Zhang, Hanzhong, et al.
Publicado: (2025)
por: Zhang, Hanzhong, et al.
Publicado: (2025)
Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing
por: Jiang, Han, et al.
Publicado: (2024)
por: Jiang, Han, et al.
Publicado: (2024)
Safety Instincts: LLMs Learn to Trust Their Internal Compass for Self-Defense
por: Shen, Guobin, et al.
Publicado: (2025)
por: Shen, Guobin, et al.
Publicado: (2025)
CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution
por: Cao, Maosong, et al.
Publicado: (2024)
por: Cao, Maosong, et al.
Publicado: (2024)
OpenCompass: A Universal Evaluation Platform for Large Language Models
por: Cao, Maosong, et al.
Publicado: (2026)
por: Cao, Maosong, et al.
Publicado: (2026)
Spatio-Temporal Autoregressions for High Dimensional Matrix-Valued Time Series
por: Dou, Baojun, et al.
Publicado: (2025)
por: Dou, Baojun, et al.
Publicado: (2025)
The Transmission Value of Energy Storage and Fundamental Limitations
por: Zhang, Qian, et al.
Publicado: (2024)
por: Zhang, Qian, et al.
Publicado: (2024)
SpecFormer: Guarding Vision Transformer Robustness via Maximum Singular Value Penalization
por: Hu, Xixu, et al.
Publicado: (2024)
por: Hu, Xixu, et al.
Publicado: (2024)
InFi-Check: Interpretable and Fine-Grained Fact-Checking of LLMs
por: Bai, Yuzhuo, et al.
Publicado: (2026)
por: Bai, Yuzhuo, et al.
Publicado: (2026)
Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap
por: Wang, Jun, et al.
Publicado: (2025)
por: Wang, Jun, et al.
Publicado: (2025)
Flames: Benchmarking Value Alignment of LLMs in Chinese
por: Huang, Kexin, et al.
Publicado: (2023)
por: Huang, Kexin, et al.
Publicado: (2023)
STEP: A Unified Spiking Transformer Evaluation Platform for Fair and Reproducible Benchmarking
por: Shen, Sicheng, et al.
Publicado: (2025)
por: Shen, Sicheng, et al.
Publicado: (2025)
Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling
por: Bai, Xuehai, et al.
Publicado: (2026)
por: Bai, Xuehai, et al.
Publicado: (2026)
Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values
por: Dong, Haonan, et al.
Publicado: (2026)
por: Dong, Haonan, et al.
Publicado: (2026)
Political Compass or Spinning Arrow? Towards More Meaningful Evaluations for Values and Opinions in Large Language Models
por: Röttger, Paul, et al.
Publicado: (2024)
por: Röttger, Paul, et al.
Publicado: (2024)
Ejemplares similares
-
AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference
por: Yao, Jing, et al.
Publicado: (2025) -
IROTE: Human-like Traits Elicitation of Large Language Model via In-Context Self-Reflective Optimization
por: Bai, Yuzhuo, et al.
Publicado: (2025) -
Denevil: Towards Deciphering and Navigating the Ethical Values of Large Language Models via Instruction Learning
por: Duan, Shitong, et al.
Publicado: (2023) -
CAReDiO: Cultural Alignment via Representativeness and Distinctiveness Guided Data Optimization
por: Yao, Jing, et al.
Publicado: (2025) -
On the Dynamics of Multi-Agent LLM Communities Driven by Value Diversity
por: Huang, Muhua, et al.
Publicado: (2025)