Evaluating Large Language Models with Psychometrics
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yuan, Huang, Yue, Wang, Hongyi, Cheng, Ying, Zhang, Xiangliang, Zou, James, Sun, Lichao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
HonestLLM: Toward an Honest and Helpful Large Language Model
di: Gao, Chujie, et al.
Pubblicazione: (2024)
di: Gao, Chujie, et al.
Pubblicazione: (2024)
DataGen: Unified Synthetic Dataset Generation via Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench
di: Li, Yuan, et al.
Pubblicazione: (2024)
di: Li, Yuan, et al.
Pubblicazione: (2024)
Can Large Language Models Automatically Jailbreak GPT-4V?
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
di: Wu, Yuanwei, et al.
Pubblicazione: (2024)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization
di: Huang, Yue, et al.
Pubblicazione: (2025)
di: Huang, Yue, et al.
Pubblicazione: (2025)
FinLLM-B: When Large Language Models Meet Financial Breakout Trading
di: Zhang, Kang, et al.
Pubblicazione: (2024)
di: Zhang, Kang, et al.
Pubblicazione: (2024)
SocialMaze: A Benchmark for Evaluating Social Reasoning in Large Language Models
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
di: Xu, Zixiang, et al.
Pubblicazione: (2025)
ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU
di: Yuan, Zhengqing, et al.
Pubblicazione: (2026)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2026)
Evaluating Implicit Bias in Large Language Models by Attacking From a Psychometric Perspective
di: Wen, Yuchen, et al.
Pubblicazione: (2024)
di: Wen, Yuchen, et al.
Pubblicazione: (2024)
PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models
di: Bao, Han, et al.
Pubblicazione: (2026)
di: Bao, Han, et al.
Pubblicazione: (2026)
Reliable Control-Point Selection for Steering Reasoning in Large Language Models
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
di: Zhuang, Haomin, et al.
Pubblicazione: (2026)
Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement
di: Ye, Haoran, et al.
Pubblicazione: (2025)
di: Ye, Haoran, et al.
Pubblicazione: (2025)
Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models
di: Gao, Lang, et al.
Pubblicazione: (2024)
di: Gao, Lang, et al.
Pubblicazione: (2024)
MetaTool Benchmark for Large Language Models: Deciding Whether to Use Tools and Which to Use
di: Huang, Yue, et al.
Pubblicazione: (2023)
di: Huang, Yue, et al.
Pubblicazione: (2023)
TrustLLM: Trustworthiness in Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2024)
di: Huang, Yue, et al.
Pubblicazione: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2023)
di: Cao, Yihan, et al.
Pubblicazione: (2023)
CodeIP: A Grammar-Guided Multi-Bit Watermark for Large Language Models of Code
di: Guan, Batu, et al.
Pubblicazione: (2024)
di: Guan, Batu, et al.
Pubblicazione: (2024)
Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement
di: Luo, Xiaonan, et al.
Pubblicazione: (2025)
di: Luo, Xiaonan, et al.
Pubblicazione: (2025)
Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
di: Jung, Jana, et al.
Pubblicazione: (2025)
di: Jung, Jana, et al.
Pubblicazione: (2025)
EfficientLLM: Efficiency in Large Language Models
di: Yuan, Zhengqing, et al.
Pubblicazione: (2025)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2025)
Psychometric Predictive Power of Large Language Models
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
Mixture-of-Agents Enhances Large Language Model Capabilities
di: Wang, Junlin, et al.
Pubblicazione: (2024)
di: Wang, Junlin, et al.
Pubblicazione: (2024)
Large Language Models as Evaluators for Recommendation Explanations
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2024)
Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models
di: Sui, Yang, et al.
Pubblicazione: (2025)
di: Sui, Yang, et al.
Pubblicazione: (2025)
BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks
di: Sokol, Anna, et al.
Pubblicazione: (2024)
di: Sokol, Anna, et al.
Pubblicazione: (2024)
Evaluating Large Language Models for Radiology Natural Language Processing
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
di: Liu, Zhengliang, et al.
Pubblicazione: (2023)
Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform
di: Cheng, Mingyue, et al.
Pubblicazione: (2024)
di: Cheng, Mingyue, et al.
Pubblicazione: (2024)
Sparse Reward Subsystem in Large Language Models
di: Xu, Guowei, et al.
Pubblicazione: (2026)
di: Xu, Guowei, et al.
Pubblicazione: (2026)
LGM: Enhancing Large Language Models with Conceptual Meta-Relations and Iterative Retrieval
di: Lei, Wenchang, et al.
Pubblicazione: (2025)
di: Lei, Wenchang, et al.
Pubblicazione: (2025)
SafetyBench: Evaluating the Safety of Large Language Models
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
di: Zhang, Zhexin, et al.
Pubblicazione: (2023)
Self-Cognition in Large Language Models: An Exploratory Study
di: Chen, Dongping, et al.
Pubblicazione: (2024)
di: Chen, Dongping, et al.
Pubblicazione: (2024)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
di: Zou, Tao, et al.
Pubblicazione: (2025)
di: Zou, Tao, et al.
Pubblicazione: (2025)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
di: Ying, Jiahao, et al.
Pubblicazione: (2025)
di: Ying, Jiahao, et al.
Pubblicazione: (2025)
Documenti analoghi
-
1+1>2: Can Large Language Models Serve as Cross-Lingual Knowledge Aggregators?
di: Huang, Yue, et al.
Pubblicazione: (2024) -
FakeGPT: Fake News Generation, Explanation and Detection of Large Language Models
di: Huang, Yue, et al.
Pubblicazione: (2023) -
Jailbreaking Large Language Models Through Alignment Vulnerabilities in Out-of-Distribution Settings
di: Huang, Yue, et al.
Pubblicazione: (2024) -
Social Science Meets LLMs: How Reliable Are Large Language Models in Social Simulations?
di: Huang, Yue, et al.
Pubblicazione: (2024) -
HonestLLM: Toward an Honest and Helpful Large Language Model
di: Gao, Chujie, et al.
Pubblicazione: (2024)