Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform
Fuente:
arXiv
Guardado en:
| Autores principales: | Cheng, Mingyue, Zhang, Hao, Yang, Jiqian, Liu, Qi, Li, Li, Huang, Xin, Song, Liwei, Li, Zhi, Huang, Zhenya, Chen, Enhong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Refining Sentence Embedding Model through Ranking Sentences Generation with Large Language Models
por: He, Liyang, et al.
Publicado: (2025)
por: He, Liyang, et al.
Publicado: (2025)
Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study
por: Yu, Shuo, et al.
Publicado: (2024)
por: Yu, Shuo, et al.
Publicado: (2024)
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
por: Gan, Aoran, et al.
Publicado: (2025)
por: Gan, Aoran, et al.
Publicado: (2025)
ConvTimeNet: A Deep Hierarchical Fully Convolutional Model for Multivariate Time Series Analysis
por: Cheng, Mingyue, et al.
Publicado: (2024)
por: Cheng, Mingyue, et al.
Publicado: (2024)
Advancing Annotation of Stance in Social Media Posts: A Comparative Analysis of Large Language Models and Crowd Sourcing
por: Li, Mao, et al.
Publicado: (2024)
por: Li, Mao, et al.
Publicado: (2024)
DisenTS: Disentangled Channel Evolving Pattern Modeling for Multivariate Time Series Forecasting
por: Liu, Zhiding, et al.
Publicado: (2024)
por: Liu, Zhiding, et al.
Publicado: (2024)
Empowering Sequential Recommendation from Collaborative Signals and Semantic Relatedness
por: Cheng, Mingyue, et al.
Publicado: (2024)
por: Cheng, Mingyue, et al.
Publicado: (2024)
A Knowledge-Injected Curriculum Pretraining Framework for Question Answering
por: Lin, Xin, et al.
Publicado: (2024)
por: Lin, Xin, et al.
Publicado: (2024)
PEToolLLM: Towards Personalized Tool Learning in Large Language Models
por: Xu, Qiancheng, et al.
Publicado: (2025)
por: Xu, Qiancheng, et al.
Publicado: (2025)
EduNLP: Towards a Unified and Modularized Library for Educational Resources
por: Huang, Zhenya, et al.
Publicado: (2024)
por: Huang, Zhenya, et al.
Publicado: (2024)
What Makes In-context Learning Effective for Mathematical Reasoning: A Theoretical Analysis
por: Liu, Jiayu, et al.
Publicado: (2024)
por: Liu, Jiayu, et al.
Publicado: (2024)
Position: AI Evaluation Should Learn from How We Test Humans
por: Zhuang, Yan, et al.
Publicado: (2023)
por: Zhuang, Yan, et al.
Publicado: (2023)
Evaluating Large Language Models with Psychometrics
por: Li, Yuan, et al.
Publicado: (2024)
por: Li, Yuan, et al.
Publicado: (2024)
ChemEval: A Comprehensive Multi-Level Chemical Evaluation for Large Language Models
por: Huang, Yuqing, et al.
Publicado: (2024)
por: Huang, Yuqing, et al.
Publicado: (2024)
StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
por: Wang, Daoyu, et al.
Publicado: (2026)
por: Wang, Daoyu, et al.
Publicado: (2026)
AgentStealth: Reinforcing Large Language Model for Anonymizing User-generated Text
por: Shao, Chenyang, et al.
Publicado: (2025)
por: Shao, Chenyang, et al.
Publicado: (2025)
Improving Time Series Forecasting via Instance-aware Post-hoc Revision
por: Liu, Zhiding, et al.
Publicado: (2025)
por: Liu, Zhiding, et al.
Publicado: (2025)
Towards the Anonymization of the Language Modeling
por: Boutet, Antoine, et al.
Publicado: (2025)
por: Boutet, Antoine, et al.
Publicado: (2025)
Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models
por: Zhang, Xin, et al.
Publicado: (2026)
por: Zhang, Xin, et al.
Publicado: (2026)
E-Bench: Towards Evaluating the Ease-of-Use of Large Language Models
por: Zhang, Zhenyu, et al.
Publicado: (2024)
por: Zhang, Zhenyu, et al.
Publicado: (2024)
When Large Language Models Meet Personalization: Perspectives of Challenges and Opportunities
por: Chen, Jin, et al.
Publicado: (2023)
por: Chen, Jin, et al.
Publicado: (2023)
Steering Vector Fields for Context-Aware Inference-Time Control in Large Language Models
por: Li, Jiaqian, et al.
Publicado: (2026)
por: Li, Jiaqian, et al.
Publicado: (2026)
Identifying Multiple Personalities in Large Language Models with External Evaluation
por: Song, Xiaoyang, et al.
Publicado: (2024)
por: Song, Xiaoyang, et al.
Publicado: (2024)
Lost in the Source Language: How Large Language Models Evaluate the Quality of Machine Translation
por: Huang, Xu, et al.
Publicado: (2024)
por: Huang, Xu, et al.
Publicado: (2024)
TableTime: Reformulating Time Series Classification as Training-Free Table Understanding with Large Language Models
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
Pre-trained Language Model and Knowledge Distillation for Lightweight Sequential Recommendation
por: Li, Li, et al.
Publicado: (2024)
por: Li, Li, et al.
Publicado: (2024)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
por: Li, Jiahuan, et al.
Publicado: (2023)
por: Li, Jiahuan, et al.
Publicado: (2023)
Generative Pretrained Hierarchical Transformer for Time Series Forecasting
por: Liu, Zhiding, et al.
Publicado: (2024)
por: Liu, Zhiding, et al.
Publicado: (2024)
Advancing Tool-Augmented Large Language Models via Meta-Verification and Reflection Learning
por: Ma, Zhiyuan, et al.
Publicado: (2025)
por: Ma, Zhiyuan, et al.
Publicado: (2025)
Robust Utility-Preserving Text Anonymization Based on Large Language Models
por: Yang, Tianyu, et al.
Publicado: (2024)
por: Yang, Tianyu, et al.
Publicado: (2024)
From Objectives to Questions: A Planning-based Framework for Educational Mathematical Question Generation
por: Cheng, Cheng, et al.
Publicado: (2025)
por: Cheng, Cheng, et al.
Publicado: (2025)
Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables
por: Zhou, Yitong, et al.
Publicado: (2025)
por: Zhou, Yitong, et al.
Publicado: (2025)
UniMEL: A Unified Framework for Multimodal Entity Linking with Large Language Models
por: Qi, Liu, et al.
Publicado: (2024)
por: Qi, Liu, et al.
Publicado: (2024)
DIRI: Adversarial Patient Reidentification with Large Language Models for Evaluating Clinical Text Anonymization
por: Morris, John X., et al.
Publicado: (2024)
por: Morris, John X., et al.
Publicado: (2024)
Evaluating Accounting Reasoning Capabilities of Large Language Models
por: Zhou, Jie, et al.
Publicado: (2026)
por: Zhou, Jie, et al.
Publicado: (2026)
Towards Optimal Learning of Language Models
por: Gu, Yuxian, et al.
Publicado: (2024)
por: Gu, Yuxian, et al.
Publicado: (2024)
Personalized Graph-Empowered Large Language Model for Proactive Information Access
por: Chang, Chia Cheng, et al.
Publicado: (2026)
por: Chang, Chia Cheng, et al.
Publicado: (2026)
Prospect Personalized Recommendation on Large Language Model-based Agent Platform
por: Zhang, Jizhi, et al.
Publicado: (2024)
por: Zhang, Jizhi, et al.
Publicado: (2024)
Objective Metrics for Evaluating Large Language Models Using External Data Sources
por: Du, Haoze, et al.
Publicado: (2025)
por: Du, Haoze, et al.
Publicado: (2025)
ValueBench: Towards Comprehensively Evaluating Value Orientations and Understanding of Large Language Models
por: Ren, Yuanyi, et al.
Publicado: (2024)
por: Ren, Yuanyi, et al.
Publicado: (2024)
Ejemplares similares
-
Refining Sentence Embedding Model through Ranking Sentences Generation with Large Language Models
por: He, Liyang, et al.
Publicado: (2025) -
Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study
por: Yu, Shuo, et al.
Publicado: (2024) -
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
por: Gan, Aoran, et al.
Publicado: (2025) -
ConvTimeNet: A Deep Hierarchical Fully Convolutional Model for Multivariate Time Series Analysis
por: Cheng, Mingyue, et al.
Publicado: (2024) -
Advancing Annotation of Stance in Social Media Posts: A Comparative Analysis of Large Language Models and Crowd Sourcing
por: Li, Mao, et al.
Publicado: (2024)