Toward a unified framework for data-efficient evaluation of large language models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liao, Lele, Zhang, Qile, Wu, Ruofan, Fang, Guanhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Re-evaluating Theory of Mind evaluation in large language models
por: Hu, Jennifer, et al.
Publicado: (2025)
por: Hu, Jennifer, et al.
Publicado: (2025)
Quantifying construct validity in large language model evaluations
por: Kearns, Ryan Othniel
Publicado: (2026)
por: Kearns, Ryan Othniel
Publicado: (2026)
Emergent evaluation hubs in a decentralizing large language model ecosystem
por: Cebrian, Manuel, et al.
Publicado: (2025)
por: Cebrian, Manuel, et al.
Publicado: (2025)
A general tensor-structured compression scheme for efficient large language models
por: Lu, Ying, et al.
Publicado: (2026)
por: Lu, Ying, et al.
Publicado: (2026)
Leveraging large language models for efficient representation learning for entity resolution
por: Xu, Xiaowei, et al.
Publicado: (2024)
por: Xu, Xiaowei, et al.
Publicado: (2024)
Ploutos: Towards interpretable stock movement prediction with financial large language model
por: Tong, Hanshuang, et al.
Publicado: (2024)
por: Tong, Hanshuang, et al.
Publicado: (2024)
A unified foundational framework for knowledge injection and evaluation of Large Language Models in Combustion Science
por: Yang, Zonglin, et al.
Publicado: (2026)
por: Yang, Zonglin, et al.
Publicado: (2026)
Towards Intelligent Geospatial Data Discovery: a knowledge graph-driven multi-agent framework powered by large language models
por: Liu, Ruixiang, et al.
Publicado: (2026)
por: Liu, Ruixiang, et al.
Publicado: (2026)
Reshaping MOFs text mining with a dynamic multi-agents framework of large language model
por: Lin, Zuhong, et al.
Publicado: (2025)
por: Lin, Zuhong, et al.
Publicado: (2025)
Evolution of meta's llama models and parameter-efficient fine-tuning of large language models: a survey
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
por: Abdullah, Abdulhady Abas, et al.
Publicado: (2025)
An evaluation framework for synthetic data generation models
por: Livieris, Ioannis E., et al.
Publicado: (2024)
por: Livieris, Ioannis E., et al.
Publicado: (2024)
The wall confronting large language models
por: Coveney, Peter V., et al.
Publicado: (2025)
por: Coveney, Peter V., et al.
Publicado: (2025)
A large-scale evaluation of commonsense knowledge in humans and large language models
por: Nguyen, Tuan Dung, et al.
Publicado: (2025)
por: Nguyen, Tuan Dung, et al.
Publicado: (2025)
Dissociating language and thought in large language models
por: Mahowald, Kyle, et al.
Publicado: (2023)
por: Mahowald, Kyle, et al.
Publicado: (2023)
TeleEval-OS: Performance evaluations of large language models for operations scheduling
por: Wang, Yanyan, et al.
Publicado: (2025)
por: Wang, Yanyan, et al.
Publicado: (2025)
A note on the impossibility of conditional PAC-efficient reasoning in large language models
por: Zeng, Hao
Publicado: (2025)
por: Zeng, Hao
Publicado: (2025)
\(X\)-evolve: Solution space evolution powered by large language models
por: Zhai, Yi, et al.
Publicado: (2025)
por: Zhai, Yi, et al.
Publicado: (2025)
BadEdit: Backdooring large language models by model editing
por: Li, Yanzhou, et al.
Publicado: (2024)
por: Li, Yanzhou, et al.
Publicado: (2024)
pUniFind: a unified large pre-trained deep learning model pushing the limit of mass spectra interpretation
por: Zhao, Jiale, et al.
Publicado: (2025)
por: Zhao, Jiale, et al.
Publicado: (2025)
Correcting misinformation on social media with a large language model
por: Zhou, Xinyi, et al.
Publicado: (2024)
por: Zhou, Xinyi, et al.
Publicado: (2024)
On the attribution of confidence to large language models
por: Keeling, Geoff, et al.
Publicado: (2024)
por: Keeling, Geoff, et al.
Publicado: (2024)
The challenge of uncertainty quantification of large language models in medicine
por: Atf, Zahra, et al.
Publicado: (2025)
por: Atf, Zahra, et al.
Publicado: (2025)
Domain adaptation of large language models for geotechnical applications
por: Fan, Lei, et al.
Publicado: (2025)
por: Fan, Lei, et al.
Publicado: (2025)
Chain-of-Authorization: Embedding authorization into large language models
por: Li, Yang, et al.
Publicado: (2026)
por: Li, Yang, et al.
Publicado: (2026)
Towards a more efficient bias detection in financial language models
por: Kacem, Firas Hadj, et al.
Publicado: (2026)
por: Kacem, Firas Hadj, et al.
Publicado: (2026)
Can large language models understand uncommon meanings of common words?
por: Wu, Jinyang, et al.
Publicado: (2024)
por: Wu, Jinyang, et al.
Publicado: (2024)
Representation in large language models
por: Yetman, Cameron
Publicado: (2025)
por: Yetman, Cameron
Publicado: (2025)
From keywords to semantics: Perceptions of large language models in data discovery
por: Halstead, Maura E, et al.
Publicado: (2025)
por: Halstead, Maura E, et al.
Publicado: (2025)
The threat of analytic flexibility in using large language models to simulate human data
por: Cummins, Jamie
Publicado: (2025)
por: Cummins, Jamie
Publicado: (2025)
ThoughtSource: A central hub for large language model reasoning data
por: Ott, Simon, et al.
Publicado: (2023)
por: Ott, Simon, et al.
Publicado: (2023)
MoleCode unlocks structural intelligence in large language models
por: Yan, Zhiyuan, et al.
Publicado: (2026)
por: Yan, Zhiyuan, et al.
Publicado: (2026)
Can open source large language models be used for tumor documentation in Germany? -- An evaluation on urological doctors' notes
por: Lenz, Stefan, et al.
Publicado: (2025)
por: Lenz, Stefan, et al.
Publicado: (2025)
Georeferencing complex relative locality descriptions with large language models
por: Fernando, Aneesha, et al.
Publicado: (2025)
por: Fernando, Aneesha, et al.
Publicado: (2025)
A critical review of methods and challenges in large language models
por: Moradi, Milad, et al.
Publicado: (2024)
por: Moradi, Milad, et al.
Publicado: (2024)
CVE-LLM : Automatic vulnerability evaluation in medical device industry using large language models
por: Ghosh, Rikhiya, et al.
Publicado: (2024)
por: Ghosh, Rikhiya, et al.
Publicado: (2024)
Can large language models explore in-context?
por: Krishnamurthy, Akshay, et al.
Publicado: (2024)
por: Krishnamurthy, Akshay, et al.
Publicado: (2024)
Long text outline generation: Chinese text outline based on unsupervised framework and large language mode
por: Yan, Yan, et al.
Publicado: (2024)
por: Yan, Yan, et al.
Publicado: (2024)
EvoOpt-LLM: Evolving industrial optimization models with large language models
por: He, Yiliu, et al.
Publicado: (2026)
por: He, Yiliu, et al.
Publicado: (2026)
Rethinking industrial artificial intelligence: a unified foundation framework
por: Lee, Jay, et al.
Publicado: (2025)
por: Lee, Jay, et al.
Publicado: (2025)
Retrieval-augmented in-context learning for multimodal large language models in disease classification
por: Zhan, Zaifu, et al.
Publicado: (2025)
por: Zhan, Zaifu, et al.
Publicado: (2025)
Ejemplares similares
-
Re-evaluating Theory of Mind evaluation in large language models
por: Hu, Jennifer, et al.
Publicado: (2025) -
Quantifying construct validity in large language model evaluations
por: Kearns, Ryan Othniel
Publicado: (2026) -
Emergent evaluation hubs in a decentralizing large language model ecosystem
por: Cebrian, Manuel, et al.
Publicado: (2025) -
A general tensor-structured compression scheme for efficient large language models
por: Lu, Ying, et al.
Publicado: (2026) -
Leveraging large language models for efficient representation learning for entity resolution
por: Xu, Xiaowei, et al.
Publicado: (2024)