NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions
Fuente:
arXiv
Salvato in:
| Autori principali: | Hua, Andong, Dhaliwal, Mehak Preet, Pullela, Laya, Burke, Ryan, Qin, Yao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence
di: Khamesian, Saman, et al.
Pubblicazione: (2025)
di: Khamesian, Saman, et al.
Pubblicazione: (2025)
A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism
di: Thompson, Brian, et al.
Pubblicazione: (2024)
di: Thompson, Brian, et al.
Pubblicazione: (2024)
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
di: Dhaliwal, Mehak, et al.
Pubblicazione: (2026)
di: Dhaliwal, Mehak, et al.
Pubblicazione: (2026)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
di: Qin, Yiwei, et al.
Pubblicazione: (2024)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
di: Zhang, Yazhou, et al.
Pubblicazione: (2024)
di: Zhang, Yazhou, et al.
Pubblicazione: (2024)
Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
di: Hua, Andong, et al.
Pubblicazione: (2025)
di: Hua, Andong, et al.
Pubblicazione: (2025)
NutriTransform: Estimating Nutritional Information From Online Food Posts
di: Ruprechter, Thorsten, et al.
Pubblicazione: (2025)
di: Ruprechter, Thorsten, et al.
Pubblicazione: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
di: Zhou, Chengfeng, et al.
Pubblicazione: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
di: Chu, Zheng, et al.
Pubblicazione: (2023)
di: Chu, Zheng, et al.
Pubblicazione: (2023)
DebugBench: Evaluating Debugging Capability of Large Language Models
di: Tian, Runchu, et al.
Pubblicazione: (2024)
di: Tian, Runchu, et al.
Pubblicazione: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
di: Sabour, Sahand, et al.
Pubblicazione: (2024)
di: Sabour, Sahand, et al.
Pubblicazione: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
di: Khandekar, Nikhil, et al.
Pubblicazione: (2024)
di: Khandekar, Nikhil, et al.
Pubblicazione: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
di: Tu, Shangqing, et al.
Pubblicazione: (2023)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
di: Toraman, Çağrı, et al.
Pubblicazione: (2026)
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
di: Zeng, Min
Pubblicazione: (2025)
di: Zeng, Min
Pubblicazione: (2025)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
di: Yan, Jianhao, et al.
Pubblicazione: (2024)
StyleBench: Evaluating thinking styles in Large Language Models
di: Guo, Junyu, et al.
Pubblicazione: (2025)
di: Guo, Junyu, et al.
Pubblicazione: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
di: Alhumud, Anas, et al.
Pubblicazione: (2026)
di: Alhumud, Anas, et al.
Pubblicazione: (2026)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
di: Li, Wei, et al.
Pubblicazione: (2024)
di: Li, Wei, et al.
Pubblicazione: (2024)
Identifying and Decomposing Compound Ingredients in Meal Plans Using Large Language Models
di: Kopitar, Leon, et al.
Pubblicazione: (2024)
di: Kopitar, Leon, et al.
Pubblicazione: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
di: Wu, Yao, et al.
Pubblicazione: (2026)
di: Wu, Yao, et al.
Pubblicazione: (2026)
CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language Models
di: Tang, Xiaqiang, et al.
Pubblicazione: (2025)
di: Tang, Xiaqiang, et al.
Pubblicazione: (2025)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
di: Tang, Xiangru, et al.
Pubblicazione: (2023)
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes
di: Nagpal, Vansh, et al.
Pubblicazione: (2024)
di: Nagpal, Vansh, et al.
Pubblicazione: (2024)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
di: Parmar, Mihir, et al.
Pubblicazione: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
di: Gao, Fan, et al.
Pubblicazione: (2025)
di: Gao, Fan, et al.
Pubblicazione: (2025)
PromptBench: A Unified Library for Evaluation of Large Language Models
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
di: Zhu, Kaijie, et al.
Pubblicazione: (2023)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
di: Feng, Jie, et al.
Pubblicazione: (2024)
di: Feng, Jie, et al.
Pubblicazione: (2024)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
di: Yu, Yongan, et al.
Pubblicazione: (2025)
di: Yu, Yongan, et al.
Pubblicazione: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
di: Zheng, Yu, et al.
Pubblicazione: (2025)
di: Zheng, Yu, et al.
Pubblicazione: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
di: Liu, Zheyuan, et al.
Pubblicazione: (2026)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
di: Zhao, Yimin, et al.
Pubblicazione: (2026)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
di: LI, Yizhi, et al.
Pubblicazione: (2024)
di: LI, Yizhi, et al.
Pubblicazione: (2024)
Liars' Bench: Evaluating Lie Detectors for Language Models
di: Kretschmar, Kieron, et al.
Pubblicazione: (2025)
di: Kretschmar, Kieron, et al.
Pubblicazione: (2025)
Evaluating Latent Knowledge of Public Tabular Datasets in Large Language Models
di: Silvestri, Matteo, et al.
Pubblicazione: (2025)
di: Silvestri, Matteo, et al.
Pubblicazione: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
di: Cui, Justin, et al.
Pubblicazione: (2024)
di: Cui, Justin, et al.
Pubblicazione: (2024)
CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy
di: Zhang, Mian, et al.
Pubblicazione: (2024)
di: Zhang, Mian, et al.
Pubblicazione: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
di: Lee, Jaeho, et al.
Pubblicazione: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
di: Hua, Tim Tian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence
di: Khamesian, Saman, et al.
Pubblicazione: (2025) -
A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism
di: Thompson, Brian, et al.
Pubblicazione: (2024) -
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
di: Dhaliwal, Mehak, et al.
Pubblicazione: (2026) -
InFoBench: Evaluating Instruction Following Ability in Large Language Models
di: Qin, Yiwei, et al.
Pubblicazione: (2024) -
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
di: Zhang, Yazhou, et al.
Pubblicazione: (2024)