NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hua, Andong, Dhaliwal, Mehak Preet, Pullela, Laya, Burke, Ryan, Qin, Yao |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence
von: Khamesian, Saman, et al.
Veröffentlicht: (2025)
von: Khamesian, Saman, et al.
Veröffentlicht: (2025)
A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism
von: Thompson, Brian, et al.
Veröffentlicht: (2024)
von: Thompson, Brian, et al.
Veröffentlicht: (2024)
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
von: Dhaliwal, Mehak, et al.
Veröffentlicht: (2026)
von: Dhaliwal, Mehak, et al.
Veröffentlicht: (2026)
InFoBench: Evaluating Instruction Following Ability in Large Language Models
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
von: Qin, Yiwei, et al.
Veröffentlicht: (2024)
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
von: Zhang, Yazhou, et al.
Veröffentlicht: (2024)
von: Zhang, Yazhou, et al.
Veröffentlicht: (2024)
Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs
von: Hua, Andong, et al.
Veröffentlicht: (2025)
von: Hua, Andong, et al.
Veröffentlicht: (2025)
NutriTransform: Estimating Nutritional Information From Online Food Posts
von: Ruprechter, Thorsten, et al.
Veröffentlicht: (2025)
von: Ruprechter, Thorsten, et al.
Veröffentlicht: (2025)
OphthBench: A Comprehensive Benchmark for Evaluating Large Language Models in Chinese Ophthalmology
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
von: Zhou, Chengfeng, et al.
Veröffentlicht: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
von: Chu, Zheng, et al.
Veröffentlicht: (2023)
DebugBench: Evaluating Debugging Capability of Large Language Models
von: Tian, Runchu, et al.
Veröffentlicht: (2024)
von: Tian, Runchu, et al.
Veröffentlicht: (2024)
EmoBench: Evaluating the Emotional Intelligence of Large Language Models
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
von: Sabour, Sahand, et al.
Veröffentlicht: (2024)
Large Language Models for Classical Chinese Poetry Translation: Benchmarking, Evaluating, and Improving
von: Chen, Andong, et al.
Veröffentlicht: (2024)
von: Chen, Andong, et al.
Veröffentlicht: (2024)
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
von: Khandekar, Nikhil, et al.
Veröffentlicht: (2024)
von: Khandekar, Nikhil, et al.
Veröffentlicht: (2024)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
von: Tu, Shangqing, et al.
Veröffentlicht: (2023)
TurkBench: A Benchmark for Evaluating Turkish Large Language Models
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
von: Toraman, Çağrı, et al.
Veröffentlicht: (2026)
PsychCounsel-Bench: Evaluating the Psychology Intelligence of Large Language Models
von: Zeng, Min
Veröffentlicht: (2025)
von: Zeng, Min
Veröffentlicht: (2025)
RefuteBench: Evaluating Refuting Instruction-Following for Large Language Models
von: Yan, Jianhao, et al.
Veröffentlicht: (2024)
von: Yan, Jianhao, et al.
Veröffentlicht: (2024)
StyleBench: Evaluating thinking styles in Large Language Models
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
von: Guo, Junyu, et al.
Veröffentlicht: (2025)
ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models
von: Alhumud, Anas, et al.
Veröffentlicht: (2026)
von: Alhumud, Anas, et al.
Veröffentlicht: (2026)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Identifying and Decomposing Compound Ingredients in Meal Plans Using Large Language Models
von: Kopitar, Leon, et al.
Veröffentlicht: (2024)
von: Kopitar, Leon, et al.
Veröffentlicht: (2024)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
von: Wu, Yao, et al.
Veröffentlicht: (2026)
von: Wu, Yao, et al.
Veröffentlicht: (2026)
CogniBench: A Legal-inspired Framework and Dataset for Assessing Cognitive Faithfulness of Large Language Models
von: Tang, Xiaqiang, et al.
Veröffentlicht: (2025)
von: Tang, Xiaqiang, et al.
Veröffentlicht: (2025)
ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
von: Tang, Xiangru, et al.
Veröffentlicht: (2023)
BEACON: Balancing Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes
von: Nagpal, Vansh, et al.
Veröffentlicht: (2024)
von: Nagpal, Vansh, et al.
Veröffentlicht: (2024)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
von: Parmar, Mihir, et al.
Veröffentlicht: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
von: Gao, Fan, et al.
Veröffentlicht: (2025)
von: Gao, Fan, et al.
Veröffentlicht: (2025)
PromptBench: A Unified Library for Evaluation of Large Language Models
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
von: Zhu, Kaijie, et al.
Veröffentlicht: (2023)
CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks
von: Feng, Jie, et al.
Veröffentlicht: (2024)
von: Feng, Jie, et al.
Veröffentlicht: (2024)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
von: Yu, Yongan, et al.
Veröffentlicht: (2025)
von: Yu, Yongan, et al.
Veröffentlicht: (2025)
UrbanPlanBench: A Comprehensive Urban Planning Benchmark for Evaluating Large Language Models
von: Zheng, Yu, et al.
Veröffentlicht: (2025)
von: Zheng, Yu, et al.
Veröffentlicht: (2025)
MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
von: Liu, Zheyuan, et al.
Veröffentlicht: (2026)
PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology
von: Zhao, Yimin, et al.
Veröffentlicht: (2026)
von: Zhao, Yimin, et al.
Veröffentlicht: (2026)
CIF-Bench: A Chinese Instruction-Following Benchmark for Evaluating the Generalizability of Large Language Models
von: LI, Yizhi, et al.
Veröffentlicht: (2024)
von: LI, Yizhi, et al.
Veröffentlicht: (2024)
Liars' Bench: Evaluating Lie Detectors for Language Models
von: Kretschmar, Kieron, et al.
Veröffentlicht: (2025)
von: Kretschmar, Kieron, et al.
Veröffentlicht: (2025)
Evaluating Latent Knowledge of Public Tabular Datasets in Large Language Models
von: Silvestri, Matteo, et al.
Veröffentlicht: (2025)
von: Silvestri, Matteo, et al.
Veröffentlicht: (2025)
OR-Bench: An Over-Refusal Benchmark for Large Language Models
von: Cui, Justin, et al.
Veröffentlicht: (2024)
von: Cui, Justin, et al.
Veröffentlicht: (2024)
CBT-Bench: Evaluating Large Language Models on Assisting Cognitive Behavior Therapy
von: Zhang, Mian, et al.
Veröffentlicht: (2024)
von: Zhang, Mian, et al.
Veröffentlicht: (2024)
AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
von: Lee, Jaeho, et al.
Veröffentlicht: (2025)
Steering Evaluation-Aware Language Models to Act Like They Are Deployed
von: Hua, Tim Tian, et al.
Veröffentlicht: (2025)
von: Hua, Tim Tian, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
NutriGen: Personalized Meal Plan Generator Leveraging Large Language Models to Enhance Dietary and Nutritional Adherence
von: Khamesian, Saman, et al.
Veröffentlicht: (2025) -
A Shocking Amount of the Web is Machine Translated: Insights from Multi-Way Parallelism
von: Thompson, Brian, et al.
Veröffentlicht: (2024) -
English is Not All You Need: Systematically Exploring the Role of Multilinguality in LLM Post-Training
von: Dhaliwal, Mehak, et al.
Veröffentlicht: (2026) -
InFoBench: Evaluating Instruction Following Ability in Large Language Models
von: Qin, Yiwei, et al.
Veröffentlicht: (2024) -
SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding
von: Zhang, Yazhou, et al.
Veröffentlicht: (2024)