DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain
Fuente:
arXiv
Saved in:
| Main Authors: | Jin, Song, Zhang, Juntian, Zhang, Xun, Tian, Zeying, Jiang, Fei, Yin, Guojun, Lin, Wei, Liu, Yong, Yan, Rui |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
by: Jin, Song, et al.
Published: (2025)
by: Jin, Song, et al.
Published: (2025)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
by: Zhang, Juntian, et al.
Published: (2025)
by: Zhang, Juntian, et al.
Published: (2025)
Beyond Static Testbeds: An Interaction-Centric Agent Simulation Platform for Dynamic Recommender Systems
by: Jin, Song, et al.
Published: (2025)
by: Jin, Song, et al.
Published: (2025)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025)
by: Xun, Shuhang, et al.
Published: (2025)
Optimal Portfolio Construction -- A Reinforcement Learning Embedded Bayesian Hierarchical Risk Parity (RL-BHRP) Approach
by: Kang, Shaofeng, et al.
Published: (2025)
by: Kang, Shaofeng, et al.
Published: (2025)
AirCopBench: A Benchmark for Multi-drone Collaborative Embodied Perception and Reasoning
by: Zha, Jirong, et al.
Published: (2025)
by: Zha, Jirong, et al.
Published: (2025)
HiBench: Benchmarking LLMs Capability on Hierarchical Structure Reasoning
by: Jiang, Zhuohang, et al.
Published: (2025)
by: Jiang, Zhuohang, et al.
Published: (2025)
MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluation
by: Li, Xiaoyuan, et al.
Published: (2025)
by: Li, Xiaoyuan, et al.
Published: (2025)
PlantMarkerBench: A Multi-Species Benchmark for Evidence-Grounded Plant Marker Reasoning
by: Dip, Sajib Acharjee, et al.
Published: (2026)
by: Dip, Sajib Acharjee, et al.
Published: (2026)
Dental-TriageBench: Benchmarking Multimodal Reasoning for Hierarchical Dental Triage
by: He, Ziyi, et al.
Published: (2026)
by: He, Ziyi, et al.
Published: (2026)
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
by: Ma, David, et al.
Published: (2025)
by: Ma, David, et al.
Published: (2025)
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
by: Li, Xuzhao, et al.
Published: (2025)
by: Li, Xuzhao, et al.
Published: (2025)
MSC-Bench: Benchmarking and Analyzing Multi-Sensor Corruption for Driving Perception
by: Hao, Xiaoshuai, et al.
Published: (2025)
by: Hao, Xiaoshuai, et al.
Published: (2025)
MergeBench: A Benchmark for Merging Domain-Specialized LLMs
by: He, Yifei, et al.
Published: (2025)
by: He, Yifei, et al.
Published: (2025)
EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations
by: Li, Jia, et al.
Published: (2024)
by: Li, Jia, et al.
Published: (2024)
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
by: Li, Gengluo, et al.
Published: (2026)
by: Li, Gengluo, et al.
Published: (2026)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
by: Zhang, Daoan, et al.
Published: (2025)
by: Zhang, Daoan, et al.
Published: (2025)
Your Reasoning Benchmark May Not Test Reasoning: Revealing Perception Bottleneck in Abstract Reasoning Benchmarks
by: Wang, Xinhe, et al.
Published: (2025)
by: Wang, Xinhe, et al.
Published: (2025)
MultiKernelBench: A Multi-Platform Benchmark for Kernel Generation
by: Wen, Zhongzhen, et al.
Published: (2025)
by: Wen, Zhongzhen, et al.
Published: (2025)
The Affleck-Dine Curvaton
by: Ireland, Aurora, et al.
Published: (2024)
by: Ireland, Aurora, et al.
Published: (2024)
Affleck-Dine Leptoflavorgenesis
by: Akita, Kensuke, et al.
Published: (2025)
by: Akita, Kensuke, et al.
Published: (2025)
Dining in Big D
by: Raffetto, Francis
Published: (1971)
by: Raffetto, Francis
Published: (1971)
The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agents
by: Liu, Yuhan, et al.
Published: (2024)
by: Liu, Yuhan, et al.
Published: (2024)
EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models
by: Huang, Junquan, et al.
Published: (2025)
by: Huang, Junquan, et al.
Published: (2025)
MASLegalBench: Benchmarking Multi-Agent Systems in Deductive Legal Reasoning
by: Jing, Huihao, et al.
Published: (2025)
by: Jing, Huihao, et al.
Published: (2025)
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
by: Li, Linfei, et al.
Published: (2025)
by: Li, Linfei, et al.
Published: (2025)
HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery
by: Zhang, Yaping, et al.
Published: (2025)
by: Zhang, Yaping, et al.
Published: (2025)
MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark
by: Liu, Hongwei, et al.
Published: (2024)
by: Liu, Hongwei, et al.
Published: (2024)
PolarQuant: Leveraging Polar Transformation for Efficient Key Cache Quantization and Decoding Acceleration
by: Wu, Songhao, et al.
Published: (2025)
by: Wu, Songhao, et al.
Published: (2025)
RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios
by: Zhang, Jun, et al.
Published: (2025)
by: Zhang, Jun, et al.
Published: (2025)
Semantic Convergence: Harmonizing Recommender Systems via Two-Stage Alignment and Behavioral Semantic Tokenization
by: Li, Guanghan, et al.
Published: (2024)
by: Li, Guanghan, et al.
Published: (2024)
Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning
by: Zhao, Bingchen, et al.
Published: (2024)
by: Zhao, Bingchen, et al.
Published: (2024)
Honduras : Dining out, Touring
Affleck-Dine Dirac Leptogenesis
by: Barrie, Neil D., et al.
Published: (2024)
by: Barrie, Neil D., et al.
Published: (2024)
Dining Etiquette for Development Professionals
by: Sarah Ammerman
Published: (2024)
by: Sarah Ammerman
Published: (2024)
QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation
by: Hong, Mengze, et al.
Published: (2025)
by: Hong, Mengze, et al.
Published: (2025)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
by: Liu, Yuyang, et al.
Published: (2025)
by: Liu, Yuyang, et al.
Published: (2025)
Sustainability in Italian Dining: A Comparative Study of Perceptions in Full‐Service Restaurants and Agritourism
by: Roberta Minazzi, et al.
Published: (2026)
by: Roberta Minazzi, et al.
Published: (2026)
RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems
by: Zeng, Wenwen, et al.
Published: (2026)
by: Zeng, Wenwen, et al.
Published: (2026)
MedDialBench: Benchmarking LLM Diagnostic Robustness under Parametric Adversarial Patient Behaviors
by: Luo, Xiaotian, et al.
Published: (2026)
by: Luo, Xiaotian, et al.
Published: (2026)
Similar Items
-
Tagging the Thought: Unlocking Personalization Reasoning via Reinforcement Learning
by: Jin, Song, et al.
Published: (2025) -
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
by: Zhang, Juntian, et al.
Published: (2025) -
Beyond Static Testbeds: An Interaction-Centric Agent Simulation Platform for Dynamic Recommender Systems
by: Jin, Song, et al.
Published: (2025) -
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
by: Xun, Shuhang, et al.
Published: (2025) -
Optimal Portfolio Construction -- A Reinforcement Learning Embedded Bayesian Hierarchical Risk Parity (RL-BHRP) Approach
by: Kang, Shaofeng, et al.
Published: (2025)