Evaluating Menu OCR and Translation: A Benchmark for Aligning Human and Automated Evaluations in Large Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wu, Zhanglin, Song, Tengfei, Xie, Ning, Zhu, Mengli, Zhang, Weidong, Wu, Shuang, Li, Pengfei, Li, Chong, Zhu, Junhao, Yang, Hao, Sun, Shiliang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
par: Wu, Zhanglin, et autres
Publié: (2025)
par: Wu, Zhanglin, et autres
Publié: (2025)
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
par: Lu, Junxin, et autres
Publié: (2026)
par: Lu, Junxin, et autres
Publié: (2026)
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
par: Yu, Zhuang, et autres
Publié: (2025)
par: Yu, Zhuang, et autres
Publié: (2025)
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
par: Zhang, Miaosen, et autres
Publié: (2024)
par: Zhang, Miaosen, et autres
Publié: (2024)
HW-TSC's Submission to the CCMT 2024 Machine Translation Tasks
par: Wu, Zhanglin, et autres
Publié: (2024)
par: Wu, Zhanglin, et autres
Publié: (2024)
CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
par: Yang, Zhibo, et autres
Publié: (2024)
par: Yang, Zhibo, et autres
Publié: (2024)
Multimodal Machine Translation with Visual Scene Graph Pruning
par: Lu, Chenyu, et autres
Publié: (2025)
par: Lu, Chenyu, et autres
Publié: (2025)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
par: Yang, Jialiang, et autres
Publié: (2026)
par: Yang, Jialiang, et autres
Publié: (2026)
Emotion Knowledge Enhancement for Vision Large Language Models: A Self-Verification Approach for High-Quality Emotion Instruction Data Generation
par: Wang, Feifan, et autres
Publié: (2025)
par: Wang, Feifan, et autres
Publié: (2025)
E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought
par: Sun, Meiqi, et autres
Publié: (2026)
par: Sun, Meiqi, et autres
Publié: (2026)
A Cognitive Evaluation Benchmark of Image Reasoning and Description for Large Vision-Language Models
par: Song, Xiujie, et autres
Publié: (2024)
par: Song, Xiujie, et autres
Publié: (2024)
SpatiaLQA: A Benchmark for Evaluating Spatial Logical Reasoning in Vision-Language Models
par: Xie, Yuechen, et autres
Publié: (2026)
par: Xie, Yuechen, et autres
Publié: (2026)
Benchmarking XAI Explanations with Human-Aligned Evaluations
par: Kazmierczak, Rémi, et autres
Publié: (2024)
par: Kazmierczak, Rémi, et autres
Publié: (2024)
Align-then-Slide: A complete evaluation framework for Ultra-Long Document-Level Machine Translation
par: Guo, Jiaxin, et autres
Publié: (2025)
par: Guo, Jiaxin, et autres
Publié: (2025)
Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning
par: Yu, Haiyang, et autres
Publié: (2025)
par: Yu, Haiyang, et autres
Publié: (2025)
VMBench: A Benchmark for Perception-Aligned Video Motion Generation
par: Ling, Xinran, et autres
Publié: (2025)
par: Ling, Xinran, et autres
Publié: (2025)
PromptEVC: Controllable Emotional Voice Conversion with Natural Language Prompts
par: Qi, Tianhua, et autres
Publié: (2025)
par: Qi, Tianhua, et autres
Publié: (2025)
Choose the Final Translation from NMT and LLM hypotheses Using MBR Decoding: HW-TSC's Submission to the WMT24 General MT Shared Task
par: Wu, Zhanglin, et autres
Publié: (2024)
par: Wu, Zhanglin, et autres
Publié: (2024)
Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
par: Shi, Yang, et autres
Publié: (2025)
par: Shi, Yang, et autres
Publié: (2025)
PARROT: A Benchmark for Evaluating LLMs in Cross-System SQL Translation
par: Zhou, Wei, et autres
Publié: (2025)
par: Zhou, Wei, et autres
Publié: (2025)
A Framework for Human-Reason-Aligned Trajectory Evaluation in Automated Vehicles
par: Suryana, Lucas Elbert, et autres
Publié: (2025)
par: Suryana, Lucas Elbert, et autres
Publié: (2025)
RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG
par: Gao, Joshua, et autres
Publié: (2025)
par: Gao, Joshua, et autres
Publié: (2025)
DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models
par: Song, Jingyu, et autres
Publié: (2025)
par: Song, Jingyu, et autres
Publié: (2025)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
par: Gagnier, Henry, et autres
Publié: (2026)
par: Gagnier, Henry, et autres
Publié: (2026)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
par: Ishikawa, Reina, et autres
Publié: (2025)
par: Ishikawa, Reina, et autres
Publié: (2025)
Video-Bench: Human-Aligned Video Generation Benchmark
par: Han, Hui, et autres
Publié: (2025)
par: Han, Hui, et autres
Publié: (2025)
3‐4: Human Perception as a Measure: Evaluating Waveguide Non‐Uniformity in Augmented Reality Technology
par: Pengfei Li, et autres
Publié: (2024)
par: Pengfei Li, et autres
Publié: (2024)
GPT-4 vs. Human Translators: A Comprehensive Evaluation of Translation Quality Across Languages, Domains, and Expertise Levels
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation
par: Chen, Jiaju, et autres
Publié: (2025)
par: Chen, Jiaju, et autres
Publié: (2025)
OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation
par: Zhang, Junyuan, et autres
Publié: (2024)
par: Zhang, Junyuan, et autres
Publié: (2024)
On the Secrecy Performance of Pinching-Antenna Systems
par: Li, Nianzu, et autres
Publié: (2025)
par: Li, Nianzu, et autres
Publié: (2025)
Movable Antenna Enhanced DF and AF Relaying Systems: Performance Analysis and Optimization
par: Li, Nianzu, et autres
Publié: (2025)
par: Li, Nianzu, et autres
Publié: (2025)
Over-the-Air Computation via 2D Movable Antenna Array
par: Li, Nianzu, et autres
Publié: (2024)
par: Li, Nianzu, et autres
Publié: (2024)
OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities
par: Zhang, Peirong, et autres
Publié: (2025)
par: Zhang, Peirong, et autres
Publié: (2025)
Menú Veraniego
Publié: (2004)
Publié: (2004)
Menú Gourmet
Publié: (2007)
Publié: (2007)
Menú : Gastronomía
When Person Re-Identification Meets Event Camera: A Benchmark Dataset and An Attribute-guided Re-Identification Framework
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation
par: Sun, Peng, et autres
Publié: (2026)
par: Sun, Peng, et autres
Publié: (2026)
Documents similaires
-
DIMT25@ICDAR2025: HW-TSC's End-to-End Document Image Machine Translation System Leveraging Large Vision-Language Model
par: Wu, Zhanglin, et autres
Publié: (2025) -
Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation
par: Lu, Junxin, et autres
Publié: (2026) -
Memory Reviving, Continuing Learning and Beyond: Evaluation of Pre-trained Encoders and Decoders for Multimodal Machine Translation
par: Yu, Zhuang, et autres
Publié: (2025) -
Aligning Vision Models with Human Aesthetics in Retrieval: Benchmarks and Algorithms
par: Zhang, Miaosen, et autres
Publié: (2024) -
HW-TSC's Submission to the CCMT 2024 Machine Translation Tasks
par: Wu, Zhanglin, et autres
Publié: (2024)