E-comIQ-ZH: A Human-Aligned Dataset and Benchmark for Fine-Grained Evaluation of E-commerce Posters with Chain-of-Thought
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Sun, Meiqi, Li, Mingyu, Zhu, Junxiong |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation
von: Feng, Yuheng, et al.
Veröffentlicht: (2026)
von: Feng, Yuheng, et al.
Veröffentlicht: (2026)
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
von: Pereira, João, et al.
Veröffentlicht: (2026)
von: Pereira, João, et al.
Veröffentlicht: (2026)
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
von: Liu, Runzhou, et al.
Veröffentlicht: (2026)
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
von: Sun, Xinyu, et al.
Veröffentlicht: (2026)
von: Sun, Xinyu, et al.
Veröffentlicht: (2026)
Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset
von: Li, Qi, et al.
Veröffentlicht: (2024)
von: Li, Qi, et al.
Veröffentlicht: (2024)
SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design
von: Yu, Yunjie, et al.
Veröffentlicht: (2025)
von: Yu, Yunjie, et al.
Veröffentlicht: (2025)
VMBench: A Benchmark for Perception-Aligned Video Motion Generation
von: Ling, Xinran, et al.
Veröffentlicht: (2025)
von: Ling, Xinran, et al.
Veröffentlicht: (2025)
E-VAds: An E-commerce Short Videos Understanding Benchmark for MLLMs
von: Liu, Xianjie, et al.
Veröffentlicht: (2026)
von: Liu, Xianjie, et al.
Veröffentlicht: (2026)
Aligning Anime Video Generation with Human Feedback
von: Zhu, Bingwen, et al.
Veröffentlicht: (2025)
von: Zhu, Bingwen, et al.
Veröffentlicht: (2025)
Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
von: Qiu, Yansheng, et al.
Veröffentlicht: (2025)
FreeFly-Thinking : Aligning Chain-of-Thought Reasoning with Continuous UAV Navigation
von: Zhou, Jiaxu, et al.
Veröffentlicht: (2026)
von: Zhou, Jiaxu, et al.
Veröffentlicht: (2026)
MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models
von: Cai, Huanqia, et al.
Veröffentlicht: (2025)
von: Cai, Huanqia, et al.
Veröffentlicht: (2025)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning
von: Shao, Hao, et al.
Veröffentlicht: (2024)
von: Shao, Hao, et al.
Veröffentlicht: (2024)
BLM-Guard: Explainable Multimodal Ad Moderation with Chain-of-Thought and Policy-Aligned Rewards
von: Yang, Yiran, et al.
Veröffentlicht: (2026)
von: Yang, Yiran, et al.
Veröffentlicht: (2026)
Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition
von: He, Yu, et al.
Veröffentlicht: (2026)
von: He, Yu, et al.
Veröffentlicht: (2026)
Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks
von: Jin, Jing, et al.
Veröffentlicht: (2026)
von: Jin, Jing, et al.
Veröffentlicht: (2026)
Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
Human-Activity AGV Quality Assessment: A Benchmark Dataset and an Objective Evaluation Metric
von: Zhang, Zhichao, et al.
Veröffentlicht: (2024)
von: Zhang, Zhichao, et al.
Veröffentlicht: (2024)
Fine-Grained Open-Vocabulary Object Detection with Fined-Grained Prompts: Task, Dataset and Benchmark
von: Liu, Ying, et al.
Veröffentlicht: (2025)
von: Liu, Ying, et al.
Veröffentlicht: (2025)
AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images
von: Li, Yunhao, et al.
Veröffentlicht: (2025)
von: Li, Yunhao, et al.
Veröffentlicht: (2025)
Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation
von: Ishikawa, Reina, et al.
Veröffentlicht: (2025)
von: Ishikawa, Reina, et al.
Veröffentlicht: (2025)
Unified Multimodal Chain-of-Thought Reward Model through Reinforcement Fine-Tuning
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
von: Wang, Yibin, et al.
Veröffentlicht: (2025)
Unsupervised Visual Chain-of-Thought Reasoning via Preference Optimization
von: Zhao, Kesen, et al.
Veröffentlicht: (2025)
von: Zhao, Kesen, et al.
Veröffentlicht: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
von: Han, Songhao, et al.
Veröffentlicht: (2024)
von: Han, Songhao, et al.
Veröffentlicht: (2024)
WUTDet: A 100K-Scale Ship Detection Dataset and Benchmarks with Dense Small Objects
von: Liang, Junxiong, et al.
Veröffentlicht: (2026)
von: Liang, Junxiong, et al.
Veröffentlicht: (2026)
MJ-VIDEO: Fine-Grained Benchmarking and Rewarding Video Preferences in Video Generation
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
von: Tong, Haibo, et al.
Veröffentlicht: (2025)
EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation
von: Han, Shuhao, et al.
Veröffentlicht: (2024)
von: Han, Shuhao, et al.
Veröffentlicht: (2024)
VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
von: Khezresmaeilzadeh, Tina, et al.
Veröffentlicht: (2026)
von: Khezresmaeilzadeh, Tina, et al.
Veröffentlicht: (2026)
PresentBench: A Fine-Grained Rubric-Based Benchmark for Slide Generation
von: Chen, Xin-Sheng, et al.
Veröffentlicht: (2026)
von: Chen, Xin-Sheng, et al.
Veröffentlicht: (2026)
C-Drag: Chain-of-Thought Driven Motion Controller for Video Generation
von: Li, Yuhao, et al.
Veröffentlicht: (2025)
von: Li, Yuhao, et al.
Veröffentlicht: (2025)
Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach
von: Wang, Xincheng, et al.
Veröffentlicht: (2025)
von: Wang, Xincheng, et al.
Veröffentlicht: (2025)
SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing
von: Xiao, Yicheng, et al.
Veröffentlicht: (2026)
von: Xiao, Yicheng, et al.
Veröffentlicht: (2026)
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
von: Zhu, Lei, et al.
Veröffentlicht: (2026)
von: Zhu, Lei, et al.
Veröffentlicht: (2026)
FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
von: Hu, Shiyu, et al.
Veröffentlicht: (2024)
MagicMirror: A Large-Scale Dataset and Benchmark for Fine-Grained Artifacts Assessment in Text-to-Image Generation
von: Wang, Jia, et al.
Veröffentlicht: (2025)
von: Wang, Jia, et al.
Veröffentlicht: (2025)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
von: Li, Zijian, et al.
Veröffentlicht: (2025)
von: Li, Zijian, et al.
Veröffentlicht: (2025)
SkinCaRe: A Multimodal Dermatology Dataset Annotated with Medical Caption and Chain-of-Thought Reasoning
von: Shen, Yuhao, et al.
Veröffentlicht: (2024)
von: Shen, Yuhao, et al.
Veröffentlicht: (2024)
Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
von: Yu, Hong-Tao, et al.
Veröffentlicht: (2025)
Thinking with Images as Continuous Actions: Numerical Visual Chain-of-Thought
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
von: Zhao, Kesen, et al.
Veröffentlicht: (2026)
ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition
von: Felemban, Abdulwahab, et al.
Veröffentlicht: (2025)
von: Felemban, Abdulwahab, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation
von: Feng, Yuheng, et al.
Veröffentlicht: (2026) -
FineVAU: A Novel Human-Aligned Benchmark for Fine-Grained Video Anomaly Understanding
von: Pereira, João, et al.
Veröffentlicht: (2026) -
Human-Aligned MLLM Judges for Fine-Grained Image Editing Evaluation: A Benchmark, Framework, and Analysis
von: Liu, Runzhou, et al.
Veröffentlicht: (2026) -
TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval
von: Sun, Xinyu, et al.
Veröffentlicht: (2026) -
Benchmarking Badminton Action Recognition with a New Fine-Grained Dataset
von: Li, Qi, et al.
Veröffentlicht: (2024)