RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Ruoxuan, Gao, Jidong, Wen, Bin, Xie, Hongxia, Zhang, Chenming, Shuai, Hong-Han, Cheng, Wen-Huang |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
RecipeGen: A Benchmark for Real-World Recipe Image Generation
by: Zhang, Ruoxuan, et al.
Published: (2025)
by: Zhang, Ruoxuan, et al.
Published: (2025)
CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation
by: Zhang, Ruoxuan, et al.
Published: (2025)
by: Zhang, Ruoxuan, et al.
Published: (2025)
EmoArt: A Multidimensional Dataset for Emotion-Aware Artistic Generation
by: Zhang, Cheng, et al.
Published: (2025)
by: Zhang, Cheng, et al.
Published: (2025)
Single Document Image Highlight Removal via A Large-Scale Real-World Dataset and A Location-Aware Network
by: Pan, Lu, et al.
Published: (2025)
by: Pan, Lu, et al.
Published: (2025)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
by: Zhou, Zhiyu, et al.
Published: (2026)
by: Zhou, Zhiyu, et al.
Published: (2026)
Retrieval Augmented Recipe Generation
by: Liu, Guoshan, et al.
Published: (2024)
by: Liu, Guoshan, et al.
Published: (2024)
ChefFusion: Multimodal Foundation Model Integrating Recipe and Food Image Generation
by: Li, Peiyu, et al.
Published: (2024)
by: Li, Peiyu, et al.
Published: (2024)
Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models
by: Hsueh, Hao-Chien, et al.
Published: (2025)
by: Hsueh, Hao-Chien, et al.
Published: (2025)
Meta CLIP 2: A Worldwide Scaling Recipe
by: Chuang, Yung-Sung, et al.
Published: (2025)
by: Chuang, Yung-Sung, et al.
Published: (2025)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
by: Chen, Shuang, et al.
Published: (2026)
by: Chen, Shuang, et al.
Published: (2026)
XSeg: A Large-scale X-ray Contraband Segmentation Benchmark For Real-World Security Screening
by: Gao, Hongxia, et al.
Published: (2026)
by: Gao, Hongxia, et al.
Published: (2026)
Chapter GenRecipe for Generating Recipes from Videos through Deep Learning
by: Sin-wai, Chan
Published: (2026)
by: Sin-wai, Chan
Published: (2026)
Chapter GenRecipe for Generating Recipes from Videos through Deep Learning
by: Sin-wai, Chan
Published: (2026)
by: Sin-wai, Chan
Published: (2026)
Attribute-Grounded Selective Reasoning for Artwork Emotion Understanding with Multimodal Large Language Models
by: Zhang, Cheng, et al.
Published: (2026)
by: Zhang, Cheng, et al.
Published: (2026)
Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents
by: Wen, Bin, et al.
Published: (2026)
by: Wen, Bin, et al.
Published: (2026)
A Recipe for CAC: Mosaic-based Generalized Loss for Improved Class-Agnostic Counting
by: Chou, Tsung-Han, et al.
Published: (2024)
by: Chou, Tsung-Han, et al.
Published: (2024)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
by: Peng, Xiangyu, et al.
Published: (2026)
by: Peng, Xiangyu, et al.
Published: (2026)
HoneyBee: Data Recipes for Vision-Language Reasoners
by: Bansal, Hritik, et al.
Published: (2025)
by: Bansal, Hritik, et al.
Published: (2025)
Recipe Generation from Unsegmented Cooking Videos
by: Nishimura, Taichi, et al.
Published: (2022)
by: Nishimura, Taichi, et al.
Published: (2022)
Datasets and Recipes for Video Temporal Grounding via Reinforcement Learning
by: Chen, Ruizhe, et al.
Published: (2025)
by: Chen, Ruizhe, et al.
Published: (2025)
A Recipe for Generating 3D Worlds From a Single Image
by: Schwarz, Katja, et al.
Published: (2025)
by: Schwarz, Katja, et al.
Published: (2025)
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
by: Imajuku, Yuki, et al.
Published: (2024)
by: Imajuku, Yuki, et al.
Published: (2024)
On Occlusions in Video Action Detection: Benchmark Datasets And Training Recipes
by: Modi, Rajat, et al.
Published: (2024)
by: Modi, Rajat, et al.
Published: (2024)
Muon in Vision Transformers: Optimizer-Recipe Interactions and Gradient Spectra
by: Southworth, Ben S., et al.
Published: (2026)
by: Southworth, Ben S., et al.
Published: (2026)
Deep Image-to-Recipe Translation
by: Ma, Jiangqin, et al.
Published: (2024)
by: Ma, Jiangqin, et al.
Published: (2024)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
by: Deng, Andong, et al.
Published: (2026)
by: Deng, Andong, et al.
Published: (2026)
A Simple Recipe for Language-guided Domain Generalized Segmentation
by: Fahes, Mohammad, et al.
Published: (2023)
by: Fahes, Mohammad, et al.
Published: (2023)
Vero: An Open RL Recipe for General Visual Reasoning
by: Sarch, Gabriel, et al.
Published: (2026)
by: Sarch, Gabriel, et al.
Published: (2026)
Customize Your Visual Autoregressive Recipe with Set Autoregressive Modeling
by: Liu, Wenze, et al.
Published: (2024)
by: Liu, Wenze, et al.
Published: (2024)
Empirical Recipes for Efficient and Compact Vision-Language Models
by: Huang, Jiabo, et al.
Published: (2026)
by: Huang, Jiabo, et al.
Published: (2026)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
by: Zhu, Jinguo, et al.
Published: (2025)
by: Zhu, Jinguo, et al.
Published: (2025)
VLANeXt: Recipes for Building Strong VLA Models
by: Wu, Xiao-Ming, et al.
Published: (2026)
by: Wu, Xiao-Ming, et al.
Published: (2026)
Tarsier: Recipes for Training and Evaluating Large Video Description Models
by: Wang, Jiawei, et al.
Published: (2024)
by: Wang, Jiawei, et al.
Published: (2024)
OmChat: A Recipe to Train Multimodal Language Models with Strong Long Context and Video Understanding
by: Zhao, Tiancheng, et al.
Published: (2024)
by: Zhao, Tiancheng, et al.
Published: (2024)
Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation
by: Ren, Zhiyao, et al.
Published: (2025)
by: Ren, Zhiyao, et al.
Published: (2025)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
by: Gao, Hong, et al.
Published: (2025)
by: Gao, Hong, et al.
Published: (2025)
Perspective-Aware Teaching: Adapting Knowledge for Heterogeneous Distillation
by: Lin, Jhe-Hao, et al.
Published: (2025)
by: Lin, Jhe-Hao, et al.
Published: (2025)
Understanding Multimodal Deep Neural Networks: A Concept Selection View
by: Shang, Chenming, et al.
Published: (2024)
by: Shang, Chenming, et al.
Published: (2024)
AlignedGen: Aligning Style Across Generated Images
by: Zhang, Jiexuan, et al.
Published: (2025)
by: Zhang, Jiexuan, et al.
Published: (2025)
OSCAR: Object Status and Contextual Awareness for Recipes to Support Non-Visual Cooking
by: Li, Franklin Mingzhe, et al.
Published: (2025)
by: Li, Franklin Mingzhe, et al.
Published: (2025)
Similar Items
-
RecipeGen: A Benchmark for Real-World Recipe Image Generation
by: Zhang, Ruoxuan, et al.
Published: (2025) -
CookAnything: A Framework for Flexible and Consistent Multi-Step Recipe Image Generation
by: Zhang, Ruoxuan, et al.
Published: (2025) -
EmoArt: A Multidimensional Dataset for Emotion-Aware Artistic Generation
by: Zhang, Cheng, et al.
Published: (2025) -
Single Document Image Highlight Removal via A Large-Scale Real-World Dataset and A Location-Aware Network
by: Pan, Lu, et al.
Published: (2025) -
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
by: Zhou, Zhiyu, et al.
Published: (2026)