ChefFusion: Multimodal Foundation Model Integrating Recipe and Food Image Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Peiyu, Huang, Xiaobao, Tian, Yijun, Chawla, Nitesh V. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
di: Imajuku, Yuki, et al.
Pubblicazione: (2024)
RecipeGen: A Benchmark for Real-World Recipe Image Generation
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025)
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025)
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025)
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025)
Do Multimodal Large Language Models Understand Welding?
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025)
VisualChef: Generating Visual Aids in Cooking via Mask Inpainting
di: Kuzyk, Oleh, et al.
Pubblicazione: (2025)
di: Kuzyk, Oleh, et al.
Pubblicazione: (2025)
AgentDrug: Utilizing Large Language Models in An Agentic Workflow for Zero-Shot Molecular Editing
di: Le, Khiem, et al.
Pubblicazione: (2024)
di: Le, Khiem, et al.
Pubblicazione: (2024)
LayerFusion: Harmonized Multi-Layer Text-to-Image Generation with Generative Priors
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
di: Dalva, Yusuf, et al.
Pubblicazione: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
di: Wang, Qing, et al.
Pubblicazione: (2025)
di: Wang, Qing, et al.
Pubblicazione: (2025)
MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension
di: Le, Khiem, et al.
Pubblicazione: (2024)
di: Le, Khiem, et al.
Pubblicazione: (2024)
Generating Multimodal Images with GAN: Integrating Text, Image, and Style
di: Tan, Chaoyi, et al.
Pubblicazione: (2025)
di: Tan, Chaoyi, et al.
Pubblicazione: (2025)
Task-Generalized Adaptive Cross-Domain Learning for Multimodal Image Fusion
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
di: Wang, Mengyu, et al.
Pubblicazione: (2025)
OpenSearch-VL: An Open Recipe for Frontier Multimodal Search Agents
di: Chen, Shuang, et al.
Pubblicazione: (2026)
di: Chen, Shuang, et al.
Pubblicazione: (2026)
Retrieval Augmented Recipe Generation
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics
di: Li, Yixuan, et al.
Pubblicazione: (2025)
di: Li, Yixuan, et al.
Pubblicazione: (2025)
Plug-and-Play Logit Fusion for Heterogeneous Pathology Foundation Models
di: Huang, Gexin, et al.
Pubblicazione: (2026)
di: Huang, Gexin, et al.
Pubblicazione: (2026)
FlexID: Training-Free Flexible Identity Injection via Intent-Aware Modulation for Text-to-Image Generation
di: Li, Guandong, et al.
Pubblicazione: (2026)
di: Li, Guandong, et al.
Pubblicazione: (2026)
MTA-Agent: An Open Recipe for Multimodal Deep Search Agents
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
di: Peng, Xiangyu, et al.
Pubblicazione: (2026)
Fusion of Foundation and Vision Transformer Model Features for Dermatoscopic Image Classification
di: Mahbod, Amirreza, et al.
Pubblicazione: (2025)
di: Mahbod, Amirreza, et al.
Pubblicazione: (2025)
InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models
di: Zhu, Jinguo, et al.
Pubblicazione: (2025)
di: Zhu, Jinguo, et al.
Pubblicazione: (2025)
AdaFusion: Prompt-Guided Inference with Adaptive Fusion of Pathology Foundation Models
di: Xiao, Yuxiang, et al.
Pubblicazione: (2025)
di: Xiao, Yuxiang, et al.
Pubblicazione: (2025)
Rank-Aware Agglomeration of Foundation Models for Immunohistochemistry Image Cell Counting
di: Huang, Zuqi, et al.
Pubblicazione: (2025)
di: Huang, Zuqi, et al.
Pubblicazione: (2025)
Foundation Model Embeddings Meet Blended Emotions: A Multimodal Fusion Approach for the BLEMORE Challenge
di: Chapariniya, Masoumeh, et al.
Pubblicazione: (2026)
di: Chapariniya, Masoumeh, et al.
Pubblicazione: (2026)
Integrating Reinforcement Learning with Visual Generative Models: Foundations and Advances
di: Liang, Yuanzhi, et al.
Pubblicazione: (2025)
di: Liang, Yuanzhi, et al.
Pubblicazione: (2025)
Object-Conditioned Energy-Based Attention Map Alignment in Text-to-Image Diffusion Models
di: Zhang, Yasi, et al.
Pubblicazione: (2024)
di: Zhang, Yasi, et al.
Pubblicazione: (2024)
FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba
di: Xie, Xinyu, et al.
Pubblicazione: (2024)
di: Xie, Xinyu, et al.
Pubblicazione: (2024)
Warm Diffusion: Recipe for Blur-Noise Mixture Diffusion Models
di: Hsueh, Hao-Chien, et al.
Pubblicazione: (2025)
di: Hsueh, Hao-Chien, et al.
Pubblicazione: (2025)
Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer
di: Image Team, et al.
Pubblicazione: (2025)
di: Image Team, et al.
Pubblicazione: (2025)
GraphAvatar: Compact Head Avatars with GNN-Generated 3D Gaussians
di: Wei, Xiaobao, et al.
Pubblicazione: (2024)
di: Wei, Xiaobao, et al.
Pubblicazione: (2024)
Uni-Fusion: Universal Continuous Mapping
di: Yuan, Yijun, et al.
Pubblicazione: (2023)
di: Yuan, Yijun, et al.
Pubblicazione: (2023)
Rethinking Early-Fusion Strategies for Improved Multimodal Image Segmentation
di: Shen, Zhengwen, et al.
Pubblicazione: (2025)
di: Shen, Zhengwen, et al.
Pubblicazione: (2025)
MSGFusion: Multimodal Scene Graph-Guided Infrared and Visible Image Fusion
di: Li, Guihui, et al.
Pubblicazione: (2025)
di: Li, Guihui, et al.
Pubblicazione: (2025)
Generative Multi-Focus Image Fusion
di: Xie, Xinzhe, et al.
Pubblicazione: (2025)
di: Xie, Xinzhe, et al.
Pubblicazione: (2025)
Leveraging Generic Foundation Models for Multimodal Surgical Data Analysis
di: Pezold, Simon, et al.
Pubblicazione: (2025)
di: Pezold, Simon, et al.
Pubblicazione: (2025)
A Generative Foundation Model for Multimodal Histopathology
di: Xiang, Jinxi, et al.
Pubblicazione: (2026)
di: Xiang, Jinxi, et al.
Pubblicazione: (2026)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
di: Zhang, Boqiang, et al.
Pubblicazione: (2025)
di: Zhang, Boqiang, et al.
Pubblicazione: (2025)
LIT: Large Language Model Driven Intention Tracking for Proactive Human-Robot Collaboration -- A Robot Sous-Chef Application
di: Huang, Zhe, et al.
Pubblicazione: (2024)
di: Huang, Zhe, et al.
Pubblicazione: (2024)
Reverse Prompt: Cracking the Recipe Inside Text-to-Image Generation
di: Ren, Zhiyao, et al.
Pubblicazione: (2025)
di: Ren, Zhiyao, et al.
Pubblicazione: (2025)
Fusion of Multi-scale Heterogeneous Pathology Foundation Models for Whole Slide Image Analysis
di: Yang, Zhidong, et al.
Pubblicazione: (2025)
di: Yang, Zhidong, et al.
Pubblicazione: (2025)
SMFusion: Semantic-Preserving Fusion of Multimodal Medical Images for Enhanced Clinical Diagnosis
di: Xiang, Haozhe, et al.
Pubblicazione: (2025)
di: Xiang, Haozhe, et al.
Pubblicazione: (2025)
Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
di: Gong, Lixue, et al.
Pubblicazione: (2025)
di: Gong, Lixue, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
di: Imajuku, Yuki, et al.
Pubblicazione: (2024) -
RecipeGen: A Benchmark for Real-World Recipe Image Generation
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025) -
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
di: Zhang, Ruoxuan, et al.
Pubblicazione: (2025) -
Do Multimodal Large Language Models Understand Welding?
di: Khvatskii, Grigorii, et al.
Pubblicazione: (2025) -
VisualChef: Generating Visual Aids in Cooking via Mask Inpainting
di: Kuzyk, Oleh, et al.
Pubblicazione: (2025)