LLaVA-Chef: A Multi-modal Generative Model for Food Recipes
Fuente:
arXiv
Guardado en:
| Autores principales: | Mohbat, Fnu, Zaki, Mohammed J. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language Models
por: Mohbat, Fnu, et al.
Publicado: (2025)
por: Mohbat, Fnu, et al.
Publicado: (2025)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024)
por: Zeer, Ahmed, et al.
Publicado: (2024)
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
por: Guo, Haiyang, et al.
Publicado: (2025)
por: Guo, Haiyang, et al.
Publicado: (2025)
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
por: Zhang, Jianyi, et al.
Publicado: (2024)
por: Zhang, Jianyi, et al.
Publicado: (2024)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)
por: Sun, Shenghuan, et al.
Publicado: (2024)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
por: Sun, Guohao, et al.
Publicado: (2024)
por: Sun, Guohao, et al.
Publicado: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
por: Cai, Mu, et al.
Publicado: (2023)
por: Cai, Mu, et al.
Publicado: (2023)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
por: Huang, Wenxuan, et al.
Publicado: (2024)
por: Huang, Wenxuan, et al.
Publicado: (2024)
TinyLLaVA: A Framework of Small-scale Large Multimodal Models
por: Zhou, Baichuan, et al.
Publicado: (2024)
por: Zhou, Baichuan, et al.
Publicado: (2024)
LLaVA-Critic: Learning to Evaluate Multimodal Models
por: Xiong, Tianyi, et al.
Publicado: (2024)
por: Xiong, Tianyi, et al.
Publicado: (2024)
Detecting Hope, Hate, and Emotion in Arabic Textual Speech and Multi-modal Memes Using Large Language Models
por: AlDahoul, Nouar, et al.
Publicado: (2025)
por: AlDahoul, Nouar, et al.
Publicado: (2025)
Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages
por: Andersland, Michael
Publicado: (2024)
por: Andersland, Michael
Publicado: (2024)
LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier
por: Chay-intr, T., et al.
Publicado: (2025)
por: Chay-intr, T., et al.
Publicado: (2025)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
por: Zhu, Yichen, et al.
Publicado: (2024)
por: Zhu, Yichen, et al.
Publicado: (2024)
G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model
por: Gao, Jiahui, et al.
Publicado: (2023)
por: Gao, Jiahui, et al.
Publicado: (2023)
LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models
por: Shi, Wenhao, et al.
Publicado: (2024)
por: Shi, Wenhao, et al.
Publicado: (2024)
LLaVA-Video: Video Instruction Tuning With Synthetic Data
por: Zhang, Yuanhan, et al.
Publicado: (2024)
por: Zhang, Yuanhan, et al.
Publicado: (2024)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
por: Wang, Ke, et al.
Publicado: (2024)
por: Wang, Ke, et al.
Publicado: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
por: Caffagni, Davide, et al.
Publicado: (2024)
por: Caffagni, Davide, et al.
Publicado: (2024)
X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment
por: Shin, Dongjae, et al.
Publicado: (2024)
por: Shin, Dongjae, et al.
Publicado: (2024)
Why do LLaVA Vision-Language Models Reply to Images in English?
por: Hinck, Musashi, et al.
Publicado: (2024)
por: Hinck, Musashi, et al.
Publicado: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
por: Liang, Yuci, et al.
Publicado: (2024)
por: Liang, Yuci, et al.
Publicado: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
por: Zhan, Xuhui, et al.
Publicado: (2025)
por: Zhan, Xuhui, et al.
Publicado: (2025)
LLaVA-Gemma: Accelerating Multimodal Foundation Models with a Compact Language Model
por: Hinck, Musashi, et al.
Publicado: (2024)
por: Hinck, Musashi, et al.
Publicado: (2024)
LogLLaMA: Transformer-based log anomaly detection with LLaMA
por: Yang, Zhuoyi, et al.
Publicado: (2025)
por: Yang, Zhuoyi, et al.
Publicado: (2025)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
por: Dialameh, Maryam, et al.
Publicado: (2025)
por: Dialameh, Maryam, et al.
Publicado: (2025)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
por: Lan, Zhibin, et al.
Publicado: (2024)
por: Lan, Zhibin, et al.
Publicado: (2024)
Spec-LLaVA: Accelerating Vision-Language Models with Dynamic Tree-Based Speculative Decoding
por: Huo, Mingxiao, et al.
Publicado: (2025)
por: Huo, Mingxiao, et al.
Publicado: (2025)
LLaVA-CMoE: Towards Continual Mixture of Experts for Large Vision-Language Models
por: Zhao, Hengyuan, et al.
Publicado: (2025)
por: Zhao, Hengyuan, et al.
Publicado: (2025)
Enhancing Document-Level Question Answering via Multi-Hop Retrieval-Augmented Generation with LLaMA 3
por: Huang, Xinyue, et al.
Publicado: (2025)
por: Huang, Xinyue, et al.
Publicado: (2025)
The Digital Sous Chef -- A Comparative Study on Fine-Tuning Language Models for Recipe Generation
por: Pundhir, Shubham, et al.
Publicado: (2025)
por: Pundhir, Shubham, et al.
Publicado: (2025)
LongAlign: A Recipe for Long Context Alignment of Large Language Models
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
por: Shang, Yuzhang, et al.
Publicado: (2024)
por: Shang, Yuzhang, et al.
Publicado: (2024)
Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data
por: Pham, Bao, et al.
Publicado: (2026)
por: Pham, Bao, et al.
Publicado: (2026)
Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework
por: Statkiewicz, Grzegorz, et al.
Publicado: (2026)
por: Statkiewicz, Grzegorz, et al.
Publicado: (2026)
Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization
por: Du, He, et al.
Publicado: (2026)
por: Du, He, et al.
Publicado: (2026)
DanmakuTPPBench: A Multi-modal Benchmark for Temporal Point Process Modeling and Understanding
por: Jiang, Yue, et al.
Publicado: (2025)
por: Jiang, Yue, et al.
Publicado: (2025)
Ejemplares similares
-
KERL: Knowledge-Enhanced Personalized Recipe Recommendation using Large Language Models
por: Mohbat, Fnu, et al.
Publicado: (2025) -
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
por: Zeer, Ahmed, et al.
Publicado: (2024) -
HiDe-LLaVA: Hierarchical Decoupling for Continual Instruction Tuning of Multimodal Large Language Model
por: Guo, Haiyang, et al.
Publicado: (2025) -
MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning
por: Zhang, Jianyi, et al.
Publicado: (2024) -
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
por: Sun, Shenghuan, et al.
Publicado: (2024)