From Canteen Food to Daily Meals: Generalizing Food Recognition to More Practical Scenarios
Fuente:
arXiv
Salvato in:
| Autori principali: | Liu, Guoshan, Jiao, Yang, Chen, Jingjing, Zhu, Bin, Jiang, Yu-Gang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
Retrieval Augmented Recipe Generation
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
di: Liu, Guoshan, et al.
Pubblicazione: (2024)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
di: Yin, Yuehao, et al.
Pubblicazione: (2023)
di: Yin, Yuehao, et al.
Pubblicazione: (2023)
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion
di: Qi, Huiyan, et al.
Pubblicazione: (2025)
di: Qi, Huiyan, et al.
Pubblicazione: (2025)
Domain Expansion and Boundary Growth for Open-Set Single-Source Domain Generalization
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
di: Jiao, Pengkun, et al.
Pubblicazione: (2025)
Benchmarking Gaslighting Negation Attacks Against Reasoning Models
di: Zhu, Bin, et al.
Pubblicazione: (2025)
di: Zhu, Bin, et al.
Pubblicazione: (2025)
NutrifyAI: An AI-Powered System for Real-Time Food Detection, Nutritional Analysis, and Personalized Meal Recommendations
di: Han, Michelle, et al.
Pubblicazione: (2024)
di: Han, Michelle, et al.
Pubblicazione: (2024)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
Unlocking Textual and Visual Wisdom: Open-Vocabulary 3D Object Detection Enhanced by Comprehensive Guidance from Text and Image
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
di: Jiao, Pengkun, et al.
Pubblicazione: (2024)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
di: Jiao, Yang, et al.
Pubblicazione: (2025)
di: Jiao, Yang, et al.
Pubblicazione: (2025)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
di: Li, Yian, et al.
Pubblicazione: (2024)
di: Li, Yian, et al.
Pubblicazione: (2024)
NuScenes-QA: A Multi-modal Visual Question Answering Benchmark for Autonomous Driving Scenario
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
di: Qian, Tianwen, et al.
Pubblicazione: (2023)
Fraesormer: Learning Adaptive Sparse Transformer for Efficient Food Recognition
di: Zou, Shun, et al.
Pubblicazione: (2025)
di: Zou, Shun, et al.
Pubblicazione: (2025)
SalientFusion: Context-Aware Compositional Zero-Shot Food Recognition
di: Song, Jiajun, et al.
Pubblicazione: (2025)
di: Song, Jiajun, et al.
Pubblicazione: (2025)
Automatic Recognition of Food Ingestion Environment from the AIM-2 Wearable Sensor
di: Huang, Yuning, et al.
Pubblicazione: (2024)
di: Huang, Yuning, et al.
Pubblicazione: (2024)
Food Portion Estimation: From Pixels to Calories
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
di: Jain, Riddhi, et al.
Pubblicazione: (2025)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
di: Li, Yian, et al.
Pubblicazione: (2026)
di: Li, Yian, et al.
Pubblicazione: (2026)
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
di: Tang, Ziyao, et al.
Pubblicazione: (2026)
di: Tang, Ziyao, et al.
Pubblicazione: (2026)
ControlThinker: Unveiling Latent Semantics for Controllable Image Generation through Visual Reasoning
di: Han, Feng, et al.
Pubblicazione: (2025)
di: Han, Feng, et al.
Pubblicazione: (2025)
Stabilizing Temporal Inference Dynamics for Online Surgical Phase Recognition
di: Liu, Yang, et al.
Pubblicazione: (2026)
di: Liu, Yang, et al.
Pubblicazione: (2026)
Understanding the Limitations of Diffusion Concept Algebra Through Food
di: Zeng, E. Zhixuan, et al.
Pubblicazione: (2024)
di: Zeng, E. Zhixuan, et al.
Pubblicazione: (2024)
EAGLE: Towards Efficient Arbitrary Referring Visual Prompts Comprehension for Multimodal Large Language Models
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
di: Zhang, Jiacheng, et al.
Pubblicazione: (2024)
January Food Benchmark (JFB): A Public Benchmark Dataset and Evaluation Suite for Multimodal Food Analysis
di: Hosseinian, Amir, et al.
Pubblicazione: (2025)
di: Hosseinian, Amir, et al.
Pubblicazione: (2025)
Food Image Generation on Multi-Noun Categories
di: Pan, Xinyue, et al.
Pubblicazione: (2025)
di: Pan, Xinyue, et al.
Pubblicazione: (2025)
Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition
di: Romero-Tapiador, Sergio, et al.
Pubblicazione: (2025)
di: Romero-Tapiador, Sergio, et al.
Pubblicazione: (2025)
Long-Tailed Continual Learning For Visual Food Recognition
di: He, Jiangpeng, et al.
Pubblicazione: (2023)
di: He, Jiangpeng, et al.
Pubblicazione: (2023)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
di: Deng, Linger, et al.
Pubblicazione: (2024)
di: Deng, Linger, et al.
Pubblicazione: (2024)
Feature-Enhanced TResNet for Fine-Grained Food Image Classification
di: Liu, Lulu, et al.
Pubblicazione: (2025)
di: Liu, Lulu, et al.
Pubblicazione: (2025)
How Much You Ate? Food Portion Estimation on Spoons
di: Sharma, Aaryam, et al.
Pubblicazione: (2024)
di: Sharma, Aaryam, et al.
Pubblicazione: (2024)
Res-VMamba: Fine-Grained Food Category Visual Classification Using Selective State Space Models with Deep Residual Learning
di: Chen, Chi-Sheng, et al.
Pubblicazione: (2024)
di: Chen, Chi-Sheng, et al.
Pubblicazione: (2024)
Swin-TUNA : A Novel PEFT Approach for Accurate Food Image Segmentation
di: Chen, Haotian, et al.
Pubblicazione: (2025)
di: Chen, Haotian, et al.
Pubblicazione: (2025)
Food Recognition and Nutritional Apps
di: Rahman, Lubnaa Abdur, et al.
Pubblicazione: (2023)
di: Rahman, Lubnaa Abdur, et al.
Pubblicazione: (2023)
Artificial Intelligence in the Food Industry: Food Waste Estimation based on Computer Vision, a Brief Case Study in a University Dining Hall
di: Rokhva, Shayan, et al.
Pubblicazione: (2025)
di: Rokhva, Shayan, et al.
Pubblicazione: (2025)
FDDet: Achieving Data-Efficient Food Defect Detection Under Real-World Scenarios
di: Xu, Ruihao, et al.
Pubblicazione: (2026)
di: Xu, Ruihao, et al.
Pubblicazione: (2026)
Lumen: Unleashing Versatile Vision-Centric Capabilities of Large Multimodal Models
di: Jiao, Yang, et al.
Pubblicazione: (2024)
di: Jiao, Yang, et al.
Pubblicazione: (2024)
FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images
di: Ishraq, Sabab, et al.
Pubblicazione: (2026)
di: Ishraq, Sabab, et al.
Pubblicazione: (2026)
FMiFood: Multi-modal Contrastive Learning for Food Image Classification
di: Pan, Xinyue, et al.
Pubblicazione: (2024)
di: Pan, Xinyue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
di: Jiao, Pengkun, et al.
Pubblicazione: (2024) -
Retrieval Augmented Recipe Generation
di: Liu, Guoshan, et al.
Pubblicazione: (2024) -
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
di: Yin, Yuehao, et al.
Pubblicazione: (2023) -
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
di: Jiao, Pengkun, et al.
Pubblicazione: (2024) -
Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion
di: Qi, Huiyan, et al.
Pubblicazione: (2025)