Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion
Fuente:
arXiv
Guardado en:
| Autores principales: | Qi, Huiyan, Zhu, Bin, Ngo, Chong-Wah, Chen, Jingjing, Lim, Ee-Peng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
por: Wu, Xiongwei, et al.
Publicado: (2024)
por: Wu, Xiongwei, et al.
Publicado: (2024)
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
por: Yin, Yuehao, et al.
Publicado: (2023)
por: Yin, Yuehao, et al.
Publicado: (2023)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
LLMs-based Augmentation for Domain Adaptation in Long-tailed Food Datasets
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
por: Jiao, Pengkun, et al.
Publicado: (2025)
por: Jiao, Pengkun, et al.
Publicado: (2025)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
por: Satar, Burak, et al.
Publicado: (2025)
por: Satar, Burak, et al.
Publicado: (2025)
Retrieval Augmented Recipe Generation
por: Liu, Guoshan, et al.
Publicado: (2024)
por: Liu, Guoshan, et al.
Publicado: (2024)
Interpretable Embedding for Ad-hoc Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
From Canteen Food to Daily Meals: Generalizing Food Recognition to More Practical Scenarios
por: Liu, Guoshan, et al.
Publicado: (2024)
por: Liu, Guoshan, et al.
Publicado: (2024)
Improving Interpretable Embeddings for Ad-hoc Video Search with Generative Captions and Multi-word Concept Bank
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
por: Zhu, Bin, et al.
Publicado: (2025)
por: Zhu, Bin, et al.
Publicado: (2025)
Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models
por: Tang, Ziyao, et al.
Publicado: (2026)
por: Tang, Ziyao, et al.
Publicado: (2026)
Class Agnostic Instance-level Descriptor for Visual Instance Search
por: Sun, Qi-Ying, et al.
Publicado: (2025)
por: Sun, Qi-Ying, et al.
Publicado: (2025)
OmniFood8K: Single-Image Nutrition Estimation via Hierarchical Frequency-Aligned Fusion
por: Yu, Dongjian, et al.
Publicado: (2026)
por: Yu, Dongjian, et al.
Publicado: (2026)
Environment-Aware Channel Prediction for Vehicular Communications: A Multimodal Visual Feature Fusion Framework
por: Zhang, Xuejian, et al.
Publicado: (2026)
por: Zhang, Xuejian, et al.
Publicado: (2026)
RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy
por: Chen, Aiyue, et al.
Publicado: (2025)
por: Chen, Aiyue, et al.
Publicado: (2025)
Restoring Linguistic Grounding in VLA Models via Train-Free Attention Recalibration
por: Zhang, Ninghao, et al.
Publicado: (2026)
por: Zhang, Ninghao, et al.
Publicado: (2026)
Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks
por: Guo, Yachan, et al.
Publicado: (2026)
por: Guo, Yachan, et al.
Publicado: (2026)
VG-CoT: Towards Trustworthy Visual Reasoning via Grounded Chain-of-Thought
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
por: Lim, Byeonggeuk, et al.
Publicado: (2026)
MoE-Enhanced Multi-Domain Feature Selection and Fusion for Fast Map-Free Trajectory Prediction
por: Xiong, Wenyi, et al.
Publicado: (2025)
por: Xiong, Wenyi, et al.
Publicado: (2025)
CookingDiffusion: Cooking Procedural Image Generation with Stable Diffusion
por: Wang, Yuan, et al.
Publicado: (2025)
por: Wang, Yuan, et al.
Publicado: (2025)
EMIFF: Enhanced Multi-scale Image Feature Fusion for Vehicle-Infrastructure Cooperative 3D Object Detection
por: Wang, Zhe, et al.
Publicado: (2024)
por: Wang, Zhe, et al.
Publicado: (2024)
FUSE-RSVLM: Feature Fusion Vision-Language Model for Remote Sensing
por: Dang, Yunkai, et al.
Publicado: (2025)
por: Dang, Yunkai, et al.
Publicado: (2025)
PosMLP-Video: Spatial and Temporal Relative Position Encoding for Efficient Video Recognition
por: Hao, Yanbin, et al.
Publicado: (2024)
por: Hao, Yanbin, et al.
Publicado: (2024)
Hierarchical Modeling for Medical Visual Question Answering with Cross-Attention Fusion
por: Zhang, Junkai, et al.
Publicado: (2025)
por: Zhang, Junkai, et al.
Publicado: (2025)
Benchmarking Gaslighting Negation Attacks Against Reasoning Models
por: Zhu, Bin, et al.
Publicado: (2025)
por: Zhu, Bin, et al.
Publicado: (2025)
Recognizing Multiple Ingredients in Food Images Using a Single-Ingredient Classification Model
por: Fu, Kun, et al.
Publicado: (2024)
por: Fu, Kun, et al.
Publicado: (2024)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
por: Wang, Yi, et al.
Publicado: (2026)
por: Wang, Yi, et al.
Publicado: (2026)
NutrifyAI: An AI-Powered System for Real-Time Food Detection, Nutritional Analysis, and Personalized Meal Recommendations
por: Han, Michelle, et al.
Publicado: (2024)
por: Han, Michelle, et al.
Publicado: (2024)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
por: Xu, Ziqiang, et al.
Publicado: (2025)
por: Xu, Ziqiang, et al.
Publicado: (2025)
Dynamic Multi-Target Fusion for Efficient Audio-Visual Navigation
por: Yu, Yinfeng, et al.
Publicado: (2025)
por: Yu, Yinfeng, et al.
Publicado: (2025)
Multi-Modal Feature Fusion for Spatial Morphology Analysis of Traditional Villages via Hierarchical Graph Neural Networks
por: Zhang, Jiaxin, et al.
Publicado: (2025)
por: Zhang, Jiaxin, et al.
Publicado: (2025)
Progressive Feature Fusion Network for Enhancing Image Quality Assessment
por: Wu, Kaiqun, et al.
Publicado: (2024)
por: Wu, Kaiqun, et al.
Publicado: (2024)
MapFusion: A Novel BEV Feature Fusion Network for Multi-modal Map Construction
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning
por: Wang, Changpeng, et al.
Publicado: (2025)
por: Wang, Changpeng, et al.
Publicado: (2025)
Multimodal Sentiment Analysis based on Multi-channel and Symmetric Mutual Promotion Feature Fusion
por: Zhu, Wangyuan, et al.
Publicado: (2026)
por: Zhu, Wangyuan, et al.
Publicado: (2026)
Thought-For-Food: Reasoning Chain Induced Food Visual Question Answering
por: Jain, Riddhi, et al.
Publicado: (2025)
por: Jain, Riddhi, et al.
Publicado: (2025)
Ejemplares similares
-
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
por: Wu, Xiongwei, et al.
Publicado: (2024) -
FoodLMM: A Versatile Food Assistant using Large Multi-modal Model
por: Yin, Yuehao, et al.
Publicado: (2023) -
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025) -
LLMs-based Augmentation for Domain Adaptation in Long-tailed Food Datasets
por: Wang, Qing, et al.
Publicado: (2025) -
RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models
por: Jiao, Pengkun, et al.
Publicado: (2024)