FoodLogAthl-218: Constructing a Real-World Food Image Dataset Using Dietary Management Applications
Fuente:
arXiv
Saved in:
| Main Authors: | Watanabe, Mitsuki, Amano, Sosuke, Aizawa, Kiyoharu, Yamakata, Yoko |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
by: Imajuku, Yuki, et al.
Published: (2024)
by: Imajuku, Yuki, et al.
Published: (2024)
A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task
by: Toyooka, Mashiro, et al.
Published: (2025)
by: Toyooka, Mashiro, et al.
Published: (2025)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
by: Ikuta, Hikaru, et al.
Published: (2024)
by: Ikuta, Hikaru, et al.
Published: (2024)
Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion
by: Li, Yingxuan, et al.
Published: (2024)
by: Li, Yingxuan, et al.
Published: (2024)
Leveraging Automatic Personalised Nutrition: Food Image Recognition Benchmark and Dataset based on Nutrition Taxonomy
by: Romero-Tapiador, Sergio, et al.
Published: (2022)
by: Romero-Tapiador, Sergio, et al.
Published: (2022)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
by: Wang, Qing, et al.
Published: (2025)
by: Wang, Qing, et al.
Published: (2025)
Scalable Image Coding for Humans and Machines Using Feature Fusion Network
by: Shindo, Takahiro, et al.
Published: (2024)
by: Shindo, Takahiro, et al.
Published: (2024)
Realistic Virtual Flood Experience System Using 360° Videos and 3D City Models Constructed from Building Footprints
by: Banno, Tatsuro, et al.
Published: (2026)
by: Banno, Tatsuro, et al.
Published: (2026)
MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models
by: Guo, Zile, et al.
Published: (2026)
by: Guo, Zile, et al.
Published: (2026)
Nutrition Estimation for Dietary Management: A Transformer Approach with Depth Sensing
by: Kwan, Zhengyi, et al.
Published: (2024)
by: Kwan, Zhengyi, et al.
Published: (2024)
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
by: Wu, Xiongwei, et al.
Published: (2024)
by: Wu, Xiongwei, et al.
Published: (2024)
POINTS1.5: Building a Vision-Language Model towards Real World Applications
by: Liu, Yuan, et al.
Published: (2024)
by: Liu, Yuan, et al.
Published: (2024)
MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection
by: Zhao, Haochen, et al.
Published: (2025)
by: Zhao, Haochen, et al.
Published: (2025)
Size Matters: Reconstructing Real-Scale 3D Models from Monocular Images for Food Portion Estimation
by: Vinod, Gautham, et al.
Published: (2026)
by: Vinod, Gautham, et al.
Published: (2026)
Building and Evaluating a Realistic Virtual World for Large Scale Urban Exploration from 360° Videos
by: Takenawa, Mizuki, et al.
Published: (2025)
by: Takenawa, Mizuki, et al.
Published: (2025)
TrueFake: A Real World Case Dataset of Last Generation Fake Images also Shared on Social Networks
by: Dell'Anna, Stefano, et al.
Published: (2025)
by: Dell'Anna, Stefano, et al.
Published: (2025)
Towards Real-World Adverse Weather Image Restoration: Enhancing Clearness and Semantics with Vision-Language Models
by: Xu, Jiaqi, et al.
Published: (2024)
by: Xu, Jiaqi, et al.
Published: (2024)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
by: Qiao, Xiangshuo, et al.
Published: (2024)
by: Qiao, Xiangshuo, et al.
Published: (2024)
Automatic Recognition of Food Ingestion Environment from the AIM-2 Wearable Sensor
by: Huang, Yuning, et al.
Published: (2024)
by: Huang, Yuning, et al.
Published: (2024)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
by: Chen, Shuang, et al.
Published: (2026)
by: Chen, Shuang, et al.
Published: (2026)
"Humor, Art, or Misinformation?": A Multimodal Dataset for Intent-Aware Synthetic Image Detection
by: Skoularikis, Anastasios, et al.
Published: (2025)
by: Skoularikis, Anastasios, et al.
Published: (2025)
Food Portion Estimation: From Pixels to Calories
by: Vinod, Gautham, et al.
Published: (2026)
by: Vinod, Gautham, et al.
Published: (2026)
Single Image Dehazing Using Scene Depth Ordering
by: Ling, Pengyang, et al.
Published: (2024)
by: Ling, Pengyang, et al.
Published: (2024)
Reinforcing Pre-trained Models Using Counterfactual Images
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
360CityGML: Realistic and Interactive Urban Visualization System Integrating CityGML Model and 360° Videos
by: Banno, Tatsuro, et al.
Published: (2025)
by: Banno, Tatsuro, et al.
Published: (2025)
LookupForensics: A Large-Scale Multi-Task Dataset for Multi-Phase Image-Based Fact Verification
by: Cui, Shuhan, et al.
Published: (2024)
by: Cui, Shuhan, et al.
Published: (2024)
Med-Banana-50K: A Cross-modality Large-Scale Dataset for Text-guided Medical Image Editing
by: Chen, Zhihui, et al.
Published: (2025)
by: Chen, Zhihui, et al.
Published: (2025)
Depth and Image Fusion for Road Obstacle Detection Using Stereo Camera
by: Perezyabov, Oleg, et al.
Published: (2025)
by: Perezyabov, Oleg, et al.
Published: (2025)
3D2M Dataset: A 3-Dimension diverse Mesh Dataset
by: Dasgupta, Sankarshan
Published: (2024)
by: Dasgupta, Sankarshan
Published: (2024)
GLENDA: Gynecologic Laparoscopy Endometriosis Dataset
by: Leibetseder, Andreas, et al.
Published: (2025)
by: Leibetseder, Andreas, et al.
Published: (2025)
SonoWorld: From One Image to a 3D Audio-Visual Scene
by: Jin, Derong, et al.
Published: (2026)
by: Jin, Derong, et al.
Published: (2026)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
by: Zhu, Hongyi, et al.
Published: (2024)
by: Zhu, Hongyi, et al.
Published: (2024)
MTFusion: Reconstructing Any 3D Object from Single Image Using Multi-word Textual Inversion
by: Liu, Yu, et al.
Published: (2024)
by: Liu, Yu, et al.
Published: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
by: Zhang, Zhenxing, et al.
Published: (2024)
by: Zhang, Zhenxing, et al.
Published: (2024)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
by: Yang, Renyu, et al.
Published: (2026)
by: Yang, Renyu, et al.
Published: (2026)
Multimodal Fake News Video Explanation: Dataset, Analysis and Evaluation
by: Chen, Lizhi, et al.
Published: (2025)
by: Chen, Lizhi, et al.
Published: (2025)
EgoForge: Goal-Directed Egocentric World Simulator
by: Shen, Yifan, et al.
Published: (2026)
by: Shen, Yifan, et al.
Published: (2026)
JPEG AI Image Compression Visual Artifacts: Detection Methods and Dataset
by: Tsereh, Daria, et al.
Published: (2024)
by: Tsereh, Daria, et al.
Published: (2024)
KeyNode-Driven Geometry Coding for Real-World Scanned Human Dynamic Mesh Compression
by: Hoang, Huong, et al.
Published: (2025)
by: Hoang, Huong, et al.
Published: (2025)
Leveraging multimodal explanatory annotations for video interpretation with Modality Specific Dataset
by: Ancarani, Elisa, et al.
Published: (2025)
by: Ancarani, Elisa, et al.
Published: (2025)
Similar Items
-
FoodMLLM-JP: Leveraging Multimodal Large Language Models for Japanese Recipe Generation
by: Imajuku, Yuki, et al.
Published: (2024) -
A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task
by: Toyooka, Mashiro, et al.
Published: (2025) -
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
by: Ikuta, Hikaru, et al.
Published: (2024) -
Zero-Shot Character Identification and Speaker Prediction in Comics via Iterative Multimodal Fusion
by: Li, Yingxuan, et al.
Published: (2024) -
Leveraging Automatic Personalised Nutrition: Food Image Recognition Benchmark and Dataset based on Nutrition Taxonomy
by: Romero-Tapiador, Sergio, et al.
Published: (2022)