Navigating Weight Prediction with Diet Diary
Fuente:
arXiv
Guardado en:
| Autores principales: | Gui, Yinxuan, Zhu, Bin, Chen, Jingjing, Ngo, Chong-Wah, Jiang, Yu-Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient Prompt Tuning for Hierarchical Ingredient Recognition
por: Gui, Yinxuan, et al.
Publicado: (2025)
por: Gui, Yinxuan, et al.
Publicado: (2025)
Robust Relevance Feedback for Interactive Known-Item Video Search
por: Ma, Zhixin, et al.
Publicado: (2025)
por: Ma, Zhixin, et al.
Publicado: (2025)
Interpretable Embedding for Ad-hoc Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
Towards Multimodal Emotional Support Conversation Systems
por: Chu, Yuqi, et al.
Publicado: (2024)
por: Chu, Yuqi, et al.
Publicado: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)
por: Wang, Qing, et al.
Publicado: (2025)
Multimodal LLM-based Query Paraphrasing for Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024)
por: Wu, Jiaxin, et al.
Publicado: (2024)
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
por: Wu, Xiongwei, et al.
Publicado: (2024)
por: Wu, Xiongwei, et al.
Publicado: (2024)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
por: Yang, Haibo, et al.
Publicado: (2024)
por: Yang, Haibo, et al.
Publicado: (2024)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
por: Xu, Junhao, et al.
Publicado: (2025)
por: Xu, Junhao, et al.
Publicado: (2025)
Class Agnostic Instance-level Descriptor for Visual Instance Search
por: Sun, Qi-Ying, et al.
Publicado: (2025)
por: Sun, Qi-Ying, et al.
Publicado: (2025)
Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
por: Zhu, Bin, et al.
Publicado: (2025)
por: Zhu, Bin, et al.
Publicado: (2025)
Pedestrian Trajectory Prediction Based on Social Interactions Learning With Random Weights
por: Xie, Jiajia, et al.
Publicado: (2025)
por: Xie, Jiajia, et al.
Publicado: (2025)
Identity-Driven Multimedia Forgery Detection via Reference Assistance
por: Xu, Junhao, et al.
Publicado: (2024)
por: Xu, Junhao, et al.
Publicado: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
por: Satar, Burak, et al.
Publicado: (2025)
por: Satar, Burak, et al.
Publicado: (2025)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
por: Yu, Wenda, et al.
Publicado: (2026)
por: Yu, Wenda, et al.
Publicado: (2026)
High-level Codes and Fine-grained Weights for Online Multi-modal Hashing Retrieval
por: Zhan, Yu-Wei, et al.
Publicado: (2024)
por: Zhan, Yu-Wei, et al.
Publicado: (2024)
Clinical Multi-modal Fusion with Heterogeneous Graph and Disease Correlation Learning for Multi-Disease Prediction
por: Jiang, Yueheng, et al.
Publicado: (2025)
por: Jiang, Yueheng, et al.
Publicado: (2025)
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
por: Zhang, Chong, et al.
Publicado: (2024)
por: Zhang, Chong, et al.
Publicado: (2024)
EVER: Edge-Assisted Auto-Verification for Mobile MR-Aided Operation
por: Chen, Jiangong, et al.
Publicado: (2025)
por: Chen, Jiangong, et al.
Publicado: (2025)
Multi Agents Semantic Emotion Aligned Music to Image Generation with Music Derived Captions
por: Shi, Junchang, et al.
Publicado: (2025)
por: Shi, Junchang, et al.
Publicado: (2025)
Emotional Cues Extraction and Fusion for Multi-modal Emotion Prediction and Recognition in Conversation
por: Shi, Haoxiang, et al.
Publicado: (2024)
por: Shi, Haoxiang, et al.
Publicado: (2024)
Revisiting Vision-Language Features Adaptation and Inconsistency for Social Media Popularity Prediction
por: Hsu, Chih-Chung, et al.
Publicado: (2024)
por: Hsu, Chih-Chung, et al.
Publicado: (2024)
Structure-Aware Residual-Center Representation for Self-Supervised Open-Set 3D Cross-Modal Retrieval
por: Xu, Yang, et al.
Publicado: (2024)
por: Xu, Yang, et al.
Publicado: (2024)
Content-Adaptive Rate-Quality Curve Prediction Model in Media Processing System
por: Yin, Shibo, et al.
Publicado: (2024)
por: Yin, Shibo, et al.
Publicado: (2024)
Tile-Weighted Rate-Distortion Optimized Packet Scheduling for 360$^\circ$ VR Video Streaming
por: Wang, Haopeng, et al.
Publicado: (2024)
por: Wang, Haopeng, et al.
Publicado: (2024)
From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning
por: Jiao, Pengkun, et al.
Publicado: (2024)
por: Jiao, Pengkun, et al.
Publicado: (2024)
Anchoring Trends: Mitigating Social Media Popularity Prediction Drift via Feature Clustering and Expansion
por: Lee, Chia-Ming, et al.
Publicado: (2025)
por: Lee, Chia-Ming, et al.
Publicado: (2025)
Don't Deceive Me: Mitigating Gaslighting through Attention Reallocation in LMMs
por: Jiao, Pengkun, et al.
Publicado: (2025)
por: Jiao, Pengkun, et al.
Publicado: (2025)
EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
por: Jing, Chong, et al.
Publicado: (2026)
por: Jing, Chong, et al.
Publicado: (2026)
TSC-PCAC: Voxel Transformer and Sparse Convolution Based Point Cloud Attribute Compression for 3D Broadcasting
por: Guo, Zixi, et al.
Publicado: (2024)
por: Guo, Zixi, et al.
Publicado: (2024)
CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition
por: Peng, Cheng, et al.
Publicado: (2023)
por: Peng, Cheng, et al.
Publicado: (2023)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
por: Chen, Zixuan, et al.
Publicado: (2026)
por: Chen, Zixuan, et al.
Publicado: (2026)
Differential Mental Disorder Detection with Psychology-Inspired Multimodal Stimuli
por: Zhou, Zhiyuan, et al.
Publicado: (2026)
por: Zhou, Zhiyuan, et al.
Publicado: (2026)
Cross-Modal Retrieval: A Systematic Review of Methods and Future Directions
por: Wang, Tianshi, et al.
Publicado: (2023)
por: Wang, Tianshi, et al.
Publicado: (2023)
PRISM-XR: Empowering Privacy-Aware XR Collaboration with Multimodal Large Language Models
por: Chen, Jiangong, et al.
Publicado: (2026)
por: Chen, Jiangong, et al.
Publicado: (2026)
Seeing Further and Wider: Joint Spatio-Temporal Enlargement for Micro-Video Popularity Prediction
por: Wang, Dali, et al.
Publicado: (2026)
por: Wang, Dali, et al.
Publicado: (2026)
SpeechEE: A Novel Benchmark for Speech Event Extraction
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
ITEACH-Net: Inverted Teacher-studEnt seArCH Network for Emotion Recognition in Conversation
por: Sun, Haiyang, et al.
Publicado: (2023)
por: Sun, Haiyang, et al.
Publicado: (2023)
COPA: Efficient Vision-Language Pre-training Through Collaborative Object- and Patch-Text Alignment
por: Jiang, Chaoya, et al.
Publicado: (2023)
por: Jiang, Chaoya, et al.
Publicado: (2023)
Ejemplares similares
-
Efficient Prompt Tuning for Hierarchical Ingredient Recognition
por: Gui, Yinxuan, et al.
Publicado: (2025) -
Robust Relevance Feedback for Interactive Known-Item Video Search
por: Ma, Zhixin, et al.
Publicado: (2025) -
Interpretable Embedding for Ad-hoc Video Search
por: Wu, Jiaxin, et al.
Publicado: (2024) -
Towards Multimodal Emotional Support Conversation Systems
por: Chu, Yuqi, et al.
Publicado: (2024) -
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
por: Wang, Qing, et al.
Publicado: (2025)