Efficient Prompt Tuning for Hierarchical Ingredient Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Gui, Yinxuan, Zhu, Bin, Chen, Jingjing, Ngo, Chong-Wah |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Navigating Weight Prediction with Diet Diary
von: Gui, Yinxuan, et al.
Veröffentlicht: (2024)
von: Gui, Yinxuan, et al.
Veröffentlicht: (2024)
Robust Relevance Feedback for Interactive Known-Item Video Search
von: Ma, Zhixin, et al.
Veröffentlicht: (2025)
von: Ma, Zhixin, et al.
Veröffentlicht: (2025)
Interpretable Embedding for Ad-hoc Video Search
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
Towards Multimodal Emotional Support Conversation Systems
von: Chu, Yuqi, et al.
Veröffentlicht: (2024)
von: Chu, Yuqi, et al.
Veröffentlicht: (2024)
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
Mitigating Cross-modal Representation Bias for Multicultural Image-to-Recipe Retrieval
von: Wang, Qing, et al.
Veröffentlicht: (2025)
von: Wang, Qing, et al.
Veröffentlicht: (2025)
Multimodal LLM-based Query Paraphrasing for Video Search
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024)
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
von: Wu, Xiongwei, et al.
Veröffentlicht: (2024)
von: Wu, Xiongwei, et al.
Veröffentlicht: (2024)
Stepwise Schema-Guided Prompting Framework with Parameter Efficient Instruction Tuning for Multimedia Event Extraction
von: Yuan, Xiang, et al.
Veröffentlicht: (2025)
von: Yuan, Xiang, et al.
Veröffentlicht: (2025)
Hi3D: Pursuing High-Resolution Image-to-3D Generation with Video Diffusion Models
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
von: Yang, Haibo, et al.
Veröffentlicht: (2024)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
von: Xie, Jingjing, et al.
Veröffentlicht: (2024)
von: Xie, Jingjing, et al.
Veröffentlicht: (2024)
Class Agnostic Instance-level Descriptor for Visual Instance Search
von: Sun, Qi-Ying, et al.
Veröffentlicht: (2025)
von: Sun, Qi-Ying, et al.
Veröffentlicht: (2025)
Benchmarking Gaslighting Negation Attacks Against Multimodal Large Language Models
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
von: Zhu, Bin, et al.
Veröffentlicht: (2025)
Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition
von: Zhou, Qianrui, et al.
Veröffentlicht: (2026)
von: Zhou, Qianrui, et al.
Veröffentlicht: (2026)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
von: Zhu, Xiaofei, et al.
Veröffentlicht: (2024)
von: Zhu, Xiaofei, et al.
Veröffentlicht: (2024)
HADUA: Hierarchical Attention and Dynamic Uniform Alignment for Robust Cross-Subject Emotion Recognition
von: Tang, Jiahao, et al.
Veröffentlicht: (2026)
von: Tang, Jiahao, et al.
Veröffentlicht: (2026)
AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
von: Yu, Wenda, et al.
Veröffentlicht: (2026)
von: Yu, Wenda, et al.
Veröffentlicht: (2026)
MAO: Efficient Model-Agnostic Optimization of Prompt Tuning for Vision-Language Models
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
von: Yang, Dejie, et al.
Veröffentlicht: (2025)
von: Yang, Dejie, et al.
Veröffentlicht: (2025)
ITEACH-Net: Inverted Teacher-studEnt seArCH Network for Emotion Recognition in Conversation
von: Sun, Haiyang, et al.
Veröffentlicht: (2023)
von: Sun, Haiyang, et al.
Veröffentlicht: (2023)
Advancing Food Nutrition Estimation via Visual-Ingredient Feature Fusion
von: Qi, Huiyan, et al.
Veröffentlicht: (2025)
von: Qi, Huiyan, et al.
Veröffentlicht: (2025)
HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation
von: Zhu, Jian, et al.
Veröffentlicht: (2026)
von: Zhu, Jian, et al.
Veröffentlicht: (2026)
Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
von: Cheng, Zebang, et al.
Veröffentlicht: (2024)
CLAIP-Emo: Parameter-Efficient Adaptation of Language-supervised models for In-the-Wild Audiovisual Emotion Recognition
von: Chen, Yin, et al.
Veröffentlicht: (2025)
von: Chen, Yin, et al.
Veröffentlicht: (2025)
Token-Level Contrastive Learning with Modality-Aware Prompting for Multimodal Intent Recognition
von: Zhou, Qianrui, et al.
Veröffentlicht: (2023)
von: Zhou, Qianrui, et al.
Veröffentlicht: (2023)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
von: Zhang, Rui, et al.
Veröffentlicht: (2024)
Towards Real-World Stickers Use: A New Dataset for Multi-Tag Sticker Recognition
von: Wang, Bingbing, et al.
Veröffentlicht: (2024)
von: Wang, Bingbing, et al.
Veröffentlicht: (2024)
Seeing Culture: A Benchmark for Visual Reasoning and Grounding
von: Satar, Burak, et al.
Veröffentlicht: (2025)
von: Satar, Burak, et al.
Veröffentlicht: (2025)
DPC: Dual-Prompt Collaboration for Tuning Vision-Language Models
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
von: Li, Haoyang, et al.
Veröffentlicht: (2025)
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
von: Zhang, Chong, et al.
Veröffentlicht: (2024)
von: Zhang, Chong, et al.
Veröffentlicht: (2024)
Identity-Driven Multimedia Forgery Detection via Reference Assistance
von: Xu, Junhao, et al.
Veröffentlicht: (2024)
von: Xu, Junhao, et al.
Veröffentlicht: (2024)
EVER: Edge-Assisted Auto-Verification for Mobile MR-Aided Operation
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe Generation
von: Liu, Guoshan, et al.
Veröffentlicht: (2026)
von: Liu, Guoshan, et al.
Veröffentlicht: (2026)
Prototypical Prompting for Text-to-image Person Re-identification
von: Yan, Shuanglin, et al.
Veröffentlicht: (2024)
von: Yan, Shuanglin, et al.
Veröffentlicht: (2024)
Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification
von: Qian, Wenhao, et al.
Veröffentlicht: (2025)
von: Qian, Wenhao, et al.
Veröffentlicht: (2025)
Explainable Multimodal Emotion Recognition
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
von: Lian, Zheng, et al.
Veröffentlicht: (2023)
Prompt-aware of Frame Sampling for Efficient Text-Video Retrieval
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
von: Zhang, Deyu, et al.
Veröffentlicht: (2025)
Multimodal Emotion Recognition with Large Language Models
von: Zhang, Hongrui, et al.
Veröffentlicht: (2026)
von: Zhang, Hongrui, et al.
Veröffentlicht: (2026)
Efficient Test-Time Retrieval Augmented Generation
von: Yin, Hailong, et al.
Veröffentlicht: (2025)
von: Yin, Hailong, et al.
Veröffentlicht: (2025)
Identity-Aware Vision-Language Model for Explainable Face Forgery Detection
von: Xu, Junhao, et al.
Veröffentlicht: (2025)
von: Xu, Junhao, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Navigating Weight Prediction with Diet Diary
von: Gui, Yinxuan, et al.
Veröffentlicht: (2024) -
Robust Relevance Feedback for Interactive Known-Item Video Search
von: Ma, Zhixin, et al.
Veröffentlicht: (2025) -
Interpretable Embedding for Ad-hoc Video Search
von: Wu, Jiaxin, et al.
Veröffentlicht: (2024) -
Towards Multimodal Emotional Support Conversation Systems
von: Chu, Yuqi, et al.
Veröffentlicht: (2024) -
Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval
von: Wang, Qing, et al.
Veröffentlicht: (2025)