User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Xuan, Wang, Guanhong, Chai, Wenhao, Zhou, Jiayu, Wang, Gaoang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
PianoFlow: Music-Aware Streaming Piano Motion Generation with Bimanual Coordination
di: Wang, Xuan, et al.
Pubblicazione: (2026)
di: Wang, Xuan, et al.
Pubblicazione: (2026)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
di: Guo, Xuechen, et al.
Pubblicazione: (2024)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025)
di: Xu, Weili, et al.
Pubblicazione: (2025)
DSG-World: Learning a 3D Gaussian World Model from Dual State Videos
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
di: Song, Enxin, et al.
Pubblicazione: (2023)
di: Song, Enxin, et al.
Pubblicazione: (2023)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
di: Song, Enxin, et al.
Pubblicazione: (2024)
di: Song, Enxin, et al.
Pubblicazione: (2024)
Hand3R: Online 4D Hand-Scene Reconstruction in the Wild
di: Hu, Wendi, et al.
Pubblicazione: (2026)
di: Hu, Wendi, et al.
Pubblicazione: (2026)
Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
STEVE Series: Step-by-Step Construction of Agent Systems in Minecraft
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
What Makes for Good Image Captions?
di: Chen, Delong, et al.
Pubblicazione: (2024)
di: Chen, Delong, et al.
Pubblicazione: (2024)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
di: Zhao, Zhonghan, et al.
Pubblicazione: (2024)
Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark
di: Song, Enxin, et al.
Pubblicazione: (2025)
di: Song, Enxin, et al.
Pubblicazione: (2025)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023)
Blind Inpainting with Object-aware Discrimination for Artificial Marker Removal
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
di: Guo, Xuechen, et al.
Pubblicazione: (2023)
VersaT2I: Improving Text-to-Image Models with Versatile Reward
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
di: Guo, Jianshu, et al.
Pubblicazione: (2024)
CityGen: Infinite and Controllable City Layout Generation
di: Deng, Jie, et al.
Pubblicazione: (2023)
di: Deng, Jie, et al.
Pubblicazione: (2023)
Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition
di: Li, Bozheng, et al.
Pubblicazione: (2024)
di: Li, Bozheng, et al.
Pubblicazione: (2024)
3D CoCa: Contrastive Learners are 3D Captioners
di: Huang, Ting, et al.
Pubblicazione: (2025)
di: Huang, Ting, et al.
Pubblicazione: (2025)
See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent
di: Tang, Tianci, et al.
Pubblicazione: (2026)
di: Tang, Tianci, et al.
Pubblicazione: (2026)
Semantic-Aware Prefix Learning for Token-Efficient Image Generation
di: Li, Qingfeng, et al.
Pubblicazione: (2026)
di: Li, Qingfeng, et al.
Pubblicazione: (2026)
MetaWriter: Personalized Handwritten Text Recognition Using Meta-Learned Prompt Tuning
di: Gu, Wenhao, et al.
Pubblicazione: (2025)
di: Gu, Wenhao, et al.
Pubblicazione: (2025)
RecurGS: Interactive Scene Modeling via Discrete-State Recurrent Gaussian Fusion
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
X-MoGen: Unified Motion Generation across Humans and Animals
di: Wang, Xuan, et al.
Pubblicazione: (2025)
di: Wang, Xuan, et al.
Pubblicazione: (2025)
Next-Embedding Prediction Makes Strong Vision Learners
di: Xu, Sihan, et al.
Pubblicazione: (2025)
di: Xu, Sihan, et al.
Pubblicazione: (2025)
Disjoint Contrastive Regression Learning for Multi-Sourced Annotations
di: Ruan, Xiaoqian, et al.
Pubblicazione: (2021)
di: Ruan, Xiaoqian, et al.
Pubblicazione: (2021)
CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs
di: Lei, Jingyu, et al.
Pubblicazione: (2025)
di: Lei, Jingyu, et al.
Pubblicazione: (2025)
MetaCaptioner: Towards Generalist Visual Captioning with Open-source Suites
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
di: Lei, Zhenxin, et al.
Pubblicazione: (2025)
FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
di: Zhan, Chenlu, et al.
Pubblicazione: (2025)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
Text Data-Centric Image Captioning with Interactive Prompts
di: Wang, Yiyu, et al.
Pubblicazione: (2024)
di: Wang, Yiyu, et al.
Pubblicazione: (2024)
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
di: Wang, Wenhao, et al.
Pubblicazione: (2025)
IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
di: Hu, Wenhao, et al.
Pubblicazione: (2025)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
di: Wang, Gaoang, et al.
Pubblicazione: (2022)
Top-Down Framework for Weakly-supervised Grounded Image Captioning
di: Cai, Chen, et al.
Pubblicazione: (2023)
di: Cai, Chen, et al.
Pubblicazione: (2023)
Visually-Aware Context Modeling for News Image Captioning
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
di: Qu, Tingyu, et al.
Pubblicazione: (2023)
Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation
di: Wang, Zihao, et al.
Pubblicazione: (2026)
di: Wang, Zihao, et al.
Pubblicazione: (2026)
Large Language Models are Good Prompt Learners for Low-Shot Image Classification
di: Zheng, Zhaoheng, et al.
Pubblicazione: (2023)
di: Zheng, Zhaoheng, et al.
Pubblicazione: (2023)
Decoding fMRI Data into Captions using Prefix Language Modeling
di: Shen, Vyacheslav, et al.
Pubblicazione: (2025)
di: Shen, Vyacheslav, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning
di: Zhang, Zhenyu, et al.
Pubblicazione: (2023) -
PianoFlow: Music-Aware Streaming Piano Motion Generation with Bimanual Coordination
di: Wang, Xuan, et al.
Pubblicazione: (2026) -
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
di: Guo, Xuechen, et al.
Pubblicazione: (2024) -
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
di: Xu, Weili, et al.
Pubblicazione: (2025) -
DSG-World: Learning a 3D Gaussian World Model from Dual State Videos
di: Hu, Wenhao, et al.
Pubblicazione: (2025)