Personalized Visual Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Pi, Renjie, Zhang, Jianshu, Han, Tianyang, Zhang, Jipeng, Pan, Rui, Zhang, Tong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
The Instinctive Bias: Spurious Images lead to Illusion in MLLMs
por: Han, Tianyang, et al.
Publicado: (2024)
por: Han, Tianyang, et al.
Publicado: (2024)
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
por: Zhang, Jipeng, et al.
Publicado: (2025)
por: Zhang, Jipeng, et al.
Publicado: (2025)
Visual Instruction Tuning with Chain of Region-of-Interest
por: Chen, Yixin, et al.
Publicado: (2025)
por: Chen, Yixin, et al.
Publicado: (2025)
Pointing to a Llama and Call it a Camel: On the Sycophancy of Multimodal Large Language Models
por: Pi, Renjie, et al.
Publicado: (2025)
por: Pi, Renjie, et al.
Publicado: (2025)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
por: Zhang, Renrui, et al.
Publicado: (2024)
por: Zhang, Renrui, et al.
Publicado: (2024)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Osprey: Pixel Understanding with Visual Instruction Tuning
por: Yuan, Yuqian, et al.
Publicado: (2023)
por: Yuan, Yuqian, et al.
Publicado: (2023)
Visual Variational Autoencoder Prompt Tuning
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
Instruction Tuning-free Visual Token Complement for Multimodal LLMs
por: Wang, Dongsheng, et al.
Publicado: (2024)
por: Wang, Dongsheng, et al.
Publicado: (2024)
Generative Visual Instruction Tuning
por: Hernandez, Jefferson, et al.
Publicado: (2024)
por: Hernandez, Jefferson, et al.
Publicado: (2024)
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
EAGLE: Elevating Geometric Reasoning through LLM-empowered Visual Instruction Tuning
por: Li, Zhihao, et al.
Publicado: (2024)
por: Li, Zhihao, et al.
Publicado: (2024)
Reconstructive Visual Instruction Tuning
por: Wang, Haochen, et al.
Publicado: (2024)
por: Wang, Haochen, et al.
Publicado: (2024)
SEP: Self-Enhanced Prompt Tuning for Visual-Language Model
por: Yao, Hantao, et al.
Publicado: (2024)
por: Yao, Hantao, et al.
Publicado: (2024)
Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning
por: Gou, Yunhao, et al.
Publicado: (2025)
por: Gou, Yunhao, et al.
Publicado: (2025)
Learning to Instruct for Visual Instruction Tuning
por: Zhou, Zhihan, et al.
Publicado: (2025)
por: Zhou, Zhihan, et al.
Publicado: (2025)
RefChartQA: Grounding Visual Answer on Chart Images through Instruction Tuning
por: Vogel, Alexander, et al.
Publicado: (2025)
por: Vogel, Alexander, et al.
Publicado: (2025)
Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning
por: li, Bonan, et al.
Publicado: (2025)
por: li, Bonan, et al.
Publicado: (2025)
Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images
por: Li, Xuchen, et al.
Publicado: (2026)
por: Li, Xuchen, et al.
Publicado: (2026)
Visual Instance-aware Prompt Tuning
por: Xiao, Xi, et al.
Publicado: (2025)
por: Xiao, Xi, et al.
Publicado: (2025)
Streaming Video Instruction Tuning
por: Xia, Jiaer, et al.
Publicado: (2025)
por: Xia, Jiaer, et al.
Publicado: (2025)
Generalizable Geometric Image Caption Synthesis
por: Xin, Yue, et al.
Publicado: (2025)
por: Xin, Yue, et al.
Publicado: (2025)
What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
por: Du, Yifan, et al.
Publicado: (2023)
por: Du, Yifan, et al.
Publicado: (2023)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
por: Zhang, Jipeng, et al.
Publicado: (2024)
por: Zhang, Jipeng, et al.
Publicado: (2024)
Multimodal Instruction Tuning with Hybrid State Space Models
por: Zhou, Jianing, et al.
Publicado: (2024)
por: Zhou, Jianing, et al.
Publicado: (2024)
LongVideoAgent: Multi-Agent Reasoning with Long Videos
por: Liu, Runtao, et al.
Publicado: (2025)
por: Liu, Runtao, et al.
Publicado: (2025)
Parrot: Multilingual Visual Instruction Tuning
por: Sun, Hai-Long, et al.
Publicado: (2024)
por: Sun, Hai-Long, et al.
Publicado: (2024)
Boosting Visual Instruction Tuning with Self-Supervised Guidance
por: Sirko-Galouchenko, Sophia, et al.
Publicado: (2026)
por: Sirko-Galouchenko, Sophia, et al.
Publicado: (2026)
Semantic Hierarchical Prompt Tuning for Parameter-Efficient Fine-Tuning
por: Zhu, Haowei, et al.
Publicado: (2024)
por: Zhu, Haowei, et al.
Publicado: (2024)
Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics
por: Liu, Jipeng, et al.
Publicado: (2026)
por: Liu, Jipeng, et al.
Publicado: (2026)
How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing
por: Zhang, Huanyu, et al.
Publicado: (2026)
por: Zhang, Huanyu, et al.
Publicado: (2026)
Reflective Instruction Tuning: Mitigating Hallucinations in Large Vision-Language Models
por: Zhang, Jinrui, et al.
Publicado: (2024)
por: Zhang, Jinrui, et al.
Publicado: (2024)
MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning
por: Ma, Yiwei, et al.
Publicado: (2025)
por: Ma, Yiwei, et al.
Publicado: (2025)
DetCLIPv3: Towards Versatile Generative Open-vocabulary Object Detection
por: Yao, Lewei, et al.
Publicado: (2024)
por: Yao, Lewei, et al.
Publicado: (2024)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
por: Hansen, Jacob, et al.
Publicado: (2025)
por: Hansen, Jacob, et al.
Publicado: (2025)
OASIS: Online Sample Selection for Continual Visual Instruction Tuning
por: Lee, Minjae, et al.
Publicado: (2025)
por: Lee, Minjae, et al.
Publicado: (2025)
Ejemplares similares
-
Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions
por: Pi, Renjie, et al.
Publicado: (2024) -
MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance
por: Pi, Renjie, et al.
Publicado: (2024) -
Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization
por: Pi, Renjie, et al.
Publicado: (2024) -
The Instinctive Bias: Spurious Images lead to Illusion in MLLMs
por: Han, Tianyang, et al.
Publicado: (2024) -
VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training
por: Zhang, Jipeng, et al.
Publicado: (2025)