Osprey: Pixel Understanding with Visual Instruction Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Yuan, Yuqian, Li, Wentong, Liu, Jian, Tang, Dongqi, Luo, Xinjie, Qin, Chi, Zhang, Lei, Zhu, Jianke |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TokenPacker: Efficient Visual Projector for Multimodal LLM
por: Li, Wentong, et al.
Publicado: (2024)
por: Li, Wentong, et al.
Publicado: (2024)
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
por: Yu, Hanxun, et al.
Publicado: (2025)
por: Yu, Hanxun, et al.
Publicado: (2025)
OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM
por: Wang, Jinhong, et al.
Publicado: (2025)
por: Wang, Jinhong, et al.
Publicado: (2025)
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
por: Yuan, Yuqian, et al.
Publicado: (2025)
por: Yuan, Yuqian, et al.
Publicado: (2025)
InstructSAM: Segment Any Instance with Any Instructions
por: Yuan, Yuqian, et al.
Publicado: (2026)
por: Yuan, Yuqian, et al.
Publicado: (2026)
Fine-Grained Multi-View Hand Reconstruction Using Inverse Rendering
por: Gan, Qijun, et al.
Publicado: (2024)
por: Gan, Qijun, et al.
Publicado: (2024)
Scalable Autoregressive Monocular Depth Estimation
por: Wang, Jinhong, et al.
Publicado: (2024)
por: Wang, Jinhong, et al.
Publicado: (2024)
Uncertainty-Instructed Structure Injection for Generalizable HD Map Construction
por: Liu, Xiaolu, et al.
Publicado: (2025)
por: Liu, Xiaolu, et al.
Publicado: (2025)
MGMap: Mask-Guided Learning for Online Vectorized HD Map Construction
por: Liu, Xiaolu, et al.
Publicado: (2024)
por: Liu, Xiaolu, et al.
Publicado: (2024)
In Pursuit of Pixel Supervision for Visual Pre-training
por: Yang, Lihe, et al.
Publicado: (2025)
por: Yang, Lihe, et al.
Publicado: (2025)
VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM
por: Yuan, Yuqian, et al.
Publicado: (2024)
por: Yuan, Yuqian, et al.
Publicado: (2024)
VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration
por: Yu, Hanxun, et al.
Publicado: (2026)
por: Yu, Hanxun, et al.
Publicado: (2026)
Personalized Visual Instruction Tuning
por: Pi, Renjie, et al.
Publicado: (2024)
por: Pi, Renjie, et al.
Publicado: (2024)
Corrupted but Not Broken: Understanding and Mitigating the Negative Impacts of Corrupted Data in Visual Instruction Tuning
por: Gou, Yunhao, et al.
Publicado: (2025)
por: Gou, Yunhao, et al.
Publicado: (2025)
Not All Voxels Are Equal: Hardness-Aware Semantic Scene Completion with Self-Distillation
por: Wang, Song, et al.
Publicado: (2024)
por: Wang, Song, et al.
Publicado: (2024)
INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning
por: Peng, Wujian, et al.
Publicado: (2024)
por: Peng, Wujian, et al.
Publicado: (2024)
LLaVA-c: Continual Improved Visual Instruction Tuning
por: Liu, Wenzhuo, et al.
Publicado: (2025)
por: Liu, Wenzhuo, et al.
Publicado: (2025)
Medical Image Understanding Improves Survival Prediction via Visual Instruction Tuning
por: Liu, Xixi, et al.
Publicado: (2026)
por: Liu, Xixi, et al.
Publicado: (2026)
VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning
por: Dong, Mingkang, et al.
Publicado: (2026)
por: Dong, Mingkang, et al.
Publicado: (2026)
PixelThink: Towards Efficient Chain-of-Pixel Reasoning
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
PixPerfect: Seamless Latent Diffusion Local Editing with Discriminative Pixel-Space Refinement
por: Zheng, Haitian, et al.
Publicado: (2025)
por: Zheng, Haitian, et al.
Publicado: (2025)
Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding
por: Zhang, Tao, et al.
Publicado: (2025)
por: Zhang, Tao, et al.
Publicado: (2025)
LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation
por: Yuan, Yuqian, et al.
Publicado: (2026)
por: Yuan, Yuqian, et al.
Publicado: (2026)
Generative Visual Instruction Tuning
por: Hernandez, Jefferson, et al.
Publicado: (2024)
por: Hernandez, Jefferson, et al.
Publicado: (2024)
Comparison Visual Instruction Tuning
por: Lin, Wei, et al.
Publicado: (2024)
por: Lin, Wei, et al.
Publicado: (2024)
MetaMorph: Multimodal Understanding and Generation via Instruction Tuning
por: Tong, Shengbang, et al.
Publicado: (2024)
por: Tong, Shengbang, et al.
Publicado: (2024)
Visual Instruction Tuning with Chain of Region-of-Interest
por: Chen, Yixin, et al.
Publicado: (2025)
por: Chen, Yixin, et al.
Publicado: (2025)
LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding
por: Zhang, Yanzhe, et al.
Publicado: (2023)
por: Zhang, Yanzhe, et al.
Publicado: (2023)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
por: Xing, Bohao, et al.
Publicado: (2024)
por: Xing, Bohao, et al.
Publicado: (2024)
Label-efficient Semantic Scene Completion with Scribble Annotations
por: Wang, Song, et al.
Publicado: (2024)
por: Wang, Song, et al.
Publicado: (2024)
ReliOcc: Towards Reliable Semantic Occupancy Prediction via Uncertainty Learning
por: Wang, Song, et al.
Publicado: (2024)
por: Wang, Song, et al.
Publicado: (2024)
TextSquare: Scaling up Text-Centric Visual Instruction Tuning
por: Tang, Jingqun, et al.
Publicado: (2024)
por: Tang, Jingqun, et al.
Publicado: (2024)
PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering
por: Zhang, Xiaoman, et al.
Publicado: (2023)
por: Zhang, Xiaoman, et al.
Publicado: (2023)
Pyramid Deep Fusion Network for Two-Hand Reconstruction from RGB-D Images
por: Ren, Jinwei, et al.
Publicado: (2023)
por: Ren, Jinwei, et al.
Publicado: (2023)
Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
Ground-V: Teaching VLMs to Ground Complex Instructions in Pixels
por: Zong, Yongshuo, et al.
Publicado: (2025)
por: Zong, Yongshuo, et al.
Publicado: (2025)
MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine
por: Zhang, Renrui, et al.
Publicado: (2024)
por: Zhang, Renrui, et al.
Publicado: (2024)
Instructify: Demystifying Metadata to Visual Instruction Tuning Data Conversion
por: Hansen, Jacob, et al.
Publicado: (2025)
por: Hansen, Jacob, et al.
Publicado: (2025)
PointLoRA: Low-Rank Adaptation with Token Selection for Point Cloud Learning
por: Wang, Song, et al.
Publicado: (2025)
por: Wang, Song, et al.
Publicado: (2025)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
por: Luo, Chuwei, et al.
Publicado: (2024)
por: Luo, Chuwei, et al.
Publicado: (2024)
Ejemplares similares
-
TokenPacker: Efficient Visual Projector for Multimodal LLM
por: Li, Wentong, et al.
Publicado: (2024) -
Inst3D-LMM: Instance-Aware 3D Scene Understanding with Multi-modal Instruction Tuning
por: Yu, Hanxun, et al.
Publicado: (2025) -
OrderChain: Towards General Instruct-Tuning for Stimulating the Ordinal Understanding Ability of MLLM
por: Wang, Jinhong, et al.
Publicado: (2025) -
PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity
por: Yuan, Yuqian, et al.
Publicado: (2025) -
InstructSAM: Segment Any Instance with Any Instructions
por: Yuan, Yuqian, et al.
Publicado: (2026)