Prismer: A Vision-Language Model with Multi-Task Experts
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Liu, Shikun, Fan, Linxi, Johns, Edward, Yu, Zhiding, Xiao, Chaowei, Anandkumar, Anima |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Diffusion State-Guided Projected Gradient for Inverse Problems
von: Zirvi, Rayhan, et al.
Veröffentlicht: (2024)
von: Zirvi, Rayhan, et al.
Veröffentlicht: (2024)
Fast Training of Diffusion Models with Masked Transformers
von: Zheng, Hongkai, et al.
Veröffentlicht: (2023)
von: Zheng, Hongkai, et al.
Veröffentlicht: (2023)
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
von: Liu, Qin, et al.
Veröffentlicht: (2025)
von: Liu, Qin, et al.
Veröffentlicht: (2025)
T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
von: Pan, Zizheng, et al.
Veröffentlicht: (2024)
von: Pan, Zizheng, et al.
Veröffentlicht: (2024)
AIDE: Agentically Improve Visual Language Model with Domain Experts
von: Chiu, Ming-Chang, et al.
Veröffentlicht: (2025)
von: Chiu, Ming-Chang, et al.
Veröffentlicht: (2025)
TaskGalaxy: Scaling Multi-modal Instruction Fine-tuning with Tens of Thousands Vision Task Types
von: Chen, Jiankang, et al.
Veröffentlicht: (2025)
von: Chen, Jiankang, et al.
Veröffentlicht: (2025)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
von: Xue, Haotian, et al.
Veröffentlicht: (2025)
von: Xue, Haotian, et al.
Veröffentlicht: (2025)
GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding
von: Mathew, Athul M., et al.
Veröffentlicht: (2025)
von: Mathew, Athul M., et al.
Veröffentlicht: (2025)
Improving Diffusion Inverse Problem Solving with Decoupled Noise Annealing
von: Zhang, Bingliang, et al.
Veröffentlicht: (2024)
von: Zhang, Bingliang, et al.
Veröffentlicht: (2024)
Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models
von: Zhou, Zijie, et al.
Veröffentlicht: (2026)
von: Zhou, Zijie, et al.
Veröffentlicht: (2026)
AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning
von: Awais, Muhammad, et al.
Veröffentlicht: (2024)
von: Awais, Muhammad, et al.
Veröffentlicht: (2024)
Robust Representation Consistency Model via Contrastive Denoising
von: Lei, Jiachen, et al.
Veröffentlicht: (2025)
von: Lei, Jiachen, et al.
Veröffentlicht: (2025)
From Captions to Rewards (CAREVL): Leveraging Large Language Model Experts for Enhanced Reward Modeling in Large Vision-Language Models
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
von: Dai, Muzhi, et al.
Veröffentlicht: (2025)
GROVER: Graph-guided Representation of Omics and Vision with Expert Regulation for Adaptive Spatial Multi-omics Fusion
von: Xiao, Yongjun, et al.
Veröffentlicht: (2025)
von: Xiao, Yongjun, et al.
Veröffentlicht: (2025)
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
von: Jia, Chenwei, et al.
Veröffentlicht: (2026)
von: Jia, Chenwei, et al.
Veröffentlicht: (2026)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
Learning Calibrated Uncertainties for Domain Shift: A Distributionally Robust Learning Approach
von: Wang, Haoxuan, et al.
Veröffentlicht: (2020)
von: Wang, Haoxuan, et al.
Veröffentlicht: (2020)
DenseFusion-1M: Merging Vision Experts for Comprehensive Multimodal Perception
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
von: Li, Xiaotong, et al.
Veröffentlicht: (2024)
Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors
von: Sun, Jiachen, et al.
Veröffentlicht: (2024)
von: Sun, Jiachen, et al.
Veröffentlicht: (2024)
Improving Distant 3D Object Detection Using 2D Box Supervision
von: Yang, Zetong, et al.
Veröffentlicht: (2024)
von: Yang, Zetong, et al.
Veröffentlicht: (2024)
Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress
von: Zhang, Yuelin, et al.
Veröffentlicht: (2026)
von: Zhang, Yuelin, et al.
Veröffentlicht: (2026)
TRIPS: Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
von: Jiang, Chaoya, et al.
Veröffentlicht: (2023)
MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
von: Xiao, Zhendong, et al.
Veröffentlicht: (2025)
Multi-Modal Adapter for Vision-Language Models
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
von: Seputis, Dominykas, et al.
Veröffentlicht: (2024)
Enhancing Screen Time Identification in Children with a Multi-View Vision Language Model and Screen Time Tracker
von: Hou, Xinlong, et al.
Veröffentlicht: (2024)
von: Hou, Xinlong, et al.
Veröffentlicht: (2024)
Demographic Bias of Expert-Level Vision-Language Foundation Models in Medical Imaging
von: Yang, Yuzhe, et al.
Veröffentlicht: (2024)
von: Yang, Yuzhe, et al.
Veröffentlicht: (2024)
FRAG: Frame Selection Augmented Generation for Long Video and Long Document Understanding
von: Huang, De-An, et al.
Veröffentlicht: (2025)
von: Huang, De-An, et al.
Veröffentlicht: (2025)
Efficient Vision-and-Language Pre-training with Text-Relevant Image Patch Selection
von: Ye, Wei, et al.
Veröffentlicht: (2024)
von: Ye, Wei, et al.
Veröffentlicht: (2024)
Aligned Vector Quantization for Edge-Cloud Collabrative Vision-Language Models
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
von: Liu, Xiao, et al.
Veröffentlicht: (2024)
LITA: Language Instructed Temporal-Localization Assistant
von: Huang, De-An, et al.
Veröffentlicht: (2024)
von: Huang, De-An, et al.
Veröffentlicht: (2024)
Vision Language Model-Empowered Contract Theory for AIGC Task Allocation in Teleoperation
von: Zhan, Zijun, et al.
Veröffentlicht: (2024)
von: Zhan, Zijun, et al.
Veröffentlicht: (2024)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
von: Jung, Hoin, et al.
Veröffentlicht: (2024)
von: Jung, Hoin, et al.
Veröffentlicht: (2024)
TagAlign: Improving Vision-Language Alignment with Multi-Tag Classification
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
von: Liu, Qinying, et al.
Veröffentlicht: (2023)
Effective Black-Box Multi-Faceted Attacks Breach Vision Large Language Model Guardrails
von: Yang, Yijun, et al.
Veröffentlicht: (2025)
von: Yang, Yijun, et al.
Veröffentlicht: (2025)
VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
von: Zhao, Rui, et al.
Veröffentlicht: (2026)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
von: Han, Xiao, et al.
Veröffentlicht: (2024)
von: Han, Xiao, et al.
Veröffentlicht: (2024)
Two-Stream Interactive Joint Learning of Scene Parsing and Geometric Vision Tasks
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
von: Tang, Guanfeng, et al.
Veröffentlicht: (2026)
TAG-MoE: Task-Aware Gating for Unified Generative Mixture-of-Experts
von: Xu, Yu, et al.
Veröffentlicht: (2026)
von: Xu, Yu, et al.
Veröffentlicht: (2026)
VLA-Pro: Cross-Task Procedural Memory Transfer for Vision-Language-Action Models
von: Si, Shengyu, et al.
Veröffentlicht: (2026)
von: Si, Shengyu, et al.
Veröffentlicht: (2026)
GeoRSMLLM: A Multimodal Large Language Model for Vision-Language Tasks in Geoscience and Remote Sensing
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
von: Zhang, Zilun, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Diffusion State-Guided Projected Gradient for Inverse Problems
von: Zirvi, Rayhan, et al.
Veröffentlicht: (2024) -
Fast Training of Diffusion Models with Masked Transformers
von: Zheng, Hongkai, et al.
Veröffentlicht: (2023) -
VLM-Guard: Safeguarding Vision-Language Models via Fulfilling Safety Alignment Gap
von: Liu, Qin, et al.
Veröffentlicht: (2025) -
T-Stitch: Accelerating Sampling in Pre-Trained Diffusion Models with Trajectory Stitching
von: Pan, Zizheng, et al.
Veröffentlicht: (2024) -
AIDE: Agentically Improve Visual Language Model with Domain Experts
von: Chiu, Ming-Chang, et al.
Veröffentlicht: (2025)