VisionLLaMA: A Unified LLaMA Backbone for Vision Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Chu, Xiangxiang, Su, Jianlin, Zhang, Bo, Shen, Chunhua |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Adapting LLaMA Decoder to Vision Transformer
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
LLaMA-Reg: Using LLaMA 2 for Unsupervised Medical Image Registration
por: Ma, Mingrui, et al.
Publicado: (2024)
por: Ma, Mingrui, et al.
Publicado: (2024)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features
por: Lee, Jewon, et al.
Publicado: (2025)
por: Lee, Jewon, et al.
Publicado: (2025)
LLaMA-XR: A Novel Framework for Radiology Report Generation using LLaMA and QLoRA Fine Tuning
por: Jahangir, Md. Zihad Bin, et al.
Publicado: (2025)
por: Jahangir, Md. Zihad Bin, et al.
Publicado: (2025)
EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning
por: Xing, Bohao, et al.
Publicado: (2024)
por: Xing, Bohao, et al.
Publicado: (2024)
What If We Recaption Billions of Web Images with LLaMA-3?
por: Li, Xianhang, et al.
Publicado: (2024)
por: Li, Xianhang, et al.
Publicado: (2024)
Multimodal Medical Disease Classification with LLaMA II
por: Gapp, Christian, et al.
Publicado: (2024)
por: Gapp, Christian, et al.
Publicado: (2024)
LLaMA-Excitor: General Instruction Tuning via Indirect Feature Interaction
por: Zou, Bo, et al.
Publicado: (2024)
por: Zou, Bo, et al.
Publicado: (2024)
Dia-LLaMA: Towards Large Language Model-driven CT Report Generation
por: Chen, Zhixuan, et al.
Publicado: (2024)
por: Chen, Zhixuan, et al.
Publicado: (2024)
LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models
por: Wang, Zhengyi, et al.
Publicado: (2024)
por: Wang, Zhengyi, et al.
Publicado: (2024)
Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens
por: Ma, Fan, et al.
Publicado: (2023)
por: Ma, Fan, et al.
Publicado: (2023)
LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention
por: Zhang, Renrui, et al.
Publicado: (2023)
por: Zhang, Renrui, et al.
Publicado: (2023)
EDVD-LLaMA: Explainable Deepfake Video Detection via Multimodal Large Language Model Reasoning
por: Sun, Haoran, et al.
Publicado: (2025)
por: Sun, Haoran, et al.
Publicado: (2025)
LLaMA Pro: Progressive LLaMA with Block Expansion
por: Wu, Chengyue, et al.
Publicado: (2024)
por: Wu, Chengyue, et al.
Publicado: (2024)
ViT3D Alignment of LLaMA3: 3D Medical Image Report Generation
por: Li, Siyou, et al.
Publicado: (2024)
por: Li, Siyou, et al.
Publicado: (2024)
SZTU-CMU at MER2024: Improving Emotion-LLaMA with Conv-Attention for Multimodal Emotion Recognition
por: Cheng, Zebang, et al.
Publicado: (2024)
por: Cheng, Zebang, et al.
Publicado: (2024)
TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning
por: Chu, Meng, et al.
Publicado: (2025)
por: Chu, Meng, et al.
Publicado: (2025)
MMS-LLaMA: Efficient LLM-based Audio-Visual Speech Recognition with Minimal Multimodal Speech Tokens
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
ECHO-LLaMA: Efficient Caching for High-Performance LLaMA Training
por: Dialameh, Maryam, et al.
Publicado: (2025)
por: Dialameh, Maryam, et al.
Publicado: (2025)
LLaVA-OneVision: Easy Visual Task Transfer
por: Li, Bo, et al.
Publicado: (2024)
por: Li, Bo, et al.
Publicado: (2024)
High-Accuracy ECG Image Interpretation using Parameter-Efficient LoRA Fine-Tuning with Multimodal LLaMA 3.2
por: M, Nandakishor, et al.
Publicado: (2025)
por: M, Nandakishor, et al.
Publicado: (2025)
VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding
por: Zhang, Boqiang, et al.
Publicado: (2025)
por: Zhang, Boqiang, et al.
Publicado: (2025)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
por: Cheng, Zesen, et al.
Publicado: (2024)
por: Cheng, Zesen, et al.
Publicado: (2024)
OccLLaMA: An Occupancy-Language-Action Generative World Model for Autonomous Driving
por: Wei, Julong, et al.
Publicado: (2024)
por: Wei, Julong, et al.
Publicado: (2024)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
por: Ge, Chunjiang, et al.
Publicado: (2024)
por: Ge, Chunjiang, et al.
Publicado: (2024)
LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training
por: Zhu, Tong, et al.
Publicado: (2024)
por: Zhu, Tong, et al.
Publicado: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
por: Yan, Dawei, et al.
Publicado: (2024)
por: Yan, Dawei, et al.
Publicado: (2024)
LogLLaMA: Transformer-based log anomaly detection with LLaMA
por: Yang, Zhuoyi, et al.
Publicado: (2025)
por: Yang, Zhuoyi, et al.
Publicado: (2025)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
por: An, Xiang, et al.
Publicado: (2026)
por: An, Xiang, et al.
Publicado: (2026)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
por: Huang, Guolei, et al.
Publicado: (2025)
por: Huang, Guolei, et al.
Publicado: (2025)
PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training
por: Chen, Cong, et al.
Publicado: (2025)
por: Chen, Cong, et al.
Publicado: (2025)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
por: Ye, Xubing, et al.
Publicado: (2024)
por: Ye, Xubing, et al.
Publicado: (2024)
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
por: Inal, Gokce, et al.
Publicado: (2026)
por: Inal, Gokce, et al.
Publicado: (2026)
LLaDA-VLA: Vision Language Diffusion Action Models
por: Wen, Yuqing, et al.
Publicado: (2025)
por: Wen, Yuqing, et al.
Publicado: (2025)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
por: Cao, Meng, et al.
Publicado: (2024)
por: Cao, Meng, et al.
Publicado: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
por: Lin, Bin, et al.
Publicado: (2024)
por: Lin, Bin, et al.
Publicado: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2025)
por: An, Ruichuan, et al.
Publicado: (2025)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
por: An, Ruichuan, et al.
Publicado: (2024)
por: An, Ruichuan, et al.
Publicado: (2024)
Ejemplares similares
-
Adapting LLaMA Decoder to Vision Transformer
por: Wang, Jiahao, et al.
Publicado: (2024) -
LLaMA-Reg: Using LLaMA 2 for Unsupervised Medical Image Registration
por: Ma, Mingrui, et al.
Publicado: (2024) -
VoCo-LLaMA: Towards Vision Compression with Large Language Models
por: Ye, Xubing, et al.
Publicado: (2024) -
Efficient LLaMA-3.2-Vision by Trimming Cross-attended Visual Features
por: Lee, Jewon, et al.
Publicado: (2025) -
LLaMA-XR: A Novel Framework for Radiology Report Generation using LLaMA and QLoRA Fine Tuning
por: Jahangir, Md. Zihad Bin, et al.
Publicado: (2025)