LLaVA-SG: Leveraging Scene Graphs as Visual Semantic Expression in Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Jingyi, Ju, Jianzhong, Luan, Jian, Deng, Zhidong |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)
par: Zhang, Ruiyi, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
par: Jin, Juseong, et autres
Publié: (2024)
par: Jin, Juseong, et autres
Publié: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
par: Xiang, Yifan, et autres
Publié: (2025)
par: Xiang, Yifan, et autres
Publié: (2025)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
AVG-LLaVA: An Efficient Large Multimodal Model with Adaptive Visual Granularity
par: Lan, Zhibin, et autres
Publié: (2024)
par: Lan, Zhibin, et autres
Publié: (2024)
R-LLaVA: Improving Med-VQA Understanding through Visual Region of Interest
par: Chen, Xupeng, et autres
Publié: (2024)
par: Chen, Xupeng, et autres
Publié: (2024)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
par: Ma, Yiwei, et autres
Publié: (2024)
par: Ma, Yiwei, et autres
Publié: (2024)
Face-LLaVA: Facial Expression and Attribute Understanding through Instruction Tuning
par: Chaubey, Ashutosh, et autres
Publié: (2025)
par: Chaubey, Ashutosh, et autres
Publié: (2025)
LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information
par: Wang, Ke, et autres
Publié: (2024)
par: Wang, Ke, et autres
Publié: (2024)
LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token
par: Zhang, Shaolei, et autres
Publié: (2025)
par: Zhang, Shaolei, et autres
Publié: (2025)
LLaVA-UHD v3: Progressive Visual Compression for Efficient Native-Resolution Encoding in MLLMs
par: Sun, Shichu, et autres
Publié: (2025)
par: Sun, Shichu, et autres
Publié: (2025)
Inverse-LLaVA: Eliminating Alignment Pre-training Through Text-to-Vision Mapping
par: Zhan, Xuhui, et autres
Publié: (2025)
par: Zhan, Xuhui, et autres
Publié: (2025)
Dr-LLaVA: Visual Instruction Tuning with Symbolic Clinical Grounding
par: Sun, Shenghuan, et autres
Publié: (2024)
par: Sun, Shenghuan, et autres
Publié: (2024)
LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
par: Sun, Boyuan, et autres
Publié: (2025)
par: Sun, Boyuan, et autres
Publié: (2025)
TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations
par: Gao, Mingze, et autres
Publié: (2024)
par: Gao, Mingze, et autres
Publié: (2024)
LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images
par: Xu, Ruyi, et autres
Publié: (2024)
par: Xu, Ruyi, et autres
Publié: (2024)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
par: Liang, Han, et autres
Publié: (2024)
par: Liang, Han, et autres
Publié: (2024)
Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification
par: Huang, Wenxuan, et autres
Publié: (2024)
par: Huang, Wenxuan, et autres
Publié: (2024)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
par: Li, Jiajie, et autres
Publié: (2024)
par: Li, Jiajie, et autres
Publié: (2024)
LLaVA-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning
par: Cocchi, Federico, et autres
Publié: (2025)
par: Cocchi, Federico, et autres
Publié: (2025)
LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models
par: Shang, Yuzhang, et autres
Publié: (2024)
par: Shang, Yuzhang, et autres
Publié: (2024)
Wiki-LLaVA: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
FairLLaVA: Fairness-Aware Parameter-Efficient Fine-Tuning for Large Vision-Language Assistants
par: Bhosale, Mahesh, et autres
Publié: (2026)
par: Bhosale, Mahesh, et autres
Publié: (2026)
Quilt-LLaVA: Visual Instruction Tuning by Extracting Localized Narratives from Open-Source Histopathology Videos
par: Seyfioglu, Mehmet Saygin, et autres
Publié: (2023)
par: Seyfioglu, Mehmet Saygin, et autres
Publié: (2023)
Direction-Aware Diagonal Autoregressive Image Generation
par: Xu, Yijia, et autres
Publié: (2025)
par: Xu, Yijia, et autres
Publié: (2025)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
par: Lu, Weiheng, et autres
Publié: (2024)
par: Lu, Weiheng, et autres
Publié: (2024)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
par: Xu, Boshen, et autres
Publié: (2025)
par: Xu, Boshen, et autres
Publié: (2025)
ViDRiP-LLaVA: A Dataset and Benchmark for Diagnostic Reasoning from Pathology Videos
par: Vuong, Trinh T. L., et autres
Publié: (2025)
par: Vuong, Trinh T. L., et autres
Publié: (2025)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
par: Jahagirdar, Soumya, et autres
Publié: (2026)
par: Jahagirdar, Soumya, et autres
Publié: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
par: Ye, Xubing, et autres
Publié: (2024)
par: Ye, Xubing, et autres
Publié: (2024)
Documents similaires
-
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024) -
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024) -
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025) -
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024) -
LLaVA-Read: Enhancing Reading Ability of Multimodal Language Models
par: Zhang, Ruiyi, et autres
Publié: (2024)