LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Inal, Gokce, Navard, Pouyan, Yilmaz, Alper |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SegFormer3D: an Efficient Transformer for 3D Medical Image Segmentation
par: Perera, Shehan, et autres
Publié: (2024)
par: Perera, Shehan, et autres
Publié: (2024)
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
par: Lu, Weiheng, et autres
Publié: (2024)
par: Lu, Weiheng, et autres
Publié: (2024)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024)
par: Guo, Xuechen, et autres
Publié: (2024)
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)
par: Sun, Guohao, et autres
Publié: (2024)
Power-LLaVA: Large Language and Vision Assistant for Power Transmission Line Inspection
par: Wang, Jiahao, et autres
Publié: (2024)
par: Wang, Jiahao, et autres
Publié: (2024)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
par: Ye, Xubing, et autres
Publié: (2024)
par: Ye, Xubing, et autres
Publié: (2024)
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
par: Lin, Bin, et autres
Publié: (2024)
par: Lin, Bin, et autres
Publié: (2024)
Continual LLaVA: Continual Instruction Tuning in Large Vision-Language Models
par: Cao, Meng, et autres
Publié: (2024)
par: Cao, Meng, et autres
Publié: (2024)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
par: Zhu, Yichen, et autres
Publié: (2024)
par: Zhu, Yichen, et autres
Publié: (2024)
Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases
par: Wang, Liqiong, et autres
Publié: (2024)
par: Wang, Liqiong, et autres
Publié: (2024)
ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant
par: Xiang, Yifan, et autres
Publié: (2025)
par: Xiang, Yifan, et autres
Publié: (2025)
Loki: Representation over Architecture for Diffusion-Based Portrait Animation
par: Navard, Pouyan, et autres
Publié: (2026)
par: Navard, Pouyan, et autres
Publié: (2026)
LLaVA-MoD: Making LLaVA Tiny via MoE Knowledge Distillation
par: Shu, Fangxun, et autres
Publié: (2024)
par: Shu, Fangxun, et autres
Publié: (2024)
MCA-LLaVA: Manhattan Causal Attention for Reducing Hallucination in Large Vision-Language Models
par: Zhao, Qiyan, et autres
Publié: (2025)
par: Zhao, Qiyan, et autres
Publié: (2025)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
par: Jahagirdar, Soumya, et autres
Publié: (2026)
par: Jahagirdar, Soumya, et autres
Publié: (2026)
LLaVA-CoT: Let Vision Language Models Reason Step-by-Step
par: Xu, Guowei, et autres
Publié: (2024)
par: Xu, Guowei, et autres
Publié: (2024)
TG-LLaVA: Text Guided LLaVA via Learnable Latent Embeddings
par: Yan, Dawei, et autres
Publié: (2024)
par: Yan, Dawei, et autres
Publié: (2024)
HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models
par: Huang, Runhui, et autres
Publié: (2024)
par: Huang, Runhui, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2024)
par: An, Ruichuan, et autres
Publié: (2024)
MC-LLaVA: Multi-Concept Personalized Vision-Language Model
par: An, Ruichuan, et autres
Publié: (2025)
par: An, Ruichuan, et autres
Publié: (2025)
Why do LLaVA Vision-Language Models Reply to Images in English?
par: Hinck, Musashi, et autres
Publié: (2024)
par: Hinck, Musashi, et autres
Publié: (2024)
LLaVA-KD: A Framework of Distilling Multimodal Large Language Models
par: Cai, Yuxuan, et autres
Publié: (2024)
par: Cai, Yuxuan, et autres
Publié: (2024)
Delta-LLaVA: Base-then-Specialize Alignment for Token-Efficient Vision-Language Models
par: Zamini, Mohamad, et autres
Publié: (2025)
par: Zamini, Mohamad, et autres
Publié: (2025)
LLaVA-SLT: Visual Language Tuning for Sign Language Translation
par: Liang, Han, et autres
Publié: (2024)
par: Liang, Han, et autres
Publié: (2024)
Surgical-LLaVA: Toward Surgical Scenario Understanding via Large Language and Vision Models
par: Jin, Juseong, et autres
Publié: (2024)
par: Jin, Juseong, et autres
Publié: (2024)
u-LLaVA: Unifying Multi-Modal Tasks via Large Language Model
par: Xu, Jinjin, et autres
Publié: (2023)
par: Xu, Jinjin, et autres
Publié: (2023)
Cosmos-LLaVA: Chatting with the Visual Cosmos-LLaVA: Görselle Sohbet Etmek
par: Zeer, Ahmed, et autres
Publié: (2024)
par: Zeer, Ahmed, et autres
Publié: (2024)
Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
par: Kim, Younggun, et autres
Publié: (2025)
par: Kim, Younggun, et autres
Publié: (2025)
LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence
par: An, Xiang, et autres
Publié: (2026)
par: An, Xiang, et autres
Publié: (2026)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image
par: Liang, Yuci, et autres
Publié: (2024)
par: Liang, Yuci, et autres
Publié: (2024)
LLaVA-RE: Binary Image-Text Relevancy Evaluation with Multimodal Large Language Model
par: Sun, Tao, et autres
Publié: (2025)
par: Sun, Tao, et autres
Publié: (2025)
LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
par: Gkalelis, Nikolaos, et autres
Publié: (2026)
LLaVA-FA: Learning Fourier Approximation for Compressing Large Multimodal Models
par: Zheng, Pengcheng, et autres
Publié: (2026)
par: Zheng, Pengcheng, et autres
Publié: (2026)
Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models
par: Zhang, Yi-Fan, et autres
Publié: (2024)
par: Zhang, Yi-Fan, et autres
Publié: (2024)
LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
par: Li, Jiajie, et autres
Publié: (2024)
par: Li, Jiajie, et autres
Publié: (2024)
LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs
par: Chen, Shaoxiang, et autres
Publié: (2024)
par: Chen, Shaoxiang, et autres
Publié: (2024)
KnobGen: Controlling the Sophistication of Artwork in Sketch-Based Diffusion Models
par: Navard, Pouyan, et autres
Publié: (2024)
par: Navard, Pouyan, et autres
Publié: (2024)
Yo'LLaVA: Your Personalized Language and Vision Assistant
par: Nguyen, Thao, et autres
Publié: (2024)
par: Nguyen, Thao, et autres
Publié: (2024)
Documents similaires
-
SegFormer3D: an Efficient Transformer for 3D Medical Image Segmentation
par: Perera, Shehan, et autres
Publié: (2024) -
LLaVA-MR: Large Language-and-Vision Assistant for Video Moment Retrieval
par: Lu, Weiheng, et autres
Publié: (2024) -
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
par: Guo, Xuechen, et autres
Publié: (2024) -
LLaVA-VSD: Large Language-and-Vision Assistant for Visual Spatial Description
par: Jin, Yizhang, et autres
Publié: (2024) -
SQ-LLaVA: Self-Questioning for Large Vision-Language Assistant
par: Sun, Guohao, et autres
Publié: (2024)