AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Awais, Muhammad, Alharthi, Ali Husain Salem Abdulla, Kumar, Amandeep, Cholakkal, Hisham, Anwer, Rao Muhammad |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
por: Kumar, Amandeep, et al.
Publicado: (2024)
por: Kumar, Amandeep, et al.
Publicado: (2024)
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
por: Kumar, Komal, et al.
Publicado: (2025)
por: Kumar, Komal, et al.
Publicado: (2025)
Multi-modal Generation via Cross-Modal In-Context Learning
por: Kumar, Amandeep, et al.
Publicado: (2024)
por: Kumar, Amandeep, et al.
Publicado: (2024)
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
por: Thawakar, Omkar, et al.
Publicado: (2023)
por: Thawakar, Omkar, et al.
Publicado: (2023)
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
por: Nawaz, Umair, et al.
Publicado: (2025)
por: Nawaz, Umair, et al.
Publicado: (2025)
AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models
por: Mahmood, Hazza, et al.
Publicado: (2026)
por: Mahmood, Hazza, et al.
Publicado: (2026)
Tracking Meets Large Multimodal Models for Driving Scenario Understanding
por: Ishaq, Ayesha, et al.
Publicado: (2025)
por: Ishaq, Ayesha, et al.
Publicado: (2025)
AgriCLIP: Adapting CLIP for Agriculture and Livestock via Domain-Specialized Cross-Model Alignment
por: Nawaz, Umair, et al.
Publicado: (2024)
por: Nawaz, Umair, et al.
Publicado: (2024)
Semi-supervised Open-World Object Detection
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
CDChat: A Large Multimodal Model for Remote Sensing Change Description
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
CLIMB-3D: Continual Learning for Imbalanced 3D Instance Segmentation
por: Thengane, Vishal, et al.
Publicado: (2025)
por: Thengane, Vishal, et al.
Publicado: (2025)
Adapting In-Domain Few-Shot Segmentation to New Domains without Source Domain Retraining
por: Fan, Qi, et al.
Publicado: (2025)
por: Fan, Qi, et al.
Publicado: (2025)
EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards
por: Thawakar, Omkar, et al.
Publicado: (2025)
por: Thawakar, Omkar, et al.
Publicado: (2025)
MedROV: Towards Real-Time Open-Vocabulary Detection Across Diverse Medical Imaging Modalities
por: Sheikh, Tooba Tehreem, et al.
Publicado: (2025)
por: Sheikh, Tooba Tehreem, et al.
Publicado: (2025)
TAViS: Text-bridged Audio-Visual Segmentation with Foundation Models
por: Luo, Ziyang, et al.
Publicado: (2025)
por: Luo, Ziyang, et al.
Publicado: (2025)
ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark
por: Ghaboura, Sara, et al.
Publicado: (2025)
por: Ghaboura, Sara, et al.
Publicado: (2025)
Open-YOLO 3D: Towards Fast and Accurate Open-Vocabulary 3D Instance Segmentation
por: Boudjoghra, Mohamed El Amine, et al.
Publicado: (2024)
por: Boudjoghra, Mohamed El Amine, et al.
Publicado: (2024)
Open-Set Semi-Supervised Learning for Long-Tailed Medical Datasets
por: Kareem, Daniya Najiha A., et al.
Publicado: (2025)
por: Kareem, Daniya Najiha A., et al.
Publicado: (2025)
Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2025)
por: Zhou, Jinxing, et al.
Publicado: (2025)
AIN: The Arabic INclusive Large Multimodal Model
por: Heakl, Ahmed, et al.
Publicado: (2025)
por: Heakl, Ahmed, et al.
Publicado: (2025)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
por: Kumar, Komal, et al.
Publicado: (2025)
por: Kumar, Komal, et al.
Publicado: (2025)
AgroBench: Vision-Language Model Benchmark in Agriculture
por: Shinoda, Risa, et al.
Publicado: (2025)
por: Shinoda, Risa, et al.
Publicado: (2025)
Open3DTrack: Towards Open-Vocabulary 3D Multi-Object Tracking
por: Ishaq, Ayesha, et al.
Publicado: (2024)
por: Ishaq, Ayesha, et al.
Publicado: (2024)
Audit After Segmentation: Reference-Free Mask Quality Assessment for Language-Referred Audio-Visual Segmentation
por: Zhou, Jinxing, et al.
Publicado: (2026)
por: Zhou, Jinxing, et al.
Publicado: (2026)
Salient Mask-Guided Vision Transformer for Fine-Grained Classification
por: Demidov, Dmitry, et al.
Publicado: (2023)
por: Demidov, Dmitry, et al.
Publicado: (2023)
BOrg: A Brain Organoid-Based Mitosis Dataset for Automatic Analysis of Brain Diseases
por: Awais, Muhammad, et al.
Publicado: (2024)
por: Awais, Muhammad, et al.
Publicado: (2024)
Time Travel: A Comprehensive Benchmark to Evaluate LMMs on Historical and Cultural Artifacts
por: Ghaboura, Sara, et al.
Publicado: (2025)
por: Ghaboura, Sara, et al.
Publicado: (2025)
Rethinking Transformers Pre-training for Multi-Spectral Satellite Imagery
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
BAPLe: Backdoor Attacks on Medical Foundational Models using Prompt Learning
por: Hanif, Asif, et al.
Publicado: (2024)
por: Hanif, Asif, et al.
Publicado: (2024)
GLaMM: Pixel Grounding Large Multimodal Model
por: Rasheed, Hanoona, et al.
Publicado: (2023)
por: Rasheed, Hanoona, et al.
Publicado: (2023)
GeoVLM: Improving Automated Vehicle Geolocalisation Using Vision-Language Matching
por: Dagda, Barkin, et al.
Publicado: (2025)
por: Dagda, Barkin, et al.
Publicado: (2025)
DC-ViT: Modulating Spatial and Channel Interactions for Multi-Channel Images
por: Marikkar, Umar, et al.
Publicado: (2026)
por: Marikkar, Umar, et al.
Publicado: (2026)
PARIS3D: Reasoning-based 3D Part Segmentation Using Large Multimodal Model
por: Kareem, Amrin, et al.
Publicado: (2024)
por: Kareem, Amrin, et al.
Publicado: (2024)
CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning
por: Deria, Ankan, et al.
Publicado: (2026)
por: Deria, Ankan, et al.
Publicado: (2026)
MediX-R1: Open Ended Medical Reinforcement Learning
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2026)
ChangeBind: A Hybrid Change Encoder for Remote Sensing Change Detection
por: Noman, Mubashir, et al.
Publicado: (2024)
por: Noman, Mubashir, et al.
Publicado: (2024)
BiMediX2: Bio-Medical EXpert LMM for Diverse Medical Modalities
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
por: Mullappilly, Sahal Shaji, et al.
Publicado: (2024)
CONDA: Condensed Deep Association Learning for Co-Salient Object Detection
por: Li, Long, et al.
Publicado: (2024)
por: Li, Long, et al.
Publicado: (2024)
Channel-Aware Probing for Multi-Channel Imaging
por: Marikkar, Umar, et al.
Publicado: (2026)
por: Marikkar, Umar, et al.
Publicado: (2026)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
por: Ashraf, Tajamul, et al.
Publicado: (2025)
por: Ashraf, Tajamul, et al.
Publicado: (2025)
Ejemplares similares
-
Efficient 3D-Aware Facial Image Editing via Attribute-Specific Prompt Learning
por: Kumar, Amandeep, et al.
Publicado: (2024) -
DEFT: Decompositional Efficient Fine-Tuning for Text-to-Image Models
por: Kumar, Komal, et al.
Publicado: (2025) -
Multi-modal Generation via Cross-Modal In-Context Learning
por: Kumar, Amandeep, et al.
Publicado: (2024) -
XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models
por: Thawakar, Omkar, et al.
Publicado: (2023) -
AI in Agriculture: A Survey of Deep Learning Techniques for Crops, Fisheries and Livestock
por: Nawaz, Umair, et al.
Publicado: (2025)