SHAKTI: A 2.5 Billion Parameter Small Language Model Optimized for Edge AI and Low-Resource Environments
Fuente:
arXiv
Salvato in:
| Autori principali: | Shakhadri, Syed Abdul Gaffar, KR, Kruthika, Aralimatti, Rakshit |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Fine-Tuning Small Language Models for Domain-Specific AI: An Edge AI Perspective
di: Aralimatti, Rakshit, et al.
Pubblicazione: (2025)
di: Aralimatti, Rakshit, et al.
Pubblicazione: (2025)
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025)
Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era
di: Oneata, Dan, et al.
Pubblicazione: (2025)
di: Oneata, Dan, et al.
Pubblicazione: (2025)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
Chitrarth: Bridging Vision and Language for a Billion People
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
di: Khan, Shaharukh, et al.
Pubblicazione: (2025)
Arctic-TILT. Business Document Understanding at Sub-Billion Scale
di: Borchmann, Łukasz, et al.
Pubblicazione: (2024)
di: Borchmann, Łukasz, et al.
Pubblicazione: (2024)
What If We Recaption Billions of Web Images with LLaMA-3?
di: Li, Xianhang, et al.
Pubblicazione: (2024)
di: Li, Xianhang, et al.
Pubblicazione: (2024)
Evaluating Vision Language Model Adaptations for Radiology Report Generation in Low-Resource Languages
di: Salmè, Marco, et al.
Pubblicazione: (2025)
di: Salmè, Marco, et al.
Pubblicazione: (2025)
LowCLIP: Adapting the CLIP Model Architecture for Low-Resource Languages in Multimodal Image Retrieval Task
di: Asgarov, Ali, et al.
Pubblicazione: (2024)
di: Asgarov, Ali, et al.
Pubblicazione: (2024)
HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices
di: Tami, Mohammad Abu, et al.
Pubblicazione: (2025)
di: Tami, Mohammad Abu, et al.
Pubblicazione: (2025)
SentiMaithili: A Benchmark Dataset for Sentiment and Reason Generation for the Low-Resource Maithili Language
di: Ranjan, Rahul, et al.
Pubblicazione: (2025)
di: Ranjan, Rahul, et al.
Pubblicazione: (2025)
ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting
di: Fields, Clayton, et al.
Pubblicazione: (2026)
di: Fields, Clayton, et al.
Pubblicazione: (2026)
PP-OCRv5: A Specialized 5M-Parameter Model Rivaling Billion-Parameter Vision-Language Models on OCR Tasks
di: Cui, Cheng, et al.
Pubblicazione: (2026)
di: Cui, Cheng, et al.
Pubblicazione: (2026)
RoundTripOCR: A Data Generation Technique for Enhancing Post-OCR Error Correction in Low-Resource Devanagari Languages
di: Kashid, Harshvivek, et al.
Pubblicazione: (2024)
di: Kashid, Harshvivek, et al.
Pubblicazione: (2024)
MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
di: Niu, Junbo, et al.
Pubblicazione: (2025)
di: Niu, Junbo, et al.
Pubblicazione: (2025)
Qwen2.5-VL Technical Report
di: Bai, Shuai, et al.
Pubblicazione: (2025)
di: Bai, Shuai, et al.
Pubblicazione: (2025)
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
di: Gao, Yufei, et al.
Pubblicazione: (2025)
di: Gao, Yufei, et al.
Pubblicazione: (2025)
Scaling Diffusion Transformers to 16 Billion Parameters
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
di: Fei, Zhengcong, et al.
Pubblicazione: (2024)
TASO: Task-Aligned Sparse Optimization for Parameter-Efficient Model Adaptation
di: Miao, Daiye, et al.
Pubblicazione: (2025)
di: Miao, Daiye, et al.
Pubblicazione: (2025)
KOSMOS-2.5: A Multimodal Literate Model
di: Lv, Tengchao, et al.
Pubblicazione: (2023)
di: Lv, Tengchao, et al.
Pubblicazione: (2023)
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
di: Choudhury, Pankaj, et al.
Pubblicazione: (2025)
di: Choudhury, Pankaj, et al.
Pubblicazione: (2025)
InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output
di: Zhang, Pan, et al.
Pubblicazione: (2024)
di: Zhang, Pan, et al.
Pubblicazione: (2024)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
di: Atuhurra, Jesse, et al.
Pubblicazione: (2025)
di: Atuhurra, Jesse, et al.
Pubblicazione: (2025)
HyperVL: An Efficient and Dynamic Multimodal Large Language Model for Edge Devices
di: HyperAI Team, et al.
Pubblicazione: (2025)
di: HyperAI Team, et al.
Pubblicazione: (2025)
Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models
di: Reka Team, et al.
Pubblicazione: (2024)
di: Reka Team, et al.
Pubblicazione: (2024)
SmoGVLM: A Small, Graph-enhanced Vision-Language Model
di: Mondal, Debjyoti, et al.
Pubblicazione: (2026)
di: Mondal, Debjyoti, et al.
Pubblicazione: (2026)
Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
di: Zhu, Minjie, et al.
Pubblicazione: (2024)
2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
di: Zhang, Wenqi, et al.
Pubblicazione: (2025)
Holodeck: Language Guided Generation of 3D Embodied AI Environments
di: Yang, Yue, et al.
Pubblicazione: (2023)
di: Yang, Yue, et al.
Pubblicazione: (2023)
Sublinear Variational Optimization of Gaussian Mixture Models with Millions to Billions of Parameters
di: Salwig, Sebastian, et al.
Pubblicazione: (2025)
di: Salwig, Sebastian, et al.
Pubblicazione: (2025)
KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
di: Gagnier, Henry, et al.
Pubblicazione: (2026)
LLaVA-Phi: Efficient Multi-Modal Assistant with Small Language Model
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
di: Zhu, Yichen, et al.
Pubblicazione: (2024)
TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
di: Yuan, Zhengqing, et al.
Pubblicazione: (2023)
Signformer is all you need: Towards Edge AI for Sign Language
di: Yang, Eta
Pubblicazione: (2024)
di: Yang, Eta
Pubblicazione: (2024)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
di: Han, Bin, et al.
Pubblicazione: (2024)
di: Han, Bin, et al.
Pubblicazione: (2024)
ERVQA: A Dataset to Benchmark the Readiness of Large Vision Language Models in Hospital Environments
di: Ray, Sourjyadip, et al.
Pubblicazione: (2024)
di: Ray, Sourjyadip, et al.
Pubblicazione: (2024)
PEFT A2Z: Parameter-Efficient Fine-Tuning Survey for Large Language and Vision Models
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
di: Prottasha, Nusrat Jahan, et al.
Pubblicazione: (2025)
MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale
di: Wang, Bin, et al.
Pubblicazione: (2026)
di: Wang, Bin, et al.
Pubblicazione: (2026)
Visually Grounded Speech Models for Low-resource Languages and Cognitive Modelling
di: Nortje, Leanne
Pubblicazione: (2024)
di: Nortje, Leanne
Pubblicazione: (2024)
Documenti analoghi
-
Fine-Tuning Small Language Models for Domain-Specific AI: An Edge AI Perspective
di: Aralimatti, Rakshit, et al.
Pubblicazione: (2025) -
Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025) -
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
di: Shakhadri, Syed Abdul Gaffar, et al.
Pubblicazione: (2025) -
Seeing What Tastes Good: Revisiting Multimodal Distributional Semantics in the Billion Parameter Era
di: Oneata, Dan, et al.
Pubblicazione: (2025) -
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
di: Nguyen, Thong, et al.
Pubblicazione: (2023)