Shakti-VLMs: Scalable Vision-Language Models for Enterprise AI
Fuente:
arXiv
Guardado en:
| Autores principales: | Shakhadri, Syed Abdul Gaffar, KR, Kruthika, Angadi, Kartik Basavaraj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Fine-Tuning Small Language Models for Domain-Specific AI: An Edge AI Perspective
por: Aralimatti, Rakshit, et al.
Publicado: (2025)
por: Aralimatti, Rakshit, et al.
Publicado: (2025)
SHAKTI: A 2.5 Billion Parameter Small Language Model Optimized for Edge AI and Low-Resource Environments
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2024)
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2024)
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2025)
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2025)
VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality
por: Bandraupalli, Srihari, et al.
Publicado: (2025)
por: Bandraupalli, Srihari, et al.
Publicado: (2025)
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
por: Shahgir, Haz Sameen, et al.
Publicado: (2026)
por: Shahgir, Haz Sameen, et al.
Publicado: (2026)
Can We Predict Performance of Large Models across Vision-Language Tasks?
por: Zhao, Qinyu, et al.
Publicado: (2024)
por: Zhao, Qinyu, et al.
Publicado: (2024)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
por: Zhao, Qinyu, et al.
Publicado: (2024)
por: Zhao, Qinyu, et al.
Publicado: (2024)
Scalable Vision Language Model Training via High Quality Data Curation
por: Dong, Hongyuan, et al.
Publicado: (2025)
por: Dong, Hongyuan, et al.
Publicado: (2025)
Are VLMs Really Blind
por: Singh, Ayush, et al.
Publicado: (2024)
por: Singh, Ayush, et al.
Publicado: (2024)
SOLO: A Single Transformer for Scalable Vision-Language Modeling
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
por: Jing, Liqiang, et al.
Publicado: (2024)
por: Jing, Liqiang, et al.
Publicado: (2024)
Audio Description Generation in the Era of LLMs and VLMs: A Review of Transferable Generative AI Technologies
por: Gao, Yingqiang, et al.
Publicado: (2024)
por: Gao, Yingqiang, et al.
Publicado: (2024)
VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images
por: Zhou, Guanyu, et al.
Publicado: (2026)
por: Zhou, Guanyu, et al.
Publicado: (2026)
On the Perception Bottleneck of VLMs for Chart Understanding
por: Liu, Junteng, et al.
Publicado: (2025)
por: Liu, Junteng, et al.
Publicado: (2025)
CIVET: Systematic Evaluation of Understanding in VLMs
por: Rizzoli, Massimo, et al.
Publicado: (2025)
por: Rizzoli, Massimo, et al.
Publicado: (2025)
VLFeedback: A Large-Scale AI Feedback Dataset for Large Vision-Language Models Alignment
por: Li, Lei, et al.
Publicado: (2024)
por: Li, Lei, et al.
Publicado: (2024)
[De|Re]constructing VLMs' Reasoning in Counting
por: Alghisi, Simone, et al.
Publicado: (2025)
por: Alghisi, Simone, et al.
Publicado: (2025)
LADDER: Language-Driven Slice Discovery and Error Rectification in Vision Classifiers
por: Ghosh, Shantanu, et al.
Publicado: (2024)
por: Ghosh, Shantanu, et al.
Publicado: (2024)
How Does Vision-Language Adaptation Impact the Safety of Vision Language Models?
por: Lee, Seongyun, et al.
Publicado: (2024)
por: Lee, Seongyun, et al.
Publicado: (2024)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
Conflict Adaptation in Vision-Language Models
por: Hu, Xiaoyang
Publicado: (2025)
por: Hu, Xiaoyang
Publicado: (2025)
Vision Language Models are Confused Tourists
por: Irawan, Patrick Amadeus, et al.
Publicado: (2025)
por: Irawan, Patrick Amadeus, et al.
Publicado: (2025)
Prism: A Framework for Decoupling and Assessing the Capabilities of VLMs
por: Qiao, Yuxuan, et al.
Publicado: (2024)
por: Qiao, Yuxuan, et al.
Publicado: (2024)
FlightGPT: Towards Generalizable and Interpretable UAV Vision-and-Language Navigation with Vision-Language Models
por: Cai, Hengxing, et al.
Publicado: (2025)
por: Cai, Hengxing, et al.
Publicado: (2025)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Do Vision-Language Models Really Understand Visual Language?
por: Hou, Yifan, et al.
Publicado: (2024)
por: Hou, Yifan, et al.
Publicado: (2024)
Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
por: Shen, Yifan, et al.
Publicado: (2025)
por: Shen, Yifan, et al.
Publicado: (2025)
Vision-Language Models Do Not Understand Negation
por: Alhamoud, Kumail, et al.
Publicado: (2025)
por: Alhamoud, Kumail, et al.
Publicado: (2025)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
Evaluating Vision-Language Models for Emotion Recognition
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
por: Bhattacharyya, Sree, et al.
Publicado: (2025)
Evaluation of Cultural Competence of Vision-Language Models
por: Yadav, Srishti, et al.
Publicado: (2025)
por: Yadav, Srishti, et al.
Publicado: (2025)
Vision Language Models Are Not (Yet) Spelling Correctors
por: Liang, Junhong, et al.
Publicado: (2025)
por: Liang, Junhong, et al.
Publicado: (2025)
Intriguing Properties of Large Language and Vision Models
por: Lee, Young-Jun, et al.
Publicado: (2024)
por: Lee, Young-Jun, et al.
Publicado: (2024)
Preserving Multi-Modal Capabilities of Pre-trained VLMs for Improving Vision-Linguistic Compositionality
por: Oh, Youngtaek, et al.
Publicado: (2024)
por: Oh, Youngtaek, et al.
Publicado: (2024)
VideoJudge: Bootstrapping Enables Scalable Supervision of MLLM-as-a-Judge for Video Understanding
por: Waheed, Abdul, et al.
Publicado: (2025)
por: Waheed, Abdul, et al.
Publicado: (2025)
ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
por: Kang, Jialiang, et al.
Publicado: (2025)
por: Kang, Jialiang, et al.
Publicado: (2025)
Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects
por: Sayeedi, Nurul Labib, et al.
Publicado: (2026)
por: Sayeedi, Nurul Labib, et al.
Publicado: (2026)
CLoVe: Encoding Compositional Language in Contrastive Vision-Language Models
por: Castro, Santiago, et al.
Publicado: (2024)
por: Castro, Santiago, et al.
Publicado: (2024)
Smart Eyes for Silent Threats: VLMs and In-Context Learning for THz Imaging
por: Poggi, Nicolas, et al.
Publicado: (2025)
por: Poggi, Nicolas, et al.
Publicado: (2025)
Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
por: Hayashi, Kazuki, et al.
Publicado: (2025)
por: Hayashi, Kazuki, et al.
Publicado: (2025)
Ejemplares similares
-
Fine-Tuning Small Language Models for Domain-Specific AI: An Edge AI Perspective
por: Aralimatti, Rakshit, et al.
Publicado: (2025) -
SHAKTI: A 2.5 Billion Parameter Small Language Model Optimized for Edge AI and Low-Resource Environments
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2024) -
Samba-ASR: State-Of-The-Art Speech Recognition Leveraging Structured State-Space Models
por: Shakhadri, Syed Abdul Gaffar, et al.
Publicado: (2025) -
VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality
por: Bandraupalli, Srihari, et al.
Publicado: (2025) -
VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors
por: Shahgir, Haz Sameen, et al.
Publicado: (2026)