O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Gupta, Rishi, Karuppasamy, Mukilan, Marjit, Shyam, Tripathi, Aditay, Chakraborty, Anirban |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Sketch-guided Image Inpainting with Partial Discrete Diffusion Process
by: Sharma, Nakul, et al.
Published: (2024)
by: Sharma, Nakul, et al.
Published: (2024)
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
by: Deitke, Matt, et al.
Published: (2024)
by: Deitke, Matt, et al.
Published: (2024)
Multimodal Query-guided Object Localization
by: Tripathi, Aditay, et al.
Published: (2022)
by: Tripathi, Aditay, et al.
Published: (2022)
Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers
by: Yashwanth, M, et al.
Published: (2025)
by: Yashwanth, M, et al.
Published: (2025)
CLIPDraw++: Text-to-Sketch Synthesis with Simple Primitives
by: Mathur, Nityanand, et al.
Published: (2023)
by: Mathur, Nityanand, et al.
Published: (2023)
Open Vocabulary Semantic Scene Sketch Understanding
by: Bourouis, Ahmed, et al.
Published: (2023)
by: Bourouis, Ahmed, et al.
Published: (2023)
FedSCAl: Leveraging Server and Client Alignment for Unsupervised Federated Source-Free Domain Adaptation
by: Yashwanth, M, et al.
Published: (2025)
by: Yashwanth, M, et al.
Published: (2025)
Open Vocabulary Panoptic Segmentation With Retrieval Augmentation
by: Sadeq, Nafis, et al.
Published: (2026)
by: Sadeq, Nafis, et al.
Published: (2026)
Open-Vocabulary Federated Learning with Multimodal Prototyping
by: Zeng, Huimin, et al.
Published: (2024)
by: Zeng, Huimin, et al.
Published: (2024)
Open-Vocabulary Object Detection via Language Hierarchy
by: Huang, Jiaxing, et al.
Published: (2024)
by: Huang, Jiaxing, et al.
Published: (2024)
Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding
by: Wang, Yan, et al.
Published: (2025)
by: Wang, Yan, et al.
Published: (2025)
An Iterative Feedback Mechanism for Improving Natural Language Class Descriptions in Open-Vocabulary Object Detection
by: Kim, Louis Y., et al.
Published: (2025)
by: Kim, Louis Y., et al.
Published: (2025)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
by: Wang, Zhaowei, et al.
Published: (2024)
by: Wang, Zhaowei, et al.
Published: (2024)
Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head
by: Zhao, Tiancheng, et al.
Published: (2024)
by: Zhao, Tiancheng, et al.
Published: (2024)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
by: Ma, Ziqiao, et al.
Published: (2023)
by: Ma, Ziqiao, et al.
Published: (2023)
Transferable and Principled Efficiency for Open-Vocabulary Segmentation
by: Xu, Jingxuan, et al.
Published: (2024)
by: Xu, Jingxuan, et al.
Published: (2024)
Towards Safer and Understandable Driver Intention Prediction
by: Karuppasamy, Mukilan, et al.
Published: (2025)
by: Karuppasamy, Mukilan, et al.
Published: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
by: Barsellotti, Luca, et al.
Published: (2024)
by: Barsellotti, Luca, et al.
Published: (2024)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
by: Chi, Haohan, et al.
Published: (2025)
by: Chi, Haohan, et al.
Published: (2025)
Open-Vocabulary Mobile Manipulation Based on Double Relaxed Contrastive Learning with Dense Labeling
by: Yashima, Daichi, et al.
Published: (2024)
by: Yashima, Daichi, et al.
Published: (2024)
OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer
by: Wang, Yu, et al.
Published: (2024)
by: Wang, Yu, et al.
Published: (2024)
ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
by: Tu, Yahan, et al.
Published: (2024)
by: Tu, Yahan, et al.
Published: (2024)
Open World Scene Graph Generation using Vision Language Models
by: Dutta, Amartya, et al.
Published: (2025)
by: Dutta, Amartya, et al.
Published: (2025)
CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition
by: Semnani, Sina J., et al.
Published: (2025)
by: Semnani, Sina J., et al.
Published: (2025)
Diffusion Models for Open-Vocabulary Segmentation
by: Karazija, Laurynas, et al.
Published: (2023)
by: Karazija, Laurynas, et al.
Published: (2023)
Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding
by: Tai, Hanchen, et al.
Published: (2024)
by: Tai, Hanchen, et al.
Published: (2024)
OCTO+: A Suite for Automatic Open-Vocabulary Object Placement in Mixed Reality
by: Sharma, Aditya, et al.
Published: (2024)
by: Sharma, Aditya, et al.
Published: (2024)
Hierarchical Open-Vocabulary 3D Scene Graphs for Language-Grounded Robot Navigation
by: Werby, Abdelrhman, et al.
Published: (2024)
by: Werby, Abdelrhman, et al.
Published: (2024)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
by: Luo, Run, et al.
Published: (2025)
by: Luo, Run, et al.
Published: (2025)
Open Vocabulary Multi-Label Video Classification
by: Gupta, Rohit, et al.
Published: (2024)
by: Gupta, Rohit, et al.
Published: (2024)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
by: Kini, Jyoti, et al.
Published: (2025)
by: Kini, Jyoti, et al.
Published: (2025)
ODOV: Benchmark the Open-Domain Open-Vocabulary Object Detection
by: Zhang, Yupeng, et al.
Published: (2025)
by: Zhang, Yupeng, et al.
Published: (2025)
Improving Automatic Text Recognition with Language Models in the PyLaia Open-Source Library
by: Tarride, Solène, et al.
Published: (2024)
by: Tarride, Solène, et al.
Published: (2024)
OpenLex3D: A Tiered Evaluation Benchmark for Open-Vocabulary 3D Scene Representations
by: Kassab, Christina, et al.
Published: (2025)
by: Kassab, Christina, et al.
Published: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
by: Ye, Jiacheng, et al.
Published: (2025)
by: Ye, Jiacheng, et al.
Published: (2025)
LR0.FM: Low-Res Benchmark and Improving Robustness for Zero-Shot Classification in Foundation Models
by: Pathak, Priyank, et al.
Published: (2025)
by: Pathak, Priyank, et al.
Published: (2025)
Scene-Graph ViT: End-to-End Open-Vocabulary Visual Relationship Detection
by: Salzmann, Tim, et al.
Published: (2024)
by: Salzmann, Tim, et al.
Published: (2024)
Context-based Motion Retrieval using Open Vocabulary Methods for Autonomous Driving
by: Englmeier, Stefan, et al.
Published: (2025)
by: Englmeier, Stefan, et al.
Published: (2025)
OpenScan: A Benchmark for Generalized Open-Vocabulary 3D Scene Understanding
by: Zhao, Youjun, et al.
Published: (2024)
by: Zhao, Youjun, et al.
Published: (2024)
OpenDAS: Open-Vocabulary Domain Adaptation for 2D and 3D Segmentation
by: Yilmaz, Gonca, et al.
Published: (2024)
by: Yilmaz, Gonca, et al.
Published: (2024)
Similar Items
-
Sketch-guided Image Inpainting with Partial Discrete Diffusion Process
by: Sharma, Nakul, et al.
Published: (2024) -
Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
by: Deitke, Matt, et al.
Published: (2024) -
Multimodal Query-guided Object Localization
by: Tripathi, Aditay, et al.
Published: (2022) -
Prompt Estimation from Prototypes for Federated Prompt Tuning of Vision Transformers
by: Yashwanth, M, et al.
Published: (2025) -
CLIPDraw++: Text-to-Sketch Synthesis with Simple Primitives
by: Mathur, Nityanand, et al.
Published: (2023)