Pushing Boundaries: Exploring Zero Shot Object Classification with Large Multimodal Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Islam, Ashhadul, Biswas, Md. Rafiul, Zaghouani, Wajdi, Belhaouari, Samir Brahim, Shah, Zubair |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MemeMind at ArAIEval Shared Task: Spotting Persuasive Spans in Arabic Text with Persuasion Techniques Identification
par: Biswas, Md Rafiul, et autres
Publié: (2024)
par: Biswas, Md Rafiul, et autres
Publié: (2024)
Systematic Weight Evaluation for Pruning Large Language Models: Enhancing Performance and Sustainability
par: Islam, Ashhadul, et autres
Publié: (2025)
par: Islam, Ashhadul, et autres
Publié: (2025)
Early Prediction of Type 2 Diabetes Using Multimodal data and Tabular Transformers
par: Khan, Sulaiman, et autres
Publié: (2026)
par: Khan, Sulaiman, et autres
Publié: (2026)
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
par: Zaghouani, Wajdi, et autres
Publié: (2025)
par: Zaghouani, Wajdi, et autres
Publié: (2025)
An Annotated Corpus of Arabic Tweets for Hate Speech Analysis
par: Zaghouani, Wajdi, et autres
Publié: (2025)
par: Zaghouani, Wajdi, et autres
Publié: (2025)
Integrating Non-Linear Radon Transformation for Diabetic Retinopathy Grading
par: Mohsen, Farida, et autres
Publié: (2025)
par: Mohsen, Farida, et autres
Publié: (2025)
Bio-Inspired Adaptive Neurons for Dynamic Weighting in Artificial Neural Networks
par: Islam, Ashhadul, et autres
Publié: (2024)
par: Islam, Ashhadul, et autres
Publié: (2024)
Oversampling and Downsampling with Core-Boundary Awareness: A Data Quality-Driven Approach
par: Belhaouari, Samir Brahim, et autres
Publié: (2025)
par: Belhaouari, Samir Brahim, et autres
Publié: (2025)
ArAIEval Shared Task: Propagandistic Techniques Detection in Unimodal and Multimodal Arabic Content
par: Hasanain, Maram, et autres
Publié: (2024)
par: Hasanain, Maram, et autres
Publié: (2024)
MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis
par: Biswas, Md. Rafiul, et autres
Publié: (2025)
par: Biswas, Md. Rafiul, et autres
Publié: (2025)
An Early Investigation into the Utility of Multimodal Large Language Models in Medical Imaging
par: Khan, Sulaiman, et autres
Publié: (2024)
par: Khan, Sulaiman, et autres
Publié: (2024)
ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
Propaganda to Hate: A Multimodal Analysis of Arabic Memes with Multi-Agent LLMs
par: Alam, Firoj, et autres
Publié: (2024)
par: Alam, Firoj, et autres
Publié: (2024)
Nullpointer at CheckThat! 2024: Identifying Subjectivity from Multilingual Text Sequence
par: Biswas, Md. Rafiul, et autres
Publié: (2024)
par: Biswas, Md. Rafiul, et autres
Publié: (2024)
Vision-Based Lane Following and Traffic Sign Recognition for Resource-Constrained Autonomous Vehicles
par: Islam, Md Tanjemul, et autres
Publié: (2026)
par: Islam, Md Tanjemul, et autres
Publié: (2026)
Multimodal Reasoning Agent for Zero-Shot Composed Image Retrieval
par: Tu, Rong-Cheng, et autres
Publié: (2025)
par: Tu, Rong-Cheng, et autres
Publié: (2025)
Cultural Adaptation in Large Language Models for Political Discourse
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
Focus on What Matters: Two-Stage ROI-Aware Refinement for Anatomy-Preserving Fetal Ultrasound Reconstruction
par: Abbes, Ines, et autres
Publié: (2026)
par: Abbes, Ines, et autres
Publié: (2026)
Multimodal LLMs See Sentiment
par: da Silva, Neemias B., et autres
Publié: (2025)
par: da Silva, Neemias B., et autres
Publié: (2025)
Audience Engagement with Arabic Women's Social Empowerment and Wellbeing: A Decadal Corpus
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews
par: Li, Fanxiao, et autres
Publié: (2026)
par: Li, Fanxiao, et autres
Publié: (2026)
Zero-Shot Fine-Grained Image Classification Using Large Vision-Language Models
par: Atabuzzaman, Md., et autres
Publié: (2025)
par: Atabuzzaman, Md., et autres
Publié: (2025)
Zero-Shot Hashing Based on Reconstruction With Part Alignment
par: Jiang, Yan, et autres
Publié: (2025)
par: Jiang, Yan, et autres
Publié: (2025)
Beyond Unimodal Boundaries: Generative Recommendation with Multimodal Semantics
par: Zhu, Jing, et autres
Publié: (2025)
par: Zhu, Jing, et autres
Publié: (2025)
Building Arabic NLP from the Ground Up: Twenty Years of Lessons, Failures, and Open Problems
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities
par: Zaghouani, Wajdi
Publié: (2026)
par: Zaghouani, Wajdi
Publié: (2026)
Vote-in-Context: Turning VLMs into Zero-Shot Rank Fusers
par: Eltahir, Mohamed, et autres
Publié: (2025)
par: Eltahir, Mohamed, et autres
Publié: (2025)
Visual Zero-Shot E-Commerce Product Attribute Value Extraction
par: Gong, Jiaying, et autres
Publié: (2025)
par: Gong, Jiaying, et autres
Publié: (2025)
Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation
par: Zhang, Ziniu, et autres
Publié: (2025)
par: Zhang, Ziniu, et autres
Publié: (2025)
BlendCLIP: Bridging Synthetic and Real Domains for Zero-Shot 3D Object Classification with Multimodal Pretraining
par: Khoche, Ajinkya, et autres
Publié: (2025)
par: Khoche, Ajinkya, et autres
Publié: (2025)
iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval
par: Agnolucci, Lorenzo, et autres
Publié: (2024)
par: Agnolucci, Lorenzo, et autres
Publié: (2024)
ChartZero: Synthetic Priors Enable Zero Shot Chart Data Extraction
par: Islam, Md Touhidul, et autres
Publié: (2026)
par: Islam, Md Touhidul, et autres
Publié: (2026)
A Heterogeneous Multimodal Graph Learning Framework for Recognizing User Emotions in Social Networks
par: Bhattacharyya, Sree, et autres
Publié: (2025)
par: Bhattacharyya, Sree, et autres
Publié: (2025)
Using Computer Vision for Skin Disease Diagnosis in Bangladesh Enhancing Interpretability and Transparency in Deep Learning Models for Skin Cancer Classification
par: Islam, Rafiul, et autres
Publié: (2025)
par: Islam, Rafiul, et autres
Publié: (2025)
Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions
par: Kang, Caixin, et autres
Publié: (2025)
par: Kang, Caixin, et autres
Publié: (2025)
What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models
par: Abdelhamed, Abdelrahman, et autres
Publié: (2024)
par: Abdelhamed, Abdelrahman, et autres
Publié: (2024)
MLLM-Guided VLM Fine-Tuning with Joint Inference for Zero-Shot Composed Image Retrieval
par: Tu, Rong-Cheng, et autres
Publié: (2025)
par: Tu, Rong-Cheng, et autres
Publié: (2025)
CNN-Based Framework for Pedestrian Age and Gender Classification Using Far-View Surveillance in Mixed-Traffic Intersections
par: Arif, Shisir Shahriar, et autres
Publié: (2025)
par: Arif, Shisir Shahriar, et autres
Publié: (2025)
CrisisViT: A Robust Vision Transformer for Crisis Image Classification
par: Long, Zijun, et autres
Publié: (2024)
par: Long, Zijun, et autres
Publié: (2024)
Resolving Sentiment Discrepancy for Multimodal Sentiment Detection via Semantics Completion and Decomposition
par: Wu, Daiqing, et autres
Publié: (2024)
par: Wu, Daiqing, et autres
Publié: (2024)
Documents similaires
-
MemeMind at ArAIEval Shared Task: Spotting Persuasive Spans in Arabic Text with Persuasion Techniques Identification
par: Biswas, Md Rafiul, et autres
Publié: (2024) -
Systematic Weight Evaluation for Pruning Large Language Models: Enhancing Performance and Sustainability
par: Islam, Ashhadul, et autres
Publié: (2025) -
Early Prediction of Type 2 Diabetes Using Multimodal data and Tabular Transformers
par: Khan, Sulaiman, et autres
Publié: (2026) -
EmoHopeSpeech: An Annotated Dataset of Emotions and Hope Speech in English and Arabic
par: Zaghouani, Wajdi, et autres
Publié: (2025) -
An Annotated Corpus of Arabic Tweets for Hate Speech Analysis
par: Zaghouani, Wajdi, et autres
Publié: (2025)