LLMeBench: A Flexible Framework for Accelerating LLMs Benchmarking
Fuente:
arXiv
Guardado en:
| Autores principales: | Dalvi, Fahim, Hasanain, Maram, Boughorbel, Sabri, Mousi, Basel, Abdaljalil, Samir, Nazar, Nizi, Abdelali, Ahmed, Chowdhury, Shammur Absar, Mubarak, Hamdy, Ali, Ahmed, Hawasly, Majd, Durrani, Nadir, Alam, Firoj |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LAraBench: Benchmarking Arabic AI with Large Language Models
por: Abdelali, Ahmed, et al.
Publicado: (2023)
por: Abdelali, Ahmed, et al.
Publicado: (2023)
AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs
por: Mousi, Basel, et al.
Publicado: (2024)
por: Mousi, Basel, et al.
Publicado: (2024)
Exploring Alignment in Shared Cross-lingual Spaces
por: Mousi, Basel, et al.
Publicado: (2024)
por: Mousi, Basel, et al.
Publicado: (2024)
Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing
por: Boughorbel, Sabri, et al.
Publicado: (2025)
por: Boughorbel, Sabri, et al.
Publicado: (2025)
Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models
por: Mousi, Basel, et al.
Publicado: (2026)
por: Mousi, Basel, et al.
Publicado: (2026)
OASIS: A Multilingual and Multimodal Dataset for Culturally Grounded Spoken Visual QA
por: Alam, Firoj, et al.
Publicado: (2025)
por: Alam, Firoj, et al.
Publicado: (2025)
From Words to Waves: Analyzing Concept Formation in Speech and Text-Based Foundation Models
por: Ersoy, Asım, et al.
Publicado: (2025)
por: Ersoy, Asım, et al.
Publicado: (2025)
Editing Across Languages: A Survey of Multilingual Knowledge Editing
por: Durrani, Nadir, et al.
Publicado: (2025)
por: Durrani, Nadir, et al.
Publicado: (2025)
An Exploration of Knowledge Editing for Arabic
por: Mousi, Basel, et al.
Publicado: (2025)
por: Mousi, Basel, et al.
Publicado: (2025)
Scaling up Discovery of Latent Concepts in Deep NLP Models
por: Hawasly, Majd, et al.
Publicado: (2023)
por: Hawasly, Majd, et al.
Publicado: (2023)
Large Language Models for Propaganda Span Annotation
por: Hasanain, Maram, et al.
Publicado: (2023)
por: Hasanain, Maram, et al.
Publicado: (2023)
Multilingual and Multimodal LLMs in the Wild: Building for Low-Resource Languages
por: Alam, Firoj, et al.
Publicado: (2026)
por: Alam, Firoj, et al.
Publicado: (2026)
Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic AudioLLMs
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2026)
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2026)
NativQA: Multilingual Culturally-Aligned Natural Query for LLMs
por: Hasan, Md. Arid, et al.
Publicado: (2024)
por: Hasan, Md. Arid, et al.
Publicado: (2024)
Fanar: An Arabic-Centric Multimodal Generative AI Platform
por: Fanar Team, et al.
Publicado: (2025)
por: Fanar Team, et al.
Publicado: (2025)
There Is More to Refusal in Large Language Models than a Single Direction
por: Joad, Faaiz, et al.
Publicado: (2026)
por: Joad, Faaiz, et al.
Publicado: (2026)
WASIL: In-the-Wild Arabic Spoken Interactions with LLMs
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
ThatiAR: Subjectivity Detection in Arabic News Sentences
por: Suwaileh, Reem, et al.
Publicado: (2024)
por: Suwaileh, Reem, et al.
Publicado: (2024)
SpokenNativQA: Multilingual Everyday Spoken Queries for LLMs
por: Alam, Firoj, et al.
Publicado: (2025)
por: Alam, Firoj, et al.
Publicado: (2025)
ArAIEval Shared Task: Propagandistic Techniques Detection in Unimodal and Multimodal Arabic Content
por: Hasanain, Maram, et al.
Publicado: (2024)
por: Hasanain, Maram, et al.
Publicado: (2024)
ArMeme: Propagandistic Content in Arabic Memes
por: Alam, Firoj, et al.
Publicado: (2024)
por: Alam, Firoj, et al.
Publicado: (2024)
NativQA Framework: Enabling LLMs and VLMs with Native, Local, and Everyday Knowledge
por: Alam, Firoj, et al.
Publicado: (2025)
por: Alam, Firoj, et al.
Publicado: (2025)
Native vs Non-Native Language Prompting: A Comparative Analysis
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2024)
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2024)
MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
por: Ali, Zien Sheikh, et al.
Publicado: (2026)
LlamaLens: Specialized Multilingual LLM for Analyzing News and Social Media Content
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2024)
por: Kmainasi, Mohamed Bayan, et al.
Publicado: (2024)
Semantic Risk-Aware Heuristic Planning for Robotic Navigation in Dynamic Environments: An LLM-Inspired Approach
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
Improving Language Models Trained on Translated Data with Continual Pre-Training and Dictionary Learning Analysis
por: Boughorbel, Sabri, et al.
Publicado: (2024)
por: Boughorbel, Sabri, et al.
Publicado: (2024)
GenAI Content Detection Task 2: AI vs. Human -- Academic Essay Authenticity Challenge
por: Chowdhury, Shammur Absar, et al.
Publicado: (2024)
por: Chowdhury, Shammur Absar, et al.
Publicado: (2024)
Lifelong Learning in Vision-Language Models: Enhanced EWC with Cross-Modal Knowledge Retention
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
PropXplain: Can LLMs Enable Explainable Propaganda Detection?
por: Hasanain, Maram, et al.
Publicado: (2025)
por: Hasanain, Maram, et al.
Publicado: (2025)
Can GPT-4 Identify Propaganda? Annotation and Detection of Propaganda Spans in News Articles
por: Hasanain, Maram, et al.
Publicado: (2024)
por: Hasanain, Maram, et al.
Publicado: (2024)
Beyond Orthography: Automatic Recovery of Short Vowels and Dialectal Sounds in Arabic
por: Kheir, Yassine El, et al.
Publicado: (2024)
por: Kheir, Yassine El, et al.
Publicado: (2024)
Real-Time Whole-Body Teleoperation of a Humanoid Robot Using IMU-Based Motion Capture with Sim2Sim and Sim2Real Validation
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
por: Durrani, Hamza Ahmed, et al.
Publicado: (2026)
Discovering Salient Neurons in Deep NLP Models
por: Durrani, Nadir, et al.
Publicado: (2022)
por: Durrani, Nadir, et al.
Publicado: (2022)
CultranAI at PalmX 2025: Data Augmentation for Cultural Knowledge Representation
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2025)
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2025)
Self-Consistency from Only Two Samples: CoT-PoT Ensembling for Efficient LLM Reasoning
por: Saparkhan, Raman, et al.
Publicado: (2026)
por: Saparkhan, Raman, et al.
Publicado: (2026)
LLM-Based Multi-Task Bangla Hate Speech Detection: Type, Severity, and Target
por: Hasan, Md Arid, et al.
Publicado: (2025)
por: Hasan, Md Arid, et al.
Publicado: (2025)
Beyond MCQ: An Open-Ended Arabic Cultural QA Benchmark with Dialect Variants
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2025)
por: Bhatti, Hunzalah Hassan, et al.
Publicado: (2025)
A Novel Word Pair-based Gaussian Sentence Similarity Algorithm For Bengali Extractive Text Summarization
por: Morshed, Fahim, et al.
Publicado: (2024)
por: Morshed, Fahim, et al.
Publicado: (2024)
An efficient algorithm to compute the minimum free energy of interacting nucleic acid strands
por: Shalaby, Ahmed, et al.
Publicado: (2024)
por: Shalaby, Ahmed, et al.
Publicado: (2024)
Ejemplares similares
-
LAraBench: Benchmarking Arabic AI with Large Language Models
por: Abdelali, Ahmed, et al.
Publicado: (2023) -
AraDiCE: Benchmarks for Dialectal and Cultural Capabilities in LLMs
por: Mousi, Basel, et al.
Publicado: (2024) -
Exploring Alignment in Shared Cross-lingual Spaces
por: Mousi, Basel, et al.
Publicado: (2024) -
Beyond the Leaderboard: Understanding Performance Disparities in Large Language Models via Model Diffing
por: Boughorbel, Sabri, et al.
Publicado: (2025) -
Once Correct, Still Wrong: Counterfactual Hallucination in Multilingual Vision-Language Models
por: Mousi, Basel, et al.
Publicado: (2026)