Kalahi: A handcrafted, grassroots cultural LLM evaluation suite for Filipino
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Montalan, Jann Railey, Ngui, Jian Gang, Leong, Wei Qi, Susanto, Yosephine, Rengarajan, Hamsawardhini, Aji, Alham Fikri, Tjhi, William Chandra |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
par: Susanto, Yosephine, et autres
Publié: (2025)
par: Susanto, Yosephine, et autres
Publié: (2025)
BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models
par: Aung, Thura, et autres
Publié: (2026)
par: Aung, Thura, et autres
Publié: (2026)
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
par: Ponwitayarat, Wuttikorn, et autres
Publié: (2025)
par: Ponwitayarat, Wuttikorn, et autres
Publié: (2025)
Batayan: A Filipino NLP benchmark for evaluating Large Language Models
par: Montalan, Jann Railey, et autres
Publié: (2025)
par: Montalan, Jann Railey, et autres
Publié: (2025)
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
par: Tasawong, Panuthep, et autres
Publié: (2025)
par: Tasawong, Panuthep, et autres
Publié: (2025)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
par: Tasawong, Panuthep, et autres
Publié: (2026)
par: Tasawong, Panuthep, et autres
Publié: (2026)
LoraxBench: A Multitask, Multilingual Benchmark Suite for 20 Indonesian Languages
par: Aji, Alham Fikri, et autres
Publié: (2025)
par: Aji, Alham Fikri, et autres
Publié: (2025)
Improving Low-Resource Machine Translation via Round-Trip Reinforcement Learning
par: Attia, Ahmed, et autres
Publié: (2026)
par: Attia, Ahmed, et autres
Publié: (2026)
Daisy-TTS: Simulating Wider Spectrum of Emotions via Prosody Embedding Decomposition
par: Chevi, Rendi, et autres
Publié: (2024)
par: Chevi, Rendi, et autres
Publié: (2024)
LLM Olympiad: Why Model Evaluation Needs a Sealed Exam
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
SEA-LION: Southeast Asian Languages in One Network
par: Ng, Raymond, et autres
Publié: (2025)
par: Ng, Raymond, et autres
Publié: (2025)
Data Laundering: Artificially Boosting Benchmark Results through Knowledge Distillation
par: Mansurov, Jonibek, et autres
Publié: (2024)
par: Mansurov, Jonibek, et autres
Publié: (2024)
Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models
par: Kaneko, Masahiro, et autres
Publié: (2025)
par: Kaneko, Masahiro, et autres
Publié: (2025)
Sense Representations Are Inducible Interfaces
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
Extracting General-use Transformers for Low-resource Languages via Knowledge Distillation
par: Cruz, Jan Christian Blaise, et autres
Publié: (2025)
par: Cruz, Jan Christian Blaise, et autres
Publié: (2025)
Beyond Probabilities: Unveiling the Misalignment in Evaluating Large Language Models
par: Lyu, Chenyang, et autres
Publié: (2024)
par: Lyu, Chenyang, et autres
Publié: (2024)
How Individual Traits and Language Styles Shape Preferences In Open-ended User-LLM Interaction: A Preliminary Study
par: Chevi, Rendi, et autres
Publié: (2025)
par: Chevi, Rendi, et autres
Publié: (2025)
Language-Specific Latent Process Hinders Cross-Lingual Performance
par: Lim, Zheng Wei, et autres
Publié: (2025)
par: Lim, Zheng Wei, et autres
Publié: (2025)
The Privileged Students: On the Value of Initialization in Multilingual Knowledge Distillation
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2024)
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2024)
Can Multimodal LLMs do Visual Temporal Understanding and Reasoning? The answer is No!
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
par: Imam, Mohamed Fazli, et autres
Publié: (2025)
Efficient and Interpretable Grammatical Error Correction with Mixture of Experts
par: Qorib, Muhammad Reza, et autres
Publié: (2024)
par: Qorib, Muhammad Reza, et autres
Publié: (2024)
Enabling Natural Zero-Shot Prompting on Encoder Models via Statement-Tuning
par: Elshabrawy, Ahmed, et autres
Publié: (2024)
par: Elshabrawy, Ahmed, et autres
Publié: (2024)
Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models
par: Susanto, Lucky, et autres
Publié: (2026)
par: Susanto, Lucky, et autres
Publié: (2026)
NusaAksara: A Multimodal and Multilingual Benchmark for Preserving Indonesian Indigenous Scripts
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
Multilinguality as Sense Adaptation
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
par: Cruz, Jan Christian Blaise, et autres
Publié: (2026)
TextGames: Learning to Self-Play Text-Based Puzzle Games via Language Model Reasoning
par: Hudi, Frederikus, et autres
Publié: (2025)
par: Hudi, Frederikus, et autres
Publié: (2025)
Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation
par: Nur'aini, Khumaisa, et autres
Publié: (2026)
par: Nur'aini, Khumaisa, et autres
Publié: (2026)
Predicting the Order of Upcoming Tokens Improves Language Modeling
par: Zuhri, Zayd M. K., et autres
Publié: (2025)
par: Zuhri, Zayd M. K., et autres
Publié: (2025)
Multicultural Spyfall: Assessing LLMs through Dynamic Multilingual Social Deduction Game
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2026)
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2026)
Softpick: No Attention Sink, No Massive Activations with Rectified Softmax
par: Zuhri, Zayd M. K., et autres
Publié: (2025)
par: Zuhri, Zayd M. K., et autres
Publié: (2025)
IndoToxic2024: A Demographically-Enriched Dataset of Hate Speech and Toxicity Types for Indonesian Language
par: Susanto, Lucky, et autres
Publié: (2024)
par: Susanto, Lucky, et autres
Publié: (2024)
From Surveys to Narratives: Rethinking Cultural Value Adaptation in LLMs
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2025)
LaMini-LM: A Diverse Herd of Distilled Models from Large-Scale Instructions
par: Wu, Minghao, et autres
Publié: (2023)
par: Wu, Minghao, et autres
Publié: (2023)
MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding
par: Zuhri, Zayd Muhammad Kawakibi, et autres
Publié: (2024)
par: Zuhri, Zayd Muhammad Kawakibi, et autres
Publié: (2024)
LinguAlchemy: Fusing Typological and Geographical Elements for Unseen Language Generalization
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2024)
par: Adilazuarda, Muhammad Farid, et autres
Publié: (2024)
LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
par: Irawan, Patrick Amadeus, et autres
Publié: (2026)
QLESS: A Quantized Approach for Data Valuation and Selection in Large Language Model Fine-Tuning
par: Ananta, Moses, et autres
Publié: (2025)
par: Ananta, Moses, et autres
Publié: (2025)
Cultural Conditioning or Placebo? On the Effectiveness of Socio-Demographic Prompting
par: Mukherjee, Sagnik, et autres
Publié: (2024)
par: Mukherjee, Sagnik, et autres
Publié: (2024)
IteRABRe: Iterative Recovery-Aided Block Reduction
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2025)
par: Wibowo, Haryo Akbarianto, et autres
Publié: (2025)
ThaiCoref: Thai Coreference Resolution Dataset
par: Trakuekul, Pontakorn, et autres
Publié: (2024)
par: Trakuekul, Pontakorn, et autres
Publié: (2024)
Documents similaires
-
SEA-HELM: Southeast Asian Holistic Evaluation of Language Models
par: Susanto, Yosephine, et autres
Publié: (2025) -
BURMESE-SAN: Burmese NLP Benchmark for Evaluating Large Language Models
par: Aung, Thura, et autres
Publié: (2026) -
SEA-BED: How Do Embedding Models Represent Southeast Asian Languages?
par: Ponwitayarat, Wuttikorn, et autres
Publié: (2025) -
Batayan: A Filipino NLP benchmark for evaluating Large Language Models
par: Montalan, Jann Railey, et autres
Publié: (2025) -
SEA-SafeguardBench: Evaluating AI Safety in SEA Languages and Cultures
par: Tasawong, Panuthep, et autres
Publié: (2025)