SeaExam and SeaBench: Benchmarking LLMs with Local Multilingual Questions in Southeast Asia
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Chaoqun, Zhang, Wenxuan, Ying, Jiahao, Aljunied, Mahani, Luu, Anh Tuan, Bing, Lidong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
par: Liu, Chaoqun, et autres
Publié: (2025)
par: Liu, Chaoqun, et autres
Publié: (2025)
SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages
par: Zhang, Wenxuan, et autres
Publié: (2024)
par: Zhang, Wenxuan, et autres
Publié: (2024)
SeaLLMs -- Large Language Models for Southeast Asia
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models
par: Liu, Chaoqun, et autres
Publié: (2024)
par: Liu, Chaoqun, et autres
Publié: (2024)
Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers
par: Zhao, Yiran, et autres
Publié: (2025)
par: Zhao, Yiran, et autres
Publié: (2025)
Democratizing LLMs for Low-Resource Languages by Leveraging their English Dominant Abilities with Linguistically-Diverse Prompts
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
par: Nguyen, Xuan-Phi, et autres
Publié: (2023)
M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
Zero-to-Strong Generalization: Eliciting Strong Capabilities of Large Language Models Iteratively without Gold Labels
par: Liu, Chaoqun, et autres
Publié: (2024)
par: Liu, Chaoqun, et autres
Publié: (2024)
BenchBench: Benchmarking Automated Benchmark Generation
par: Zheng, Yandan, et autres
Publié: (2026)
par: Zheng, Yandan, et autres
Publié: (2026)
Analyzing LLMs' Knowledge Boundary Cognition Across Languages Through the Lens of Internal Representations
par: Xiao, Chenghao, et autres
Publié: (2025)
par: Xiao, Chenghao, et autres
Publié: (2025)
Exploring the Potential of Large Language Models in Computational Argumentation
par: Chen, Guizhen, et autres
Publié: (2023)
par: Chen, Guizhen, et autres
Publié: (2023)
FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving
par: Chen, Guizhen, et autres
Publié: (2025)
par: Chen, Guizhen, et autres
Publié: (2025)
Domain-Expanded ASTE: Rethinking Generalization in Aspect Sentiment Triplet Extraction
par: Chia, Yew Ken, et autres
Publié: (2023)
par: Chia, Yew Ken, et autres
Publié: (2023)
Sufi Warriorism in Muslim Southeast Asia
par: Khairudin Aljunied
Publié: (2024)
par: Khairudin Aljunied
Publié: (2024)
Multilingual Jailbreak Challenges in Large Language Models
par: Deng, Yue, et autres
Publié: (2023)
par: Deng, Yue, et autres
Publié: (2023)
SynTQA: Synergistic Table-based Question Answering via Mixture of Text-to-SQL and E2E TQA
par: Zhang, Siyue, et autres
Publié: (2024)
par: Zhang, Siyue, et autres
Publié: (2024)
Adaptive Contrastive Learning on Multimodal Transformer for Review Helpfulness Predictions
par: Nguyen, Thong, et autres
Publié: (2022)
par: Nguyen, Thong, et autres
Publié: (2022)
How do Large Language Models Handle Multilingualism?
par: Zhao, Yiran, et autres
Publié: (2024)
par: Zhao, Yiran, et autres
Publié: (2024)
LAMPAT: Low-Rank Adaption for Multilingual Paraphrasing Using Adversarial Training
par: Le, Khoi M., et autres
Publié: (2024)
par: Le, Khoi M., et autres
Publié: (2024)
Reasoning Paths Optimization: Learning to Reason and Explore From Diverse Paths
par: Chia, Yew Ken, et autres
Publié: (2024)
par: Chia, Yew Ken, et autres
Publié: (2024)
More Bias, Less Bias: BiasPrompting for Enhanced Multiple-Choice Question Answering
par: Vu, Duc Anh, et autres
Publié: (2025)
par: Vu, Duc Anh, et autres
Publié: (2025)
Are LLMs Good Zero-Shot Fallacy Classifiers?
par: Pan, Fengjun, et autres
Publié: (2024)
par: Pan, Fengjun, et autres
Publié: (2024)
InfoCTM: A Mutual Information Maximization Perspective of Cross-Lingual Topic Modeling
par: Wu, Xiaobao, et autres
Publié: (2023)
par: Wu, Xiaobao, et autres
Publié: (2023)
Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction
par: Nguyen, Thong, et autres
Publié: (2023)
par: Nguyen, Thong, et autres
Publié: (2023)
Read as You See: Guiding Unimodal LLMs for Low-Resource Explainable Harmful Meme Detection
par: Pan, Fengjun, et autres
Publié: (2025)
par: Pan, Fengjun, et autres
Publié: (2025)
Compass-v3: Scaling Domain-Specific LLMs for Multilingual E-Commerce in Southeast Asia
par: Maria, Sophia
Publié: (2025)
par: Maria, Sophia
Publié: (2025)
Filipino Benchmarks for Measuring Sexist and Homophobic Bias in Multilingual Language Models from Southeast Asia
par: Gamboa, Lance Calvin Lim, et autres
Publié: (2024)
par: Gamboa, Lance Calvin Lim, et autres
Publié: (2024)
SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia
par: Yue, Pengfei, et autres
Publié: (2026)
par: Yue, Pengfei, et autres
Publié: (2026)
ChatGPT as a Math Questioner? Evaluating ChatGPT on Generating Pre-university Math Questions
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
par: Van Long, Phuoc Pham, et autres
Publié: (2023)
SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
par: Tasawong, Panuthep, et autres
Publié: (2026)
par: Tasawong, Panuthep, et autres
Publié: (2026)
MRAG: A Modular Retrieval Framework for Time-Sensitive Question Answering
par: Siyue, Zhang, et autres
Publié: (2024)
par: Siyue, Zhang, et autres
Publié: (2024)
The Potential of LLMs in Medical Education: Generating Questions and Answers for Qualification Exams
par: Zhu, Yunqi, et autres
Publié: (2024)
par: Zhu, Yunqi, et autres
Publié: (2024)
Mercury: A Code Efficiency Benchmark for Code Large Language Models
par: Du, Mingzhe, et autres
Publié: (2024)
par: Du, Mingzhe, et autres
Publié: (2024)
On the Affinity, Rationality, and Diversity of Hierarchical Topic Modeling
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
CricBench: A Multilingual Benchmark for Evaluating LLMs in Cricket Analytics
par: Agarwal, Parth, et autres
Publié: (2025)
par: Agarwal, Parth, et autres
Publié: (2025)
Unsupervised Hallucination Detection by Inspecting Reasoning Processes
par: Srey, Ponhvoan, et autres
Publié: (2025)
par: Srey, Ponhvoan, et autres
Publié: (2025)
Disentangling Language and Culture for Evaluating Multilingual Large Language Models
par: Ying, Jiahao, et autres
Publié: (2025)
par: Ying, Jiahao, et autres
Publié: (2025)
UniBridge: A Unified Approach to Cross-Lingual Transfer Learning for Low-Resource Languages
par: Pham, Trinh, et autres
Publié: (2024)
par: Pham, Trinh, et autres
Publié: (2024)
Scaling Language-Centric Omnimodal Representation Learning
par: Xiao, Chenghao, et autres
Publié: (2025)
par: Xiao, Chenghao, et autres
Publié: (2025)
AntiLeakBench: Preventing Data Contamination by Automatically Constructing Benchmarks with Updated Real-World Knowledge
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
Documents similaires
-
SeaLLMs-Audio: Large Audio-Language Models for Southeast Asia
par: Liu, Chaoqun, et autres
Publié: (2025) -
SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages
par: Zhang, Wenxuan, et autres
Publié: (2024) -
SeaLLMs -- Large Language Models for Southeast Asia
par: Nguyen, Xuan-Phi, et autres
Publié: (2023) -
Is Translation All You Need? A Study on Solving Multilingual Tasks with Large Language Models
par: Liu, Chaoqun, et autres
Publié: (2024) -
Babel: Open Multilingual Large Language Models Serving Over 90% of Global Speakers
par: Zhao, Yiran, et autres
Publié: (2025)