Taxi1500: A Multilingual Dataset for Text Classification in 1500 Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Chunlan, ImaniGooghari, Ayyoob, Ye, Haotian, Pei, Renhao, Asgari, Ehsaneddin, Schütze, Hinrich |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
por: Liu, Yihong, et al.
Publicado: (2024)
por: Liu, Yihong, et al.
Publicado: (2024)
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
por: Liu, Yihong, et al.
Publicado: (2024)
por: Liu, Yihong, et al.
Publicado: (2024)
LangSAMP: Language-Script Aware Multilingual Pretraining
por: Liu, Yihong, et al.
Publicado: (2024)
por: Liu, Yihong, et al.
Publicado: (2024)
RET-LLM: Towards a General Read-Write Memory for Large Language Models
por: Modarressi, Ali, et al.
Publicado: (2023)
por: Modarressi, Ali, et al.
Publicado: (2023)
GlotLID: Language Identification for Low-Resource Languages
por: Kargaran, Amir Hossein, et al.
Publicado: (2023)
por: Kargaran, Amir Hossein, et al.
Publicado: (2023)
Exploring the Role of Transliteration in In-Context Learning for Low-resource Languages Written in Non-Latin Scripts
por: Ma, Chunlan, et al.
Publicado: (2024)
por: Ma, Chunlan, et al.
Publicado: (2024)
How Transliterations Improve Crosslingual Alignment
por: Liu, Yihong, et al.
Publicado: (2024)
por: Liu, Yihong, et al.
Publicado: (2024)
MoSECroT: Model Stitching with Static Word Embeddings for Crosslingual Zero-shot Transfer
por: Ye, Haotian, et al.
Publicado: (2024)
por: Ye, Haotian, et al.
Publicado: (2024)
Through the LLM Looking Glass: A Socratic Probing of Donkeys, Elephants, and Markets
por: Kennedy, Molly, et al.
Publicado: (2025)
por: Kennedy, Molly, et al.
Publicado: (2025)
MURI: High-Quality Instruction Tuning Datasets for Low-Resource Languages via Reverse Instructions
por: Köksal, Abdullatif, et al.
Publicado: (2024)
por: Köksal, Abdullatif, et al.
Publicado: (2024)
MemLLM: Finetuning LLMs to Use An Explicit Read-Write Memory
por: Modarressi, Ali, et al.
Publicado: (2024)
por: Modarressi, Ali, et al.
Publicado: (2024)
CLASP: Contrastive Language-Speech Pretraining for Multilingual Multimodal Information Retrieval
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2024)
por: Abootorabi, Mohammad Mahdi, et al.
Publicado: (2024)
I Am Aligned, But With Whom? MENA Values Benchmark for Evaluating Cultural Alignment and Multilingual Bias in LLMs
por: Zahraei, Pardis Sadat, et al.
Publicado: (2025)
por: Zahraei, Pardis Sadat, et al.
Publicado: (2025)
Understanding In-Context Machine Translation for Low-Resource Languages: A Case Study on Manchu
por: Pei, Renhao, et al.
Publicado: (2025)
por: Pei, Renhao, et al.
Publicado: (2025)
EICAP: Deep Dive in Assessment and Enhancement of Large Language Models in Emotional Intelligence through Multi-Turn Conversations
por: Nazar, Nizi, et al.
Publicado: (2025)
por: Nazar, Nizi, et al.
Publicado: (2025)
Evaluating Contextually Mediated Factual Recall in Multilingual Large Language Models
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
A Recipe of Parallel Corpora Exploitation for Multilingual Large Language Models
por: Lin, Peiqin, et al.
Publicado: (2024)
por: Lin, Peiqin, et al.
Publicado: (2024)
TuringQ: Benchmarking AI Comprehension in Theory of Computation
por: Zahraei, Pardis Sadat, et al.
Publicado: (2024)
por: Zahraei, Pardis Sadat, et al.
Publicado: (2024)
Breaking the Script Barrier in Multilingual Pre-Trained Language Models with Transliteration-Based Post-Training Alignment
por: Xhelili, Orgest, et al.
Publicado: (2024)
por: Xhelili, Orgest, et al.
Publicado: (2024)
M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing
por: Mofayezi, Mohammadreza, et al.
Publicado: (2024)
por: Mofayezi, Mohammadreza, et al.
Publicado: (2024)
A Comprehensive Evaluation of Multilingual Chain-of-Thought Reasoning: Performance, Consistency, and Faithfulness Across Languages
por: Zhao, Raoyuan, et al.
Publicado: (2025)
por: Zhao, Raoyuan, et al.
Publicado: (2025)
GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models
por: Gerstner, Sebastian, et al.
Publicado: (2026)
por: Gerstner, Sebastian, et al.
Publicado: (2026)
Evaluating Robustness of Large Language Models Against Multilingual Typographical Errors
por: Zhao, Raoyuan, et al.
Publicado: (2025)
por: Zhao, Raoyuan, et al.
Publicado: (2025)
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
A Federated Approach to Few-Shot Hate Speech Detection for Marginalized Communities
por: Ye, Haotian, et al.
Publicado: (2024)
por: Ye, Haotian, et al.
Publicado: (2024)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
por: Liu, Yihong, et al.
Publicado: (2023)
por: Liu, Yihong, et al.
Publicado: (2023)
Decomposed Prompting: Probing Multilingual Linguistic Structure Knowledge in Large Language Models
por: Nie, Ercong, et al.
Publicado: (2024)
por: Nie, Ercong, et al.
Publicado: (2024)
Large Reasoning Models Are (Not Yet) Multilingual Latent Reasoners
por: Liu, Yihong, et al.
Publicado: (2026)
por: Liu, Yihong, et al.
Publicado: (2026)
SpeechTaxi: On Multilingual Semantic Speech Classification
por: Keller, Lennart, et al.
Publicado: (2024)
por: Keller, Lennart, et al.
Publicado: (2024)
mPLM-Sim: Better Cross-Lingual Similarity and Transfer in Multilingual Pretrained Language Models
por: Lin, Peiqin, et al.
Publicado: (2023)
por: Lin, Peiqin, et al.
Publicado: (2023)
Mechanistic Understanding and Mitigation of Language Confusion in English-Centric Large Language Models
por: Nie, Ercong, et al.
Publicado: (2025)
por: Nie, Ercong, et al.
Publicado: (2025)
NLNDE at SemEval-2023 Task 12: Adaptive Pretraining and Source Language Selection for Low-Resource Multilingual Sentiment Analysis
por: Wang, Mingyang, et al.
Publicado: (2023)
por: Wang, Mingyang, et al.
Publicado: (2023)
GKnow: Measuring the Entanglement of Gender Bias and Factual Gender
por: Veloso, Leonor, et al.
Publicado: (2026)
por: Veloso, Leonor, et al.
Publicado: (2026)
Lost in Multilinguality: Dissecting Cross-lingual Factual Inconsistency in Transformer Language Models
por: Wang, Mingyang, et al.
Publicado: (2025)
por: Wang, Mingyang, et al.
Publicado: (2025)
Left, Right, or Center? Evaluating LLM Framing in News Classification and Generation
por: Kennedy, Molly, et al.
Publicado: (2026)
por: Kennedy, Molly, et al.
Publicado: (2026)
MorphBPE: A Morpho-Aware Tokenizer Bridging Linguistic Complexity for Efficient LLM Training Across Morphologies
por: Asgari, Ehsaneddin, et al.
Publicado: (2025)
por: Asgari, Ehsaneddin, et al.
Publicado: (2025)
Understanding Gated Neurons in Transformers from Their Input-Output Functionality
por: Gerstner, Sebastian, et al.
Publicado: (2025)
por: Gerstner, Sebastian, et al.
Publicado: (2025)
MaskLID: Code-Switching Language Identification through Iterative Masking
por: Kargaran, Amir Hossein, et al.
Publicado: (2024)
por: Kargaran, Amir Hossein, et al.
Publicado: (2024)
XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs
por: He, Linyang, et al.
Publicado: (2025)
por: He, Linyang, et al.
Publicado: (2025)
CRAFT Your Dataset: Task-Specific Synthetic Dataset Generation Through Corpus Retrieval and Augmentation
por: Ziegler, Ingo, et al.
Publicado: (2024)
por: Ziegler, Ingo, et al.
Publicado: (2024)
Ejemplares similares
-
TransliCo: A Contrastive Learning Framework to Address the Script Barrier in Multilingual Pretrained Language Models
por: Liu, Yihong, et al.
Publicado: (2024) -
TransMI: A Framework to Create Strong Baselines from Multilingual Pretrained Language Models for Transliterated Data
por: Liu, Yihong, et al.
Publicado: (2024) -
LangSAMP: Language-Script Aware Multilingual Pretraining
por: Liu, Yihong, et al.
Publicado: (2024) -
RET-LLM: Towards a General Read-Write Memory for Large Language Models
por: Modarressi, Ali, et al.
Publicado: (2023) -
GlotLID: Language Identification for Low-Resource Languages
por: Kargaran, Amir Hossein, et al.
Publicado: (2023)