Tomato, Tomahto, Tomate: Do Multilingual Language Models Understand Based on Subword-Level Semantic Concepts?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Crystina, Lu, Jing, Tran, Vinh Q., Schuster, Tal, Metzler, Donald, Lin, Jimmy |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
par: Shao, Jiandong, et autres
Publié: (2026)
par: Shao, Jiandong, et autres
Publié: (2026)
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
par: Thakur, Nandan, et autres
Publié: (2025)
par: Thakur, Nandan, et autres
Publié: (2025)
Understanding Subword Compositionality of Large Language Models
par: Peng, Qiwei, et autres
Publié: (2025)
par: Peng, Qiwei, et autres
Publié: (2025)
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
par: Sims, Anya, et autres
Publié: (2025)
par: Sims, Anya, et autres
Publié: (2025)
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
par: Meyer, Francois, et autres
Publié: (2024)
par: Meyer, Francois, et autres
Publié: (2024)
CSF: Contrastive Semantic Features for Direct Multilingual Sign Language Generation
par: Bao, Tran Sy
Publié: (2026)
par: Bao, Tran Sy
Publié: (2026)
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum
par: Xu, Zhichao, et autres
Publié: (2026)
par: Xu, Zhichao, et autres
Publié: (2026)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
par: Liu, Yihong, et autres
Publié: (2023)
par: Liu, Yihong, et autres
Publié: (2023)
Impact of Preference Noise on the Alignment Performance of Generative Language Models
par: Gao, Yang, et autres
Publié: (2024)
par: Gao, Yang, et autres
Publié: (2024)
Rankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation
par: Balog, Krisztian, et autres
Publié: (2025)
par: Balog, Krisztian, et autres
Publié: (2025)
Can Pretrained Language Models Derive Correct Semantics from Corrupt Subwords under Noise?
par: Li, Xinzhe, et autres
Publié: (2023)
par: Li, Xinzhe, et autres
Publié: (2023)
Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
par: Tang, Raphael, et autres
Publié: (2025)
par: Tang, Raphael, et autres
Publié: (2025)
SEMQA: Semi-Extractive Multi-Source Question Answering
par: Schuster, Tal, et autres
Publié: (2023)
par: Schuster, Tal, et autres
Publié: (2023)
Do Language Models' Words Refer?
par: Mandelkern, Matthew, et autres
Publié: (2023)
par: Mandelkern, Matthew, et autres
Publié: (2023)
Fractal Patterns May Illuminate the Success of Next-Token Prediction
par: Alabdulmohsin, Ibrahim, et autres
Publié: (2024)
par: Alabdulmohsin, Ibrahim, et autres
Publié: (2024)
The Learning Dynamics of Subword Segmentation for Morphologically Diverse Languages
par: Meyer, Francois, et autres
Publié: (2025)
par: Meyer, Francois, et autres
Publié: (2025)
Morphological Typology in BPE Subword Productivity and Language Modeling
par: Parra, Iñigo
Publié: (2024)
par: Parra, Iñigo
Publié: (2024)
Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge
par: Batsuren, Khuyagbaatar, et autres
Publié: (2024)
par: Batsuren, Khuyagbaatar, et autres
Publié: (2024)
Improving Multilingual Math Reasoning for African Languages
par: Ogundepo, Odunayo, et autres
Publié: (2025)
par: Ogundepo, Odunayo, et autres
Publié: (2025)
Distributional Properties of Subword Regularization
par: Cognetta, Marco, et autres
Publié: (2024)
par: Cognetta, Marco, et autres
Publié: (2024)
Lexically Grounded Subword Segmentation
par: Libovický, Jindřich, et autres
Publié: (2024)
par: Libovický, Jindřich, et autres
Publié: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
par: Chai, Yekun, et autres
Publié: (2024)
par: Chai, Yekun, et autres
Publié: (2024)
All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
par: Wang, Dan, et autres
Publié: (2026)
par: Wang, Dan, et autres
Publié: (2026)
On the Effect of (Near) Duplicate Subwords in Language Modelling
par: Schäfer, Anton, et autres
Publié: (2024)
par: Schäfer, Anton, et autres
Publié: (2024)
Entailment Semantics Can Be Extracted from an Ideal Language Model
par: Merrill, William, et autres
Publié: (2022)
par: Merrill, William, et autres
Publié: (2022)
ByteSpan: Information-Driven Subword Tokenisation
par: Goriely, Zébulon, et autres
Publié: (2025)
par: Goriely, Zébulon, et autres
Publié: (2025)
Subword Tokenization Strategies for Kurdish Word Embeddings
par: Salehi, Ali, et autres
Publié: (2025)
par: Salehi, Ali, et autres
Publié: (2025)
Transferring Extreme Subword Style Using Ngram Model-Based Logit Scaling
par: Messner, Craig, et autres
Publié: (2025)
par: Messner, Craig, et autres
Publié: (2025)
MINERS: Multilingual Language Models as Semantic Retrievers
par: Winata, Genta Indra, et autres
Publié: (2024)
par: Winata, Genta Indra, et autres
Publié: (2024)
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
par: Gigant, Théo, et autres
Publié: (2026)
par: Gigant, Théo, et autres
Publié: (2026)
How Do Multilingual Language Models Remember Facts?
par: Fierro, Constanza, et autres
Publié: (2024)
par: Fierro, Constanza, et autres
Publié: (2024)
Do Pre-Trained Language Models Detect and Understand Semantic Underspecification? Ask the DUST!
par: Wildenburg, Frank, et autres
Publié: (2024)
par: Wildenburg, Frank, et autres
Publié: (2024)
LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation
par: Teklehaymanot, Hailay, et autres
Publié: (2026)
par: Teklehaymanot, Hailay, et autres
Publié: (2026)
Subword models struggle with word learning, but surprisal hides it
par: Bunzeck, Bastian, et autres
Publié: (2025)
par: Bunzeck, Bastian, et autres
Publié: (2025)
Learning Mutually Informed Representations for Characters and Subwords
par: Wang, Yilin, et autres
Publié: (2023)
par: Wang, Yilin, et autres
Publié: (2023)
Leading Whitespaces of Language Models' Subword Vocabulary Pose a Confound for Calculating Word Probabilities
par: Oh, Byung-Doh, et autres
Publié: (2024)
par: Oh, Byung-Doh, et autres
Publié: (2024)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
par: Bansal, Hritik, et autres
Publié: (2024)
par: Bansal, Hritik, et autres
Publié: (2024)
Existential Definability over the Subword Ordering
par: Baumann, Pascal, et autres
Publié: (2022)
par: Baumann, Pascal, et autres
Publié: (2022)
INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge
par: Romanou, Angelika, et autres
Publié: (2024)
par: Romanou, Angelika, et autres
Publié: (2024)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
par: Nie, Shangrui, et autres
Publié: (2024)
par: Nie, Shangrui, et autres
Publié: (2024)
Documents similaires
-
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
par: Shao, Jiandong, et autres
Publié: (2026) -
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
par: Thakur, Nandan, et autres
Publié: (2025) -
Understanding Subword Compositionality of Large Language Models
par: Peng, Qiwei, et autres
Publié: (2025) -
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
par: Sims, Anya, et autres
Publié: (2025) -
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
par: Meyer, Francois, et autres
Publié: (2024)