Tomato, Tomahto, Tomate: Do Multilingual Language Models Understand Based on Subword-Level Semantic Concepts?
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Crystina, Lu, Jing, Tran, Vinh Q., Schuster, Tal, Metzler, Donald, Lin, Jimmy |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
por: Shao, Jiandong, et al.
Publicado: (2026)
por: Shao, Jiandong, et al.
Publicado: (2026)
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
por: Thakur, Nandan, et al.
Publicado: (2025)
por: Thakur, Nandan, et al.
Publicado: (2025)
Understanding Subword Compositionality of Large Language Models
por: Peng, Qiwei, et al.
Publicado: (2025)
por: Peng, Qiwei, et al.
Publicado: (2025)
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
por: Sims, Anya, et al.
Publicado: (2025)
por: Sims, Anya, et al.
Publicado: (2025)
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
por: Meyer, Francois, et al.
Publicado: (2024)
por: Meyer, Francois, et al.
Publicado: (2024)
CSF: Contrastive Semantic Features for Direct Multilingual Sign Language Generation
por: Bao, Tran Sy
Publicado: (2026)
por: Bao, Tran Sy
Publicado: (2026)
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum
por: Xu, Zhichao, et al.
Publicado: (2026)
por: Xu, Zhichao, et al.
Publicado: (2026)
OFA: A Framework of Initializing Unseen Subword Embeddings for Efficient Large-scale Multilingual Continued Pretraining
por: Liu, Yihong, et al.
Publicado: (2023)
por: Liu, Yihong, et al.
Publicado: (2023)
Impact of Preference Noise on the Alignment Performance of Generative Language Models
por: Gao, Yang, et al.
Publicado: (2024)
por: Gao, Yang, et al.
Publicado: (2024)
Rankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation
por: Balog, Krisztian, et al.
Publicado: (2025)
por: Balog, Krisztian, et al.
Publicado: (2025)
Can Pretrained Language Models Derive Correct Semantics from Corrupt Subwords under Noise?
por: Li, Xinzhe, et al.
Publicado: (2023)
por: Li, Xinzhe, et al.
Publicado: (2023)
Drawing Conclusions from Draws: Rethinking Preference Semantics in Arena-Style LLM Evaluation
por: Tang, Raphael, et al.
Publicado: (2025)
por: Tang, Raphael, et al.
Publicado: (2025)
SEMQA: Semi-Extractive Multi-Source Question Answering
por: Schuster, Tal, et al.
Publicado: (2023)
por: Schuster, Tal, et al.
Publicado: (2023)
Do Language Models' Words Refer?
por: Mandelkern, Matthew, et al.
Publicado: (2023)
por: Mandelkern, Matthew, et al.
Publicado: (2023)
Fractal Patterns May Illuminate the Success of Next-Token Prediction
por: Alabdulmohsin, Ibrahim, et al.
Publicado: (2024)
por: Alabdulmohsin, Ibrahim, et al.
Publicado: (2024)
The Learning Dynamics of Subword Segmentation for Morphologically Diverse Languages
por: Meyer, Francois, et al.
Publicado: (2025)
por: Meyer, Francois, et al.
Publicado: (2025)
Morphological Typology in BPE Subword Productivity and Language Modeling
por: Parra, Iñigo
Publicado: (2024)
por: Parra, Iñigo
Publicado: (2024)
Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge
por: Batsuren, Khuyagbaatar, et al.
Publicado: (2024)
por: Batsuren, Khuyagbaatar, et al.
Publicado: (2024)
Improving Multilingual Math Reasoning for African Languages
por: Ogundepo, Odunayo, et al.
Publicado: (2025)
por: Ogundepo, Odunayo, et al.
Publicado: (2025)
Distributional Properties of Subword Regularization
por: Cognetta, Marco, et al.
Publicado: (2024)
por: Cognetta, Marco, et al.
Publicado: (2024)
Lexically Grounded Subword Segmentation
por: Libovický, Jindřich, et al.
Publicado: (2024)
por: Libovický, Jindřich, et al.
Publicado: (2024)
Tokenization Falling Short: On Subword Robustness in Large Language Models
por: Chai, Yekun, et al.
Publicado: (2024)
por: Chai, Yekun, et al.
Publicado: (2024)
All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
por: Wang, Dan, et al.
Publicado: (2026)
por: Wang, Dan, et al.
Publicado: (2026)
On the Effect of (Near) Duplicate Subwords in Language Modelling
por: Schäfer, Anton, et al.
Publicado: (2024)
por: Schäfer, Anton, et al.
Publicado: (2024)
Entailment Semantics Can Be Extracted from an Ideal Language Model
por: Merrill, William, et al.
Publicado: (2022)
por: Merrill, William, et al.
Publicado: (2022)
ByteSpan: Information-Driven Subword Tokenisation
por: Goriely, Zébulon, et al.
Publicado: (2025)
por: Goriely, Zébulon, et al.
Publicado: (2025)
Subword Tokenization Strategies for Kurdish Word Embeddings
por: Salehi, Ali, et al.
Publicado: (2025)
por: Salehi, Ali, et al.
Publicado: (2025)
Transferring Extreme Subword Style Using Ngram Model-Based Logit Scaling
por: Messner, Craig, et al.
Publicado: (2025)
por: Messner, Craig, et al.
Publicado: (2025)
MINERS: Multilingual Language Models as Semantic Retrievers
por: Winata, Genta Indra, et al.
Publicado: (2024)
por: Winata, Genta Indra, et al.
Publicado: (2024)
Decoupling the Benefits of Subword Tokenization for Language Model Training via Byte-level Simulation
por: Gigant, Théo, et al.
Publicado: (2026)
por: Gigant, Théo, et al.
Publicado: (2026)
How Do Multilingual Language Models Remember Facts?
por: Fierro, Constanza, et al.
Publicado: (2024)
por: Fierro, Constanza, et al.
Publicado: (2024)
Do Pre-Trained Language Models Detect and Understand Semantic Underspecification? Ask the DUST!
por: Wildenburg, Frank, et al.
Publicado: (2024)
por: Wildenburg, Frank, et al.
Publicado: (2024)
LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation
por: Teklehaymanot, Hailay, et al.
Publicado: (2026)
por: Teklehaymanot, Hailay, et al.
Publicado: (2026)
Subword models struggle with word learning, but surprisal hides it
por: Bunzeck, Bastian, et al.
Publicado: (2025)
por: Bunzeck, Bastian, et al.
Publicado: (2025)
Learning Mutually Informed Representations for Characters and Subwords
por: Wang, Yilin, et al.
Publicado: (2023)
por: Wang, Yilin, et al.
Publicado: (2023)
Leading Whitespaces of Language Models' Subword Vocabulary Pose a Confound for Calculating Word Probabilities
por: Oh, Byung-Doh, et al.
Publicado: (2024)
por: Oh, Byung-Doh, et al.
Publicado: (2024)
Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling
por: Bansal, Hritik, et al.
Publicado: (2024)
por: Bansal, Hritik, et al.
Publicado: (2024)
Existential Definability over the Subword Ordering
por: Baumann, Pascal, et al.
Publicado: (2022)
por: Baumann, Pascal, et al.
Publicado: (2022)
INCLUDE: Evaluating Multilingual Language Understanding with Regional Knowledge
por: Romanou, Angelika, et al.
Publicado: (2024)
por: Romanou, Angelika, et al.
Publicado: (2024)
Do Multilingual Large Language Models Mitigate Stereotype Bias?
por: Nie, Shangrui, et al.
Publicado: (2024)
por: Nie, Shangrui, et al.
Publicado: (2024)
Ejemplares similares
-
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
por: Shao, Jiandong, et al.
Publicado: (2026) -
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
por: Thakur, Nandan, et al.
Publicado: (2025) -
Understanding Subword Compositionality of Large Language Models
por: Peng, Qiwei, et al.
Publicado: (2025) -
StochasTok: Improving Fine-Grained Subword Understanding in LLMs
por: Sims, Anya, et al.
Publicado: (2025) -
A Systematic Analysis of Subwords and Cross-Lingual Transfer in Multilingual Translation
por: Meyer, Francois, et al.
Publicado: (2024)