Large Vocabulary Size Improves Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Takase, Sho, Ri, Ryokan, Kiyono, Shun, Kato, Takuya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability
por: Ri, Ryokan, et al.
Publicado: (2024)
por: Ri, Ryokan, et al.
Publicado: (2024)
Natural Fingerprints of Large Language Models
por: Suzuki, Teppei, et al.
Publicado: (2025)
por: Suzuki, Teppei, et al.
Publicado: (2025)
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023)
por: Takase, Sho, et al.
Publicado: (2023)
Efficient Construction of Model Family through Progressive Training Using Model Expansion
por: Yano, Kazuki, et al.
Publicado: (2025)
por: Yano, Kazuki, et al.
Publicado: (2025)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
por: Liew, Seng Pei, et al.
Publicado: (2025)
por: Liew, Seng Pei, et al.
Publicado: (2025)
LEIA: Facilitating Cross-lingual Knowledge Transfer in Language Models with Entity-based Data Augmentation
por: Yamada, Ikuya, et al.
Publicado: (2024)
por: Yamada, Ikuya, et al.
Publicado: (2024)
Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning
por: Yano, Kazuki, et al.
Publicado: (2026)
por: Yano, Kazuki, et al.
Publicado: (2026)
Self-Preference Bias in LLM-as-a-Judge
por: Wataoka, Koki, et al.
Publicado: (2024)
por: Wataoka, Koki, et al.
Publicado: (2024)
Dynamic Injection of Entity Knowledge into Dense Retrievers
por: Yamada, Ikuya, et al.
Publicado: (2025)
por: Yamada, Ikuya, et al.
Publicado: (2025)
Toward LLMs Beyond English-Centric Development
por: Takase, Sho, et al.
Publicado: (2026)
por: Takase, Sho, et al.
Publicado: (2026)
Do Large Language Models Advocate for Inferentialism?
por: Arai, Yuzuki, et al.
Publicado: (2024)
por: Arai, Yuzuki, et al.
Publicado: (2024)
Cut Your Losses in Large-Vocabulary Language Models
por: Wijmans, Erik, et al.
Publicado: (2024)
por: Wijmans, Erik, et al.
Publicado: (2024)
The Ups and Downs of Large Language Model Inference with Vocabulary Trimming by Language Heuristics
por: Bogoychev, Nikolay, et al.
Publicado: (2023)
por: Bogoychev, Nikolay, et al.
Publicado: (2023)
Establishing Vocabulary Tests as a Benchmark for Evaluating Large Language Models
por: Martínez, Gonzalo, et al.
Publicado: (2023)
por: Martínez, Gonzalo, et al.
Publicado: (2023)
Exploring Tokenization Strategies and Vocabulary Sizes for Enhanced Arabic Language Models
por: Alrefaie, Mohamed Taher, et al.
Publicado: (2024)
por: Alrefaie, Mohamed Taher, et al.
Publicado: (2024)
Revisiting the Capacity Gap in Chain-of-Thought Distillation from a Practical Perspective
por: Kajitsuka, Tokio, et al.
Publicado: (2026)
por: Kajitsuka, Tokio, et al.
Publicado: (2026)
Reusing Overtrained Language Models Saturates Scaling
por: Liew, Seng Pei, et al.
Publicado: (2025)
por: Liew, Seng Pei, et al.
Publicado: (2025)
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
por: Kim, Seungduk, et al.
Publicado: (2024)
por: Kim, Seungduk, et al.
Publicado: (2024)
Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatch
por: Tsiapali, Stella Eva, et al.
Publicado: (2026)
por: Tsiapali, Stella Eva, et al.
Publicado: (2026)
Improved Unbiased Watermark for Large Language Models
por: Chen, Ruibo, et al.
Publicado: (2025)
por: Chen, Ruibo, et al.
Publicado: (2025)
Token Constraint Decoding Improves Robustness on Question Answering for Large Language Models
por: Yao, Jui-Ming, et al.
Publicado: (2025)
por: Yao, Jui-Ming, et al.
Publicado: (2025)
Improving Natural Language Capability of Code Large Language Model
por: Li, Wei, et al.
Publicado: (2024)
por: Li, Wei, et al.
Publicado: (2024)
Vocabulary Expansion of Large Language Models via Kullback-Leibler-Based Self-Distillation
por: Linder, Max Rehman
Publicado: (2025)
por: Linder, Max Rehman
Publicado: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
por: Liu, Dong, et al.
Publicado: (2025)
por: Liu, Dong, et al.
Publicado: (2025)
Language Model Maps for Prompt-Response Distributions via Log-Likelihood Vectors
por: Takase, Yusuke, et al.
Publicado: (2026)
por: Takase, Yusuke, et al.
Publicado: (2026)
Interpreting and Improving Large Language Models in Arithmetic Calculation
por: Zhang, Wei, et al.
Publicado: (2024)
por: Zhang, Wei, et al.
Publicado: (2024)
Re-Reading Improves Reasoning in Large Language Models
por: Xu, Xiaohan, et al.
Publicado: (2023)
por: Xu, Xiaohan, et al.
Publicado: (2023)
The Polish Vocabulary Size Test: A Novel Adaptive Test for Receptive Vocabulary Assessment
por: Fokin, Danil, et al.
Publicado: (2025)
por: Fokin, Danil, et al.
Publicado: (2025)
Measuring and Improving Persuasiveness of Large Language Models
por: Singh, Somesh, et al.
Publicado: (2024)
por: Singh, Somesh, et al.
Publicado: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
por: Kando, Shunsuke, et al.
Publicado: (2025)
por: Kando, Shunsuke, et al.
Publicado: (2025)
Improving Text Embeddings with Large Language Models
por: Wang, Liang, et al.
Publicado: (2023)
por: Wang, Liang, et al.
Publicado: (2023)
Information Re-Organization Improves Reasoning in Large Language Models
por: Cheng, Xiaoxia, et al.
Publicado: (2024)
por: Cheng, Xiaoxia, et al.
Publicado: (2024)
Refining Answer Distributions for Improved Large Language Model Reasoning
por: Pal, Soumyasundar, et al.
Publicado: (2024)
por: Pal, Soumyasundar, et al.
Publicado: (2024)
Improving the Robustness of Large Language Models via Consistency Alignment
por: Zhao, Yukun, et al.
Publicado: (2024)
por: Zhao, Yukun, et al.
Publicado: (2024)
Evaluating and Improving Graph to Text Generation with Large Language Models
por: He, Jie, et al.
Publicado: (2025)
por: He, Jie, et al.
Publicado: (2025)
Improving Fairness of Large Language Models in Multi-document Summarization
por: Li, Haoyuan, et al.
Publicado: (2025)
por: Li, Haoyuan, et al.
Publicado: (2025)
Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages
por: Puranegedara, Imalsha, et al.
Publicado: (2025)
por: Puranegedara, Imalsha, et al.
Publicado: (2025)
DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models
por: Zhang, Jinbin, et al.
Publicado: (2025)
por: Zhang, Jinbin, et al.
Publicado: (2025)
Mapping 1,000+ Language Models via the Log-Likelihood Vector
por: Oyama, Momose, et al.
Publicado: (2025)
por: Oyama, Momose, et al.
Publicado: (2025)
Revisiting In-context Learning Inference Circuit in Large Language Models
por: Cho, Hakaze, et al.
Publicado: (2024)
por: Cho, Hakaze, et al.
Publicado: (2024)
Ejemplares similares
-
Self-Translate-Train: Enhancing Cross-Lingual Transfer of Large Language Models via Inherent Capability
por: Ri, Ryokan, et al.
Publicado: (2024) -
Natural Fingerprints of Large Language Models
por: Suzuki, Teppei, et al.
Publicado: (2025) -
Spike No More: Stabilizing the Pre-training of Large Language Models
por: Takase, Sho, et al.
Publicado: (2023) -
Efficient Construction of Model Family through Progressive Training Using Model Expansion
por: Yano, Kazuki, et al.
Publicado: (2025) -
Scaling Laws for Upcycling Mixture-of-Experts Language Models
por: Liew, Seng Pei, et al.
Publicado: (2025)