Guardado en:
| Autores principales: | Rom, Aviad, Bar, Kfir |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.16065 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Silent Tokens, Loud Effects: Padding in LLMs
por: Himelstein, Rom, et al.
Publicado: (2025)
por: Himelstein, Rom, et al.
Publicado: (2025)
Training Bilingual LMs with Data Constraints in the Targeted Language
por: Seto, Skyler, et al.
Publicado: (2024)
por: Seto, Skyler, et al.
Publicado: (2024)
Leveraging NTPs for Efficient Hallucination Detection in VLMs
por: Azachi, Ofir, et al.
Publicado: (2025)
por: Azachi, Ofir, et al.
Publicado: (2025)
Kanana: Compute-efficient Bilingual Language Models
por: Kanana LLM Team, et al.
Publicado: (2025)
por: Kanana LLM Team, et al.
Publicado: (2025)
Efficient Training of Language Models with Compact and Consistent Next Token Distributions
por: Sathe, Ashutosh, et al.
Publicado: (2024)
por: Sathe, Ashutosh, et al.
Publicado: (2024)
How a Bilingual LM Becomes Bilingual: Tracing Internal Representations with Sparse Autoencoders
por: Inaba, Tatsuro, et al.
Publicado: (2025)
por: Inaba, Tatsuro, et al.
Publicado: (2025)
CroissantLLM: A Truly Bilingual French-English Language Model
por: Faysse, Manuel, et al.
Publicado: (2024)
por: Faysse, Manuel, et al.
Publicado: (2024)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
por: Tran, Toan, et al.
Publicado: (2025)
por: Tran, Toan, et al.
Publicado: (2025)
Rethinking Token Reduction for State Space Models
por: Zhan, Zheng, et al.
Publicado: (2024)
por: Zhan, Zheng, et al.
Publicado: (2024)
Persona Vectors: Monitoring and Controlling Character Traits in Language Models
por: Chen, Runjin, et al.
Publicado: (2025)
por: Chen, Runjin, et al.
Publicado: (2025)
Improving Diffusion Language Model Decoding through Joint Search in Generation Order and Token Space
por: Shen, Yangyi, et al.
Publicado: (2026)
por: Shen, Yangyi, et al.
Publicado: (2026)
SpaceByte: Towards Deleting Tokenization from Large Language Modeling
por: Slagle, Kevin
Publicado: (2024)
por: Slagle, Kevin
Publicado: (2024)
Training Large Language Models To Reason In Parallel With Global Forking Tokens
por: Jia, Sheng, et al.
Publicado: (2025)
por: Jia, Sheng, et al.
Publicado: (2025)
Think before you speak: Training Language Models With Pause Tokens
por: Goyal, Sachin, et al.
Publicado: (2023)
por: Goyal, Sachin, et al.
Publicado: (2023)
CharED: Character-wise Ensemble Decoding for Large Language Models
por: Gu, Kevin, et al.
Publicado: (2024)
por: Gu, Kevin, et al.
Publicado: (2024)
On Bilingual Lexicon Induction with Large Language Models
por: Li, Yaoyiran, et al.
Publicado: (2023)
por: Li, Yaoyiran, et al.
Publicado: (2023)
Modeling Bilingual Sentence Processing: Evaluating RNN and Transformer Architectures for Cross-Language Structural Priming
por: Zhang, Demi, et al.
Publicado: (2024)
por: Zhang, Demi, et al.
Publicado: (2024)
Mapping Post-Training Forgetting in Language Models at Scale
por: Harmon, Jackson, et al.
Publicado: (2025)
por: Harmon, Jackson, et al.
Publicado: (2025)
MambaByte: Token-free Selective State Space Model
por: Wang, Junxiong, et al.
Publicado: (2024)
por: Wang, Junxiong, et al.
Publicado: (2024)
Unlocking Full Efficiency of Token Filtering in Large Language Model Training
por: Chai, Di, et al.
Publicado: (2025)
por: Chai, Di, et al.
Publicado: (2025)
Language Modeling with Learned Meta-Tokens
por: Shah, Alok N., et al.
Publicado: (2025)
por: Shah, Alok N., et al.
Publicado: (2025)
Parallel Token Prediction for Language Models
por: Draxler, Felix, et al.
Publicado: (2025)
por: Draxler, Felix, et al.
Publicado: (2025)
Shared Latent Space by Both Languages in Non-Autoregressive Neural Machine Translation
por: Heo, DongNyeong, et al.
Publicado: (2023)
por: Heo, DongNyeong, et al.
Publicado: (2023)
The Impact of Language Mixing on Bilingual LLM Reasoning
por: Li, Yihao, et al.
Publicado: (2025)
por: Li, Yihao, et al.
Publicado: (2025)
Beyond Next Token Prediction: Patch-Level Training for Large Language Models
por: Shao, Chenze, et al.
Publicado: (2024)
por: Shao, Chenze, et al.
Publicado: (2024)
Basis Sharing: Cross-Layer Parameter Sharing for Large Language Model Compression
por: Wang, Jingcun, et al.
Publicado: (2024)
por: Wang, Jingcun, et al.
Publicado: (2024)
Revisiting Character-level Adversarial Attacks for Language Models
por: Rocamora, Elias Abad, et al.
Publicado: (2024)
por: Rocamora, Elias Abad, et al.
Publicado: (2024)
A Discriminative Latent-Variable Model for Bilingual Lexicon Induction
por: Ruder, Sebastian, et al.
Publicado: (2018)
por: Ruder, Sebastian, et al.
Publicado: (2018)
Vision-Language Models Create Cross-Modal Task Representations
por: Luo, Grace, et al.
Publicado: (2024)
por: Luo, Grace, et al.
Publicado: (2024)
MAP-Neo: Highly Capable and Transparent Bilingual Large Language Model Series
por: Zhang, Ge, et al.
Publicado: (2024)
por: Zhang, Ge, et al.
Publicado: (2024)
Special Characters Attack: Toward Scalable Training Data Extraction From Large Language Models
por: Bai, Yang, et al.
Publicado: (2024)
por: Bai, Yang, et al.
Publicado: (2024)
Bringing Up a Bilingual BabyLM: Investigating Multilingual Language Acquisition Using Small-Scale Models
por: Zeng, Linda, et al.
Publicado: (2026)
por: Zeng, Linda, et al.
Publicado: (2026)
Can Character-based Language Models Improve Downstream Task Performance in Low-Resource and Noisy Language Scenarios?
por: Riabi, Arij, et al.
Publicado: (2021)
por: Riabi, Arij, et al.
Publicado: (2021)
Reasoning Bias of Next Token Prediction Training
por: Lin, Pengxiao, et al.
Publicado: (2025)
por: Lin, Pengxiao, et al.
Publicado: (2025)
ByteFlow: Language Modeling through Adaptive Byte Compression without a Tokenizer
por: Deng, Chunyuan, et al.
Publicado: (2026)
por: Deng, Chunyuan, et al.
Publicado: (2026)
From Token to Token Pair: Efficient Prompt Compression for Large Language Models in Clinical Prediction
por: Zhu, Mingcheng, et al.
Publicado: (2026)
por: Zhu, Mingcheng, et al.
Publicado: (2026)
Shared Global and Local Geometry of Language Model Embeddings
por: Lee, Andrew, et al.
Publicado: (2025)
por: Lee, Andrew, et al.
Publicado: (2025)
The Geometry of Tokens in Internal Representations of Large Language Models
por: Viswanathan, Karthik, et al.
Publicado: (2025)
por: Viswanathan, Karthik, et al.
Publicado: (2025)
Silenced Biases: The Dark Side LLMs Learned to Refuse
por: Himelstein, Rom, et al.
Publicado: (2025)
por: Himelstein, Rom, et al.
Publicado: (2025)
Smart Bilingual Focused Crawling of Parallel Documents
por: García-Romero, Cristian, et al.
Publicado: (2024)
por: García-Romero, Cristian, et al.
Publicado: (2024)
Ejemplares similares
-
Silent Tokens, Loud Effects: Padding in LLMs
por: Himelstein, Rom, et al.
Publicado: (2025) -
Training Bilingual LMs with Data Constraints in the Targeted Language
por: Seto, Skyler, et al.
Publicado: (2024) -
Leveraging NTPs for Efficient Hallucination Detection in VLMs
por: Azachi, Ofir, et al.
Publicado: (2025) -
Kanana: Compute-efficient Bilingual Language Models
por: Kanana LLM Team, et al.
Publicado: (2025) -
Efficient Training of Language Models with Compact and Consistent Next Token Distributions
por: Sathe, Ashutosh, et al.
Publicado: (2024)