Enregistré dans:
| Auteurs principaux: | Wicks, Rachel, Ravisankar, Kartik, Yang, Xinchen, Koehn, Philipp, Post, Matt |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.21265 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Recovering document annotations for sentence-level bitext
par: Wicks, Rachel, et autres
Publié: (2024)
par: Wicks, Rachel, et autres
Publié: (2024)
Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs
par: Ravisankar, Kartik, et autres
Publié: (2025)
par: Ravisankar, Kartik, et autres
Publié: (2025)
Escaping the sentence-level paradigm in machine translation
par: Post, Matt, et autres
Publié: (2023)
par: Post, Matt, et autres
Publié: (2023)
Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documents
par: Meng, Chutong, et autres
Publié: (2025)
par: Meng, Chutong, et autres
Publié: (2025)
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
par: Liu, Ruoxi, et autres
Publié: (2026)
par: Liu, Ruoxi, et autres
Publié: (2026)
Bridging the Gap between Different Vocabularies for LLM Ensemble
par: Xu, Yangyifan, et autres
Publié: (2024)
par: Xu, Yangyifan, et autres
Publié: (2024)
Learn and Unlearn: Addressing Misinformation in Multilingual LLMs
par: Lu, Taiming, et autres
Publié: (2024)
par: Lu, Taiming, et autres
Publié: (2024)
Pointer-Generator Networks for Low-Resource Machine Translation: Don't Copy That!
par: Bafna, Niyati, et autres
Publié: (2024)
par: Bafna, Niyati, et autres
Publié: (2024)
PEAR: Pairwise Evaluation for Automatic Relative Scoring in Machine Translation
par: Proietti, Lorenzo, et autres
Publié: (2026)
par: Proietti, Lorenzo, et autres
Publié: (2026)
SLIDE: Reference-free Evaluation for Machine Translation using a Sliding Document Window
par: Raunak, Vikas, et autres
Publié: (2023)
par: Raunak, Vikas, et autres
Publié: (2023)
Error Norm Truncation: Robust Training in the Presence of Data Noise for Text Generation Models
par: Li, Tianjian, et autres
Publié: (2023)
par: Li, Tianjian, et autres
Publié: (2023)
Steering Large Language Models with Register Analysis for Arbitrary Style Transfer
par: Yang, Xinchen, et autres
Publié: (2025)
par: Yang, Xinchen, et autres
Publié: (2025)
Navigating the Metrics Maze: Reconciling Score Magnitudes and Accuracies
par: Kocmi, Tom, et autres
Publié: (2024)
par: Kocmi, Tom, et autres
Publié: (2024)
Exploring Tokenization Strategies and Vocabulary Sizes for Enhanced Arabic Language Models
par: Alrefaie, Mohamed Taher, et autres
Publié: (2024)
par: Alrefaie, Mohamed Taher, et autres
Publié: (2024)
DiffNorm: Self-Supervised Normalization for Non-autoregressive Speech-to-speech Translation
par: Tan, Weiting, et autres
Publié: (2024)
par: Tan, Weiting, et autres
Publié: (2024)
TokAlign++: Advancing Vocabulary Adaptation via Better Token Alignment
par: Li, Chong, et autres
Publié: (2026)
par: Li, Chong, et autres
Publié: (2026)
Neuron-Level Emotion Control in Speech-Generative Large Audio-Language Models
par: Zhao, Xiutian, et autres
Publié: (2026)
par: Zhao, Xiutian, et autres
Publié: (2026)
HiMATE: A Hierarchical Multi-Agent Framework for Machine Translation Evaluation
par: Zhang, Shijie, et autres
Publié: (2025)
par: Zhang, Shijie, et autres
Publié: (2025)
Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models
par: Balde, Gunjan, et autres
Publié: (2024)
par: Balde, Gunjan, et autres
Publié: (2024)
When to Ensemble: Identifying Token-Level Points for Stable and Fast LLM Ensembling
par: Yun, Heecheol, et autres
Publié: (2025)
par: Yun, Heecheol, et autres
Publié: (2025)
TokAlign: Efficient Vocabulary Adaptation via Token Alignment
par: Li, Chong, et autres
Publié: (2025)
par: Li, Chong, et autres
Publié: (2025)
Parallel Tokenizers: Rethinking Vocabulary Design for Cross-Lingual Transfer
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2025)
par: Kautsar, Muhammad Dehan Al, et autres
Publié: (2025)
PyMarian: Fast Neural Machine Translation and Evaluation in Python
par: Gowda, Thamme, et autres
Publié: (2024)
par: Gowda, Thamme, et autres
Publié: (2024)
X-ALMA: Plug & Play Modules and Adaptive Rejection for Quality Translation at Scale
par: Xu, Haoran, et autres
Publié: (2024)
par: Xu, Haoran, et autres
Publié: (2024)
CTC-GMM: CTC guided modality matching for fast and accurate streaming speech translation
par: Zhao, Rui, et autres
Publié: (2024)
par: Zhao, Rui, et autres
Publié: (2024)
When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models
par: Liu, Xiaoze, et autres
Publié: (2025)
par: Liu, Xiaoze, et autres
Publié: (2025)
Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling
par: Huang, Hongzhi, et autres
Publié: (2025)
par: Huang, Hongzhi, et autres
Publié: (2025)
Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence
par: Işık, İlker, et autres
Publié: (2024)
par: Işık, İlker, et autres
Publié: (2024)
BPE Gets Picky: Efficient Vocabulary Refinement During Tokenizer Training
par: Chizhov, Pavel, et autres
Publié: (2024)
par: Chizhov, Pavel, et autres
Publié: (2024)
Small Vocabularies, Big Gains: Pretraining and Tokenization in Time Series Models
par: Roger, Alexis, et autres
Publié: (2025)
par: Roger, Alexis, et autres
Publié: (2025)
The First to Know: How Token Distributions Reveal Hidden Knowledge in Large Vision-Language Models?
par: Zhao, Qinyu, et autres
Publié: (2024)
par: Zhao, Qinyu, et autres
Publié: (2024)
Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation
par: Tan, Weiting, et autres
Publié: (2025)
par: Tan, Weiting, et autres
Publié: (2025)
Cut Your Losses in Large-Vocabulary Language Models
par: Wijmans, Erik, et autres
Publié: (2024)
par: Wijmans, Erik, et autres
Publié: (2024)
Exploring the Effect of Segmentation and Vocabulary Size on Speech Tokenization for Speech Language Models
par: Kando, Shunsuke, et autres
Publié: (2025)
par: Kando, Shunsuke, et autres
Publié: (2025)
Iterative Auto-Annotation for Scientific Named Entity Recognition Using BERT-Based Models
par: Gupta, Kartik
Publié: (2025)
par: Gupta, Kartik
Publié: (2025)
The Tokenization Bottleneck: How Vocabulary Extension Improves Chemistry Representation Learning in Pretrained Language Models
par: Kalamkar, Prathamesh, et autres
Publié: (2025)
par: Kalamkar, Prathamesh, et autres
Publié: (2025)
Vocabulary-level Memory Efficiency for Language Model Fine-tuning
par: Williams, Miles, et autres
Publié: (2023)
par: Williams, Miles, et autres
Publié: (2023)
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
par: Moroni, Luca, et autres
Publié: (2025)
par: Moroni, Luca, et autres
Publié: (2025)
Train It and Forget It: Merge Lists are Unnecessary for BPE Inference in Language Models
par: Sawada, Tomohiro, et autres
Publié: (2025)
par: Sawada, Tomohiro, et autres
Publié: (2025)
DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies
par: Song, Wei, et autres
Publié: (2025)
par: Song, Wei, et autres
Publié: (2025)
Documents similaires
-
Recovering document annotations for sentence-level bitext
par: Wicks, Rachel, et autres
Publié: (2024) -
Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs
par: Ravisankar, Kartik, et autres
Publié: (2025) -
Escaping the sentence-level paradigm in machine translation
par: Post, Matt, et autres
Publié: (2023) -
Speech Vecalign: an Embedding-based Method for Aligning Parallel Speech Documents
par: Meng, Chutong, et autres
Publié: (2025) -
Text Style Transfer with Parameter-efficient LLM Finetuning and Round-trip Translation
par: Liu, Ruoxi, et autres
Publié: (2026)