I Have an Attention Bridge to Sell You: Generalization Capabilities of Modular Translation Architectures
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mickus, Timothee, Vázquez, Raúl, Attieh, Joseph |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Isotropy, Clusters, and Classifiers
par: Mickus, Timothee, et autres
Publié: (2024)
par: Mickus, Timothee, et autres
Publié: (2024)
KD4MT: A Survey of Knowledge Distillation for Machine Translation
par: de Gibert, Ona, et autres
Publié: (2026)
par: de Gibert, Ona, et autres
Publié: (2026)
Life Cycle-Aware Evaluation of Knowledge Distillation for Machine Translation: Environmental Impact and Translation Quality Trade-offs
par: Attieh, Joseph, et autres
Publié: (2026)
par: Attieh, Joseph, et autres
Publié: (2026)
MAMMOTH: Massively Multilingual Modular Open Translation @ Helsinki
par: Mickus, Timothee, et autres
Publié: (2024)
par: Mickus, Timothee, et autres
Publié: (2024)
Your Model is Overconfident, and Other Lies We Tell Ourselves
par: Mickus, Timothee, et autres
Publié: (2025)
par: Mickus, Timothee, et autres
Publié: (2025)
Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?
par: Ji, Shaoxiong, et autres
Publié: (2024)
par: Ji, Shaoxiong, et autres
Publié: (2024)
A Comparison of Language Modeling and Translation as Multilingual Pretraining Objectives
par: Li, Zihao, et autres
Publié: (2024)
par: Li, Zihao, et autres
Publié: (2024)
Adapting Definition Modeling for New Languages: A Case Study on Belarusian
par: Kazakouskaya, Daniela, et autres
Publié: (2025)
par: Kazakouskaya, Daniela, et autres
Publié: (2025)
Language Models Learn Universal Representations of Numbers and Here's Why You Should Care
par: Štefánik, Michal, et autres
Publié: (2025)
par: Štefánik, Michal, et autres
Publié: (2025)
SemEval-2024 Shared Task 6: SHROOM, a Shared-task on Hallucinations and Related Observable Overgeneration Mistakes
par: Mickus, Timothee, et autres
Publié: (2024)
par: Mickus, Timothee, et autres
Publié: (2024)
Domain-specific or Uncertainty-aware models: Does it really make a difference for biomedical text classification?
par: Sinha, Aman, et autres
Publié: (2024)
par: Sinha, Aman, et autres
Publié: (2024)
Scaling Low-Resource MT via Synthetic Data Generation with LLMs
par: de Gibert, Ona, et autres
Publié: (2025)
par: de Gibert, Ona, et autres
Publié: (2025)
Pre-trained Language Models Learn Remarkably Accurate Representations of Numbers
par: Kadlčík, Marek, et autres
Publié: (2025)
par: Kadlčík, Marek, et autres
Publié: (2025)
AXOLOTL'24 Shared Task on Multilingual Explainable Semantic Change Modeling
par: Fedorova, Mariia, et autres
Publié: (2024)
par: Fedorova, Mariia, et autres
Publié: (2024)
SemEval-2025 Task 3: Mu-SHROOM, the Multilingual Shared Task on Hallucinations and Related Observable Overgeneration Mistakes
par: Vázquez, Raúl, et autres
Publié: (2025)
par: Vázquez, Raúl, et autres
Publié: (2025)
Can Out-of-Distribution Evaluations Uncover Reliance on Shortcuts? A Case Study in Question Answering
par: Štefánik, Michal, et autres
Publié: (2025)
par: Štefánik, Michal, et autres
Publié: (2025)
Sell More, Play Less: Benchmarking LLM Realistic Selling Skill
par: Su, Xuanbo, et autres
Publié: (2026)
par: Su, Xuanbo, et autres
Publié: (2026)
Decoupling Knowledge and Reasoning in Transformers: A Modular Architecture with Generalized Cross-Attention
par: Guo, Zhenyu, et autres
Publié: (2025)
par: Guo, Zhenyu, et autres
Publié: (2025)
Improving Language Transfer Capability of Decoder-only Architecture in Multilingual Neural Machine Translation
par: Qu, Zhi, et autres
Publié: (2024)
par: Qu, Zhi, et autres
Publié: (2024)
BridG MT: Enhancing LLMs' Machine Translation Capabilities with Sentence Bridging and Gradual MT
par: Choi, Seung-Woo, et autres
Publié: (2024)
par: Choi, Seung-Woo, et autres
Publié: (2024)
What Have We Achieved on Non-autoregressive Translation?
par: Li, Yafu, et autres
Publié: (2024)
par: Li, Yafu, et autres
Publié: (2024)
Confabulations from ACL Publications (CAP): A Dataset for Scientific Hallucination Detection
par: Gamba, Federica, et autres
Publié: (2025)
par: Gamba, Federica, et autres
Publié: (2025)
Tower+: Bridging Generality and Translation Specialization in Multilingual LLMs
par: Rei, Ricardo, et autres
Publié: (2025)
par: Rei, Ricardo, et autres
Publié: (2025)
Mention Attention for Pronoun Translation
par: Tang, Gongbo, et autres
Publié: (2024)
par: Tang, Gongbo, et autres
Publié: (2024)
What is it for a Machine Learning Model to Have a Capability?
par: Harding, Jacqueline, et autres
Publié: (2024)
par: Harding, Jacqueline, et autres
Publié: (2024)
Adding Multimodal Capabilities to a Text-only Translation Model
par: Vijayan, Vipin, et autres
Publié: (2024)
par: Vijayan, Vipin, et autres
Publié: (2024)
You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases
par: Gisler, Isaia, et autres
Publié: (2026)
par: Gisler, Isaia, et autres
Publié: (2026)
A Novel Paradigm Boosting Translation Capabilities of Large Language Models
par: Guo, Jiaxin, et autres
Publié: (2024)
par: Guo, Jiaxin, et autres
Publié: (2024)
PROST-LLM: Progressively Enhancing the Speech-to-Speech Translation Capability in LLMs
par: Xu, Jing, et autres
Publié: (2026)
par: Xu, Jing, et autres
Publié: (2026)
You Need Better Attention Priors
par: Litman, Elon, et autres
Publié: (2026)
par: Litman, Elon, et autres
Publié: (2026)
Are We Paying Attention to Her? Investigating Gender Disambiguation and Attention in Machine Translation
par: Manna, Chiara, et autres
Publié: (2025)
par: Manna, Chiara, et autres
Publié: (2025)
How Does Sequence Modeling Architecture Influence Base Capabilities of Pre-trained Language Models? Exploring Key Architecture Design Principles to Avoid Base Capabilities Degradation
par: Lu, Xin, et autres
Publié: (2025)
par: Lu, Xin, et autres
Publié: (2025)
Proverbs Run in Pairs: Evaluating Proverb Translation Capability of Large Language Model
par: Wang, Minghan, et autres
Publié: (2025)
par: Wang, Minghan, et autres
Publié: (2025)
Beyond Isolated Capabilities: Bridging Long CoT Reasoning and Long-Context Understanding
par: Wang, Yifei
Publié: (2025)
par: Wang, Yifei
Publié: (2025)
Understand, Solve and Translate: Bridging the Multilingual Mathematical Reasoning Gap
par: Ko, Hyunwoo, et autres
Publié: (2025)
par: Ko, Hyunwoo, et autres
Publié: (2025)
GlotEval: A Test Suite for Massively Multilingual Evaluation of Large Language Models
par: Luo, Hengyu, et autres
Publié: (2025)
par: Luo, Hengyu, et autres
Publié: (2025)
Unlocking Reasoning Capability on Machine Translation in Large Language Models
par: Rajaee, Sara, et autres
Publié: (2026)
par: Rajaee, Sara, et autres
Publié: (2026)
You Only Cache Once: Decoder-Decoder Architectures for Language Models
par: Sun, Yutao, et autres
Publié: (2024)
par: Sun, Yutao, et autres
Publié: (2024)
Your Multimodal Speech Model Says I Have a Face for Radio
par: Nachesa, Maya K., et autres
Publié: (2026)
par: Nachesa, Maya K., et autres
Publié: (2026)
R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning
par: He, Minggui, et autres
Publié: (2025)
par: He, Minggui, et autres
Publié: (2025)
Documents similaires
-
Isotropy, Clusters, and Classifiers
par: Mickus, Timothee, et autres
Publié: (2024) -
KD4MT: A Survey of Knowledge Distillation for Machine Translation
par: de Gibert, Ona, et autres
Publié: (2026) -
Life Cycle-Aware Evaluation of Knowledge Distillation for Machine Translation: Environmental Impact and Translation Quality Trade-offs
par: Attieh, Joseph, et autres
Publié: (2026) -
MAMMOTH: Massively Multilingual Modular Open Translation @ Helsinki
par: Mickus, Timothee, et autres
Publié: (2024) -
Your Model is Overconfident, and Other Lies We Tell Ourselves
par: Mickus, Timothee, et autres
Publié: (2025)