G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation
Fuente:
arXiv
Salvato in:
| Autori principali: | Pan, Xingyuan, Huang, Luyang, Kang, Liyan, Liu, Zhicheng, Lu, Yu, Cheng, Shanbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
di: Li, Jiahuan, et al.
Pubblicazione: (2024)
GRRM: Group Relative Reward Modeling for Machine Translation
di: Yang, Sen, et al.
Pubblicazione: (2026)
di: Yang, Sen, et al.
Pubblicazione: (2026)
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
di: Li, Jiahuan, et al.
Pubblicazione: (2023)
Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs
di: Cao, Zhiwei, et al.
Pubblicazione: (2024)
di: Cao, Zhiwei, et al.
Pubblicazione: (2024)
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
di: Yang, Sen, et al.
Pubblicazione: (2025)
di: Yang, Sen, et al.
Pubblicazione: (2025)
SeqPO-SiMT: Sequential Policy Optimization for Simultaneous Machine Translation
di: Xu, Ting, et al.
Pubblicazione: (2025)
di: Xu, Ting, et al.
Pubblicazione: (2025)
Trans-Zero: Self-Play Incentivizes Large Language Models for Multilingual Translation Without Parallel Data
di: Zou, Wei, et al.
Pubblicazione: (2025)
di: Zou, Wei, et al.
Pubblicazione: (2025)
From Tens of Hours to Tens of Thousands: Scaling Back-Translation for Speech Recognition
di: Wang, Tianduo, et al.
Pubblicazione: (2025)
di: Wang, Tianduo, et al.
Pubblicazione: (2025)
Towards Achieving Human Parity on End-to-end Simultaneous Speech Translation via LLM Agent
di: Cheng, Shanbo, et al.
Pubblicazione: (2024)
di: Cheng, Shanbo, et al.
Pubblicazione: (2024)
Seed-X: Building Strong Multilingual Translation LLM with 7B Parameters
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
di: Cheng, Shanbo, et al.
Pubblicazione: (2025)
Towards Tailored Recovery of Lexical Diversity in Literary Machine Translation
di: Ploeger, Esther, et al.
Pubblicazione: (2024)
di: Ploeger, Esther, et al.
Pubblicazione: (2024)
Beyond Similarity: A Gradient-based Graph Method for Instruction Tuning Data Selection
di: Zhao, Yang, et al.
Pubblicazione: (2025)
di: Zhao, Yang, et al.
Pubblicazione: (2025)
TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
di: Zhang, Jipeng, et al.
Pubblicazione: (2024)
Uncertainty-Aware Gradient Signal-to-Noise Data Selection for Instruction Tuning
di: Yuan, Zhihang, et al.
Pubblicazione: (2026)
di: Yuan, Zhihang, et al.
Pubblicazione: (2026)
DoG-Instruct: Towards Premium Instruction-Tuning Data via Text-Grounded Instruction Wrapping
di: Chen, Yongrui, et al.
Pubblicazione: (2023)
di: Chen, Yongrui, et al.
Pubblicazione: (2023)
Enhancing Contrastive Demonstration Selection with Semantic Diversity for Robust In-Context Machine Translation
di: Patterson, Owen, et al.
Pubblicazione: (2025)
di: Patterson, Owen, et al.
Pubblicazione: (2025)
Multiscale simulation of rarefied polyatomic gas flow via DIG method
di: Luo, Liyan, et al.
Pubblicazione: (2025)
di: Luo, Liyan, et al.
Pubblicazione: (2025)
Your Vision-Language Model Itself Is a Strong Filter: Towards High-Quality Instruction Tuning with Data Selection
di: Chen, Ruibo, et al.
Pubblicazione: (2024)
di: Chen, Ruibo, et al.
Pubblicazione: (2024)
Leveraging Diverse Modeling Contexts with Collaborating Learning for Neural Machine Translation
di: Liao, Yusheng, et al.
Pubblicazione: (2024)
di: Liao, Yusheng, et al.
Pubblicazione: (2024)
Diverse and Fine-Grained Instruction-Following Ability Exploration with Synthetic Data
di: Gu, Zihui, et al.
Pubblicazione: (2024)
di: Gu, Zihui, et al.
Pubblicazione: (2024)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
di: Cao, Yihan, et al.
Pubblicazione: (2023)
di: Cao, Yihan, et al.
Pubblicazione: (2023)
DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization
di: She, Shuaijie, et al.
Pubblicazione: (2025)
di: She, Shuaijie, et al.
Pubblicazione: (2025)
On Instruction-Finetuning Neural Machine Translation Models
di: Raunak, Vikas, et al.
Pubblicazione: (2024)
di: Raunak, Vikas, et al.
Pubblicazione: (2024)
TopXGen: Topic-Diverse Parallel Data Generation for Low-Resource Machine Translation
di: Zebaze, Armel, et al.
Pubblicazione: (2025)
di: Zebaze, Armel, et al.
Pubblicazione: (2025)
Improving Influence-based Instruction Tuning Data Selection for Balanced Learning of Diverse Capabilities
di: Dai, Qirun, et al.
Pubblicazione: (2025)
di: Dai, Qirun, et al.
Pubblicazione: (2025)
Self-Modifying State Modeling for Simultaneous Machine Translation
di: Yu, Donglei, et al.
Pubblicazione: (2024)
di: Yu, Donglei, et al.
Pubblicazione: (2024)
Dynamic Jointly Batch Selection for Data Efficient Machine Translation Fine-Tuning
di: Ghanizadeh, Mohammad Amin, et al.
Pubblicazione: (2025)
di: Ghanizadeh, Mohammad Amin, et al.
Pubblicazione: (2025)
CrowdSelect: Synthetic Instruction Data Selection with Multi-LLM Wisdom
di: Li, Yisen, et al.
Pubblicazione: (2025)
di: Li, Yisen, et al.
Pubblicazione: (2025)
Deterministic Reversible Data Augmentation for Neural Machine Translation
di: Yao, Jiashu, et al.
Pubblicazione: (2024)
di: Yao, Jiashu, et al.
Pubblicazione: (2024)
Tuning LLMs with Contrastive Alignment Instructions for Machine Translation in Unseen, Low-resource Languages
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2024)
di: Mao, Zhuoyuan, et al.
Pubblicazione: (2024)
Is It Good Data for Multilingual Instruction Tuning or Just Bad Multilingual Evaluation for Large Language Models?
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
di: Chen, Pinzhen, et al.
Pubblicazione: (2024)
LANDeRMT: Detecting and Routing Language-Aware Neurons for Selectively Finetuning LLMs to Machine Translation
di: Zhu, Shaolin, et al.
Pubblicazione: (2024)
di: Zhu, Shaolin, et al.
Pubblicazione: (2024)
Mergen: The First Manchu-Korean Machine Translation Model Trained on Augmented Data
di: Seo, Jean, et al.
Pubblicazione: (2023)
di: Seo, Jean, et al.
Pubblicazione: (2023)
SCOI: Syntax-augmented Coverage-based In-context Example Selection for Machine Translation
di: Tang, Chenming, et al.
Pubblicazione: (2024)
di: Tang, Chenming, et al.
Pubblicazione: (2024)
LLMs Can Achieve High-quality Simultaneous Machine Translation as Efficiently as Offline
di: Fu, Biao, et al.
Pubblicazione: (2025)
di: Fu, Biao, et al.
Pubblicazione: (2025)
Diversity Measurement and Subset Selection for Instruction Tuning Datasets
di: Wang, Peiqi, et al.
Pubblicazione: (2024)
di: Wang, Peiqi, et al.
Pubblicazione: (2024)
Instruction-tuned Large Language Models for Machine Translation in the Medical Domain
di: Rios, Miguel
Pubblicazione: (2024)
di: Rios, Miguel
Pubblicazione: (2024)
Towards Zero-Shot Multimodal Machine Translation
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
di: Futeral, Matthieu, et al.
Pubblicazione: (2024)
MADS: Model-Aware Diverse Core Set Selection for Instruction Tuning
di: Bai, Yi, et al.
Pubblicazione: (2026)
di: Bai, Yi, et al.
Pubblicazione: (2026)
TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection
di: He, Xixiang, et al.
Pubblicazione: (2025)
di: He, Xixiang, et al.
Pubblicazione: (2025)
Documenti analoghi
-
MT-PATCHER: Selective and Extendable Knowledge Distillation from Large Language Models for Machine Translation
di: Li, Jiahuan, et al.
Pubblicazione: (2024) -
GRRM: Group Relative Reward Modeling for Machine Translation
di: Yang, Sen, et al.
Pubblicazione: (2026) -
Eliciting the Translation Ability of Large Language Models via Multilingual Finetuning with Translation Instructions
di: Li, Jiahuan, et al.
Pubblicazione: (2023) -
Retaining Key Information under High Compression Ratios: Query-Guided Compressor for LLMs
di: Cao, Zhiwei, et al.
Pubblicazione: (2024) -
EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation
di: Yang, Sen, et al.
Pubblicazione: (2025)