Guardado en:
| Autores principales: | Tong, Ziyi, Sun, Feifei, Nguyen, Le Minh |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.26133 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Lost in Modality: Evaluating the Effectiveness of Text-Based Membership Inference Attacks on Large Multimodal Models
por: Tong, Ziyi, et al.
Publicado: (2025)
por: Tong, Ziyi, et al.
Publicado: (2025)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024)
por: Jiang, Minhao, et al.
Publicado: (2024)
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024)
por: Puerto, Haritz, et al.
Publicado: (2024)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Time Travel in LLMs: Tracing Data Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
Revisiting Multilingual Data Mixtures in Language Model Pretraining
por: Foroutan, Negar, et al.
Publicado: (2025)
por: Foroutan, Negar, et al.
Publicado: (2025)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
por: Zhang, Hengxiang, et al.
Publicado: (2024)
por: Zhang, Hengxiang, et al.
Publicado: (2024)
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
por: Chen, Zhixun, et al.
Publicado: (2025)
por: Chen, Zhixun, et al.
Publicado: (2025)
Context-Aware Membership Inference Attacks against Pre-trained Large Language Models
por: Chang, Hongyan, et al.
Publicado: (2024)
por: Chang, Hongyan, et al.
Publicado: (2024)
Membership Inference Attacks against Large Vision-Language Models
por: Li, Zhan, et al.
Publicado: (2024)
por: Li, Zhan, et al.
Publicado: (2024)
A Survey on Large Language Model-based Agents for Statistics and Data Science
por: Sun, Maojun, et al.
Publicado: (2024)
por: Sun, Maojun, et al.
Publicado: (2024)
Pretraining Large Language Models with NVFP4
por: NVIDIA, et al.
Publicado: (2025)
por: NVIDIA, et al.
Publicado: (2025)
Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models
por: Dong, Yihong, et al.
Publicado: (2024)
por: Dong, Yihong, et al.
Publicado: (2024)
Evading Data Contamination Detection for Language Models is (too) Easy
por: Dekoninck, Jasper, et al.
Publicado: (2024)
por: Dekoninck, Jasper, et al.
Publicado: (2024)
An Efficient Inference Framework for Early-exit Large Language Models
por: Miao, Ruijie, et al.
Publicado: (2024)
por: Miao, Ruijie, et al.
Publicado: (2024)
Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
por: Wang, Xinyi, et al.
Publicado: (2024)
por: Wang, Xinyi, et al.
Publicado: (2024)
BiMix: A Bivariate Data Mixing Law for Language Model Pretraining
por: Ge, Ce, et al.
Publicado: (2024)
por: Ge, Ce, et al.
Publicado: (2024)
Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models
por: Ali, Mehdi, et al.
Publicado: (2025)
por: Ali, Mehdi, et al.
Publicado: (2025)
Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation
por: Chen, Simin, et al.
Publicado: (2025)
por: Chen, Simin, et al.
Publicado: (2025)
Surveying the Effects of Quality, Diversity, and Complexity in Synthetic Data From Large Language Models
por: Havrilla, Alex, et al.
Publicado: (2024)
por: Havrilla, Alex, et al.
Publicado: (2024)
Fine-tuning Large Language Models with Limited Data: A Survey and Practical Guide
por: Szep, Marton, et al.
Publicado: (2024)
por: Szep, Marton, et al.
Publicado: (2024)
LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models
por: Kostikova, Aida, et al.
Publicado: (2025)
por: Kostikova, Aida, et al.
Publicado: (2025)
Model Compression and Efficient Inference for Large Language Models: A Survey
por: Wang, Wenxiao, et al.
Publicado: (2024)
por: Wang, Wenxiao, et al.
Publicado: (2024)
$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models
por: Do, Quyet V., et al.
Publicado: (2026)
por: Do, Quyet V., et al.
Publicado: (2026)
Instruction Mining: Instruction Data Selection for Tuning Large Language Models
por: Cao, Yihan, et al.
Publicado: (2023)
por: Cao, Yihan, et al.
Publicado: (2023)
One STEP at a time: Language Agents are Stepwise Planners
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
A Survey on Multimodal Large Language Models
por: Yin, Shukang, et al.
Publicado: (2023)
por: Yin, Shukang, et al.
Publicado: (2023)
HMI: Hierarchical Knowledge Management for Efficient Multi-Tenant Inference in Pretrained Language Models
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
Many-to-English Machine Translation Tools, Data, and Pretrained Models
por: Gowda, Thamme, et al.
Publicado: (2021)
por: Gowda, Thamme, et al.
Publicado: (2021)
Rethinking Data Mixing from the Perspective of Large Language Models
por: Xu, Yuanjian, et al.
Publicado: (2026)
por: Xu, Yuanjian, et al.
Publicado: (2026)
Soft Prompting for Unlearning in Large Language Models
por: Bhaila, Karuna, et al.
Publicado: (2024)
por: Bhaila, Karuna, et al.
Publicado: (2024)
MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources
por: Nguyen, Huu, et al.
Publicado: (2025)
por: Nguyen, Huu, et al.
Publicado: (2025)
Generalized knowledge-enhanced framework for biomedical entity and relation extraction
por: Nguyen, Minh, et al.
Publicado: (2024)
por: Nguyen, Minh, et al.
Publicado: (2024)
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
por: Yu, Zichun, et al.
Publicado: (2026)
por: Yu, Zichun, et al.
Publicado: (2026)
Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models
por: Huang, Yukun, et al.
Publicado: (2025)
por: Huang, Yukun, et al.
Publicado: (2025)
How Much Can We Forget about Data Contamination?
por: Bordt, Sebastian, et al.
Publicado: (2024)
por: Bordt, Sebastian, et al.
Publicado: (2024)
A Systematic Survey on Large Language Models for Algorithm Design
por: Liu, Fei, et al.
Publicado: (2024)
por: Liu, Fei, et al.
Publicado: (2024)
Foundations of Large Language Models
por: Xiao, Tong, et al.
Publicado: (2025)
por: Xiao, Tong, et al.
Publicado: (2025)
The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination
por: Sun, Yifan, et al.
Publicado: (2025)
por: Sun, Yifan, et al.
Publicado: (2025)
Ejemplares similares
-
Lost in Modality: Evaluating the Effectiveness of Text-Based Membership Inference Attacks on Large Multimodal Models
por: Tong, Ziyi, et al.
Publicado: (2025) -
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023) -
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024) -
Scaling Up Membership Inference: When and How Attacks Succeed on Large Language Models
por: Puerto, Haritz, et al.
Publicado: (2024) -
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)