Guardado en:
| Autores principales: | Kocyigit, Muhammed Yusuf, Yildirim, Caglar |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2601.06103 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation
por: Kocyigit, Muhammed Yusuf, et al.
Publicado: (2025)
por: Kocyigit, Muhammed Yusuf, et al.
Publicado: (2025)
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025)
por: Tao, Yongding, et al.
Publicado: (2025)
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024)
por: Jiang, Minhao, et al.
Publicado: (2024)
LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
por: Gwak, Minju, et al.
Publicado: (2026)
por: Gwak, Minju, et al.
Publicado: (2026)
Search-Time Data Contamination
por: Han, Ziwen, et al.
Publicado: (2025)
por: Han, Ziwen, et al.
Publicado: (2025)
In Search for Architectures and Loss Functions in Multi-Objective Reinforcement Learning
por: Terekhov, Mikhail, et al.
Publicado: (2024)
por: Terekhov, Mikhail, et al.
Publicado: (2024)
Impact of Inaccurate Contamination Ratio on Robust Unsupervised Anomaly Detection
por: Masakuna, Jordan F., et al.
Publicado: (2024)
por: Masakuna, Jordan F., et al.
Publicado: (2024)
Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure
por: Yildirim, Caglar
Publicado: (2026)
por: Yildirim, Caglar
Publicado: (2026)
Deep Positive-Unlabeled Anomaly Detection for Contaminated Unlabeled Data
por: Takahashi, Hiroshi, et al.
Publicado: (2024)
por: Takahashi, Hiroshi, et al.
Publicado: (2024)
RADAR: Mechanistic Pathways for Detecting Data Contamination in LLM Evaluation
por: Kattamuri, Ashish, et al.
Publicado: (2025)
por: Kattamuri, Ashish, et al.
Publicado: (2025)
Anomaly Detection with Adaptive and Aggressive Rejection for Contaminated Training Data
por: Lee, Jungi, et al.
Publicado: (2025)
por: Lee, Jungi, et al.
Publicado: (2025)
Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models
por: Golchin, Shahriar, et al.
Publicado: (2023)
por: Golchin, Shahriar, et al.
Publicado: (2023)
The Role of Deep Learning Regularizations on Actors in Offline RL
por: Tarasov, Denis, et al.
Publicado: (2024)
por: Tarasov, Denis, et al.
Publicado: (2024)
TSFMAudit: Data Contamination Auditing in Forecasting Time Series Foundation Models
por: Li, Hongkai, et al.
Publicado: (2026)
por: Li, Hongkai, et al.
Publicado: (2026)
Prioritized Replay for RL Post-training
por: Fatemi, Mehdi
Publicado: (2026)
por: Fatemi, Mehdi
Publicado: (2026)
Efficient Learning of Fuzzy Logic Systems for Large-Scale Data Using Deep Learning
por: Koklu, Ata, et al.
Publicado: (2024)
por: Koklu, Ata, et al.
Publicado: (2024)
Can Generative Artificial Intelligence Survive Data Contamination? Theoretical Guarantees under Contaminated Recursive Training
por: Wang, Kevin, et al.
Publicado: (2026)
por: Wang, Kevin, et al.
Publicado: (2026)
Generative Modeling of Networked Time-Series via Transformer Architectures
por: Elnady, Yusuf
Publicado: (2025)
por: Elnady, Yusuf
Publicado: (2025)
AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
por: Motwani, Sumeet Ramesh, et al.
Publicado: (2026)
Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders
por: Jing, Yi, et al.
Publicado: (2026)
por: Jing, Yi, et al.
Publicado: (2026)
BoA: Attention-aware Post-training Quantization without Backpropagation
por: Kim, Junhan, et al.
Publicado: (2024)
por: Kim, Junhan, et al.
Publicado: (2024)
Bayesian Kolmogorov Arnold Networks (Bayesian_KANs): A Probabilistic Approach to Enhance Accuracy and Interpretability
por: Hassan, Masoud Muhammed
Publicado: (2024)
por: Hassan, Masoud Muhammed
Publicado: (2024)
Automatic Pair Construction for Contrastive Post-training
por: Xu, Canwen, et al.
Publicado: (2023)
por: Xu, Canwen, et al.
Publicado: (2023)
The Illusion of Reasoning: Exposing Evasive Data Contamination in LLMs via Zero-CoT Truncation
por: Lan, Yifan, et al.
Publicado: (2026)
por: Lan, Yifan, et al.
Publicado: (2026)
A Generic Machine Learning Framework for Fully-Unsupervised Anomaly Detection with Contaminated Data
por: Ulmer, Markus, et al.
Publicado: (2023)
por: Ulmer, Markus, et al.
Publicado: (2023)
Beneficial Reasoning Behaviors in Agentic Search and Effective Post-training to Obtain Them
por: Jin, Jiahe, et al.
Publicado: (2025)
por: Jin, Jiahe, et al.
Publicado: (2025)
AdamS: Momentum Itself Can Be A Normalizer for LLM Pretraining and Post-training
por: Zhang, Huishuai, et al.
Publicado: (2025)
por: Zhang, Huishuai, et al.
Publicado: (2025)
Arena Learning: Build Data Flywheel for LLMs Post-training via Simulated Chatbot Arena
por: Luo, Haipeng, et al.
Publicado: (2024)
por: Luo, Haipeng, et al.
Publicado: (2024)
Towards Effective Theory of LLMs: A Representation Learning Approach
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
por: Ustaomeroglu, Muhammed, et al.
Publicado: (2026)
RoCA: Robust Contrastive One-class Time Series Anomaly Detection with Contaminated Data
por: Mou, Xudong, et al.
Publicado: (2025)
por: Mou, Xudong, et al.
Publicado: (2025)
Beyond Surface-Level Similarity: Hierarchical Contamination Detection for Synthetic Training Data in Foundation Models
por: Mehta, Sushant
Publicado: (2025)
por: Mehta, Sushant
Publicado: (2025)
From Simulation to Enaction: Post-trained language models recognize and react to their own generations
por: G., Asvin, et al.
Publicado: (2026)
por: G., Asvin, et al.
Publicado: (2026)
PBP: Post-training Backdoor Purification for Malware Classifiers
por: Nguyen, Dung Thuy, et al.
Publicado: (2024)
por: Nguyen, Dung Thuy, et al.
Publicado: (2024)
Post-training for Efficient Communication via Convention Formation
por: Hua, Yilun, et al.
Publicado: (2025)
por: Hua, Yilun, et al.
Publicado: (2025)
Efficient Post-training Quantization with FP8 Formats
por: Shen, Haihao, et al.
Publicado: (2023)
por: Shen, Haihao, et al.
Publicado: (2023)
How Much Can We Forget about Data Contamination?
por: Bordt, Sebastian, et al.
Publicado: (2024)
por: Bordt, Sebastian, et al.
Publicado: (2024)
On the dimension of pullback attractors in recurrent neural networks
por: Fadera, Muhammed
Publicado: (2025)
por: Fadera, Muhammed
Publicado: (2025)
State Contamination in Memory-Augmented LLM Agents
por: Wang, Yian, et al.
Publicado: (2026)
por: Wang, Yian, et al.
Publicado: (2026)
Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training
por: Hu, Pingbang, et al.
Publicado: (2026)
por: Hu, Pingbang, et al.
Publicado: (2026)
Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination
por: Wu, Mingqi, et al.
Publicado: (2025)
por: Wu, Mingqi, et al.
Publicado: (2025)
Ejemplares similares
-
Overestimation in LLM Evaluation: A Controlled Large-Scale Study on Data Contamination's Impact on Machine Translation
por: Kocyigit, Muhammed Yusuf, et al.
Publicado: (2025) -
Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models
por: Tao, Yongding, et al.
Publicado: (2025) -
Investigating Data Contamination for Pre-training Language Models
por: Jiang, Minhao, et al.
Publicado: (2024) -
LaRA: Layer-wise Representation Analysis for Detecting Data Contamination in RL Post-Training
por: Gwak, Minju, et al.
Publicado: (2026) -
Search-Time Data Contamination
por: Han, Ziwen, et al.
Publicado: (2025)