Leveraging Web-Crawled Data for High-Quality Fine-Tuning
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhou, Jing, Jiang, Chenglin, Shen, Wei, Zhou, Xiao, He, Xiaonan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data
di: Wang, Yudong, et al.
Pubblicazione: (2025)
di: Wang, Yudong, et al.
Pubblicazione: (2025)
Introducing the NewsPaLM MBR and QE Dataset: LLM-Generated High-Quality Parallel Data Outperforms Traditional Web-Crawled Data
di: Finkelstein, Mara, et al.
Pubblicazione: (2024)
di: Finkelstein, Mara, et al.
Pubblicazione: (2024)
CC-GPX: Extracting High-Quality Annotated Geospatial Data from Common Crawl
di: Ilyankou, Ilya, et al.
Pubblicazione: (2024)
di: Ilyankou, Ilya, et al.
Pubblicazione: (2024)
Phased Instruction Fine-Tuning for Large Language Models
di: Pang, Wei, et al.
Pubblicazione: (2024)
di: Pang, Wei, et al.
Pubblicazione: (2024)
Craw4LLM: Efficient Web Crawling for LLM Pretraining
di: Yu, Shi, et al.
Pubblicazione: (2025)
di: Yu, Shi, et al.
Pubblicazione: (2025)
Do Language Models Care About Text Quality? Evaluating Web-Crawled Corpora Across 11 Languages
di: van Noord, Rik, et al.
Pubblicazione: (2024)
di: van Noord, Rik, et al.
Pubblicazione: (2024)
Web Page Classification using LLMs for Crawling Support
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2025)
di: Sasazawa, Yuichi, et al.
Pubblicazione: (2025)
Rethinking Data Selection for Supervised Fine-Tuning
di: Shen, Ming
Pubblicazione: (2024)
di: Shen, Ming
Pubblicazione: (2024)
Leveraging the Power of LLMs: A Fine-Tuning Approach for High-Quality Aspect-Based Summarization
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
di: Mullick, Ankan, et al.
Pubblicazione: (2024)
Building High-Quality Datasets for Portuguese LLMs: From Common Crawl Snapshots to Industrial-Grade Corpora
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
di: Almeida, Thales Sales, et al.
Pubblicazione: (2025)
From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning
di: Li, Ming, et al.
Pubblicazione: (2023)
di: Li, Ming, et al.
Pubblicazione: (2023)
Better Datasets Start From RefineLab: Automatic Optimization for High-Quality Dataset Refinement
di: Luo, Xiaonan, et al.
Pubblicazione: (2025)
di: Luo, Xiaonan, et al.
Pubblicazione: (2025)
InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning
di: Su, Junyou, et al.
Pubblicazione: (2026)
di: Su, Junyou, et al.
Pubblicazione: (2026)
Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs
di: Fan, Dongyang, et al.
Pubblicazione: (2025)
di: Fan, Dongyang, et al.
Pubblicazione: (2025)
Instruction-Tuning Data Synthesis from Scratch via Web Reconstruction
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
di: Jiang, Yuxin, et al.
Pubblicazione: (2025)
The Synergy of Automated Pipelines with Prompt Engineering and Generative AI in Web Crawling
di: Huang, Chau-Jian
Pubblicazione: (2024)
di: Huang, Chau-Jian
Pubblicazione: (2024)
GneissWeb: Preparing High Quality Data for LLMs at Scale
di: Gohari, Hajar Emami, et al.
Pubblicazione: (2025)
di: Gohari, Hajar Emami, et al.
Pubblicazione: (2025)
DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
di: Zhang, Junbo, et al.
Pubblicazione: (2026)
GiFT: Gibbs Fine-Tuning for Code Generation
di: Li, Haochen, et al.
Pubblicazione: (2025)
di: Li, Haochen, et al.
Pubblicazione: (2025)
Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment
di: Guo, Geyang, et al.
Pubblicazione: (2023)
di: Guo, Geyang, et al.
Pubblicazione: (2023)
A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
di: Zhou, Shijie, et al.
Pubblicazione: (2024)
Improving Translation Quality by Selecting Better Data for LLM Fine-Tuning: A Comparative Analysis
di: de Mello, Felipe Ribeiro Fujita, et al.
Pubblicazione: (2025)
di: de Mello, Felipe Ribeiro Fujita, et al.
Pubblicazione: (2025)
Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation
di: Zhang, Lechen, et al.
Pubblicazione: (2026)
di: Zhang, Lechen, et al.
Pubblicazione: (2026)
FineWeb-zhtw: Scalable Curation of Traditional Chinese Text Data from the Web
di: Lin, Cheng-Wei, et al.
Pubblicazione: (2024)
di: Lin, Cheng-Wei, et al.
Pubblicazione: (2024)
VisCon-100K: Leveraging Contextual Web Data for Fine-tuning Vision Language Models
di: Kumar, Gokul Karthik, et al.
Pubblicazione: (2025)
di: Kumar, Gokul Karthik, et al.
Pubblicazione: (2025)
M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
di: Zhao, Chunguang, et al.
Pubblicazione: (2025)
The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
di: Penedo, Guilherme, et al.
Pubblicazione: (2024)
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
Leveraging Lora Fine-Tuning and Knowledge Bases for Construction Identification
di: Kaipeng, Liu, et al.
Pubblicazione: (2026)
di: Kaipeng, Liu, et al.
Pubblicazione: (2026)
The Growing Gains and Pains of Iterative Web Corpora Crawling: Insights from South Slavic CLASSLA-web 2.0 Corpora
di: Pungeršek, Taja Kuzman, et al.
Pubblicazione: (2026)
di: Pungeršek, Taja Kuzman, et al.
Pubblicazione: (2026)
What Do LLMs Know About Alzheimer's Disease? Multi-loss Fine-Tuning and Probing for AD Detection
di: Jiang, Lei, et al.
Pubblicazione: (2026)
di: Jiang, Lei, et al.
Pubblicazione: (2026)
Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data
di: Zhuang, Xinlin, et al.
Pubblicazione: (2025)
di: Zhuang, Xinlin, et al.
Pubblicazione: (2025)
Quantifying Geospatial in the Common Crawl Corpus
di: Ilyankou, Ilya, et al.
Pubblicazione: (2024)
di: Ilyankou, Ilya, et al.
Pubblicazione: (2024)
OffsetBias: Leveraging Debiased Data for Tuning Evaluators
di: Park, Junsoo, et al.
Pubblicazione: (2024)
di: Park, Junsoo, et al.
Pubblicazione: (2024)
Mind the Gap: Data Rewriting for Stable Off-Policy Supervised Fine-Tuning
di: Zhao, Shiwan, et al.
Pubblicazione: (2025)
di: Zhao, Shiwan, et al.
Pubblicazione: (2025)
An Empirical Study on Parameter-Efficient Fine-Tuning for MultiModal Large Language Models
di: Zhou, Xiongtao, et al.
Pubblicazione: (2024)
di: Zhou, Xiongtao, et al.
Pubblicazione: (2024)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
di: Li, Wu, et al.
Pubblicazione: (2026)
di: Li, Wu, et al.
Pubblicazione: (2026)
GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuning
di: Fang, Zhouxiang, et al.
Pubblicazione: (2026)
di: Fang, Zhouxiang, et al.
Pubblicazione: (2026)
Leveraging Conditional Mutual Information to Improve Large Language Model Fine-Tuning For Classification
di: Sivakaran, Thanushon, et al.
Pubblicazione: (2025)
di: Sivakaran, Thanushon, et al.
Pubblicazione: (2025)
PAFT: Prompt-Agnostic Fine-Tuning
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
di: Wei, Chenxing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data
di: Wang, Yudong, et al.
Pubblicazione: (2025) -
Introducing the NewsPaLM MBR and QE Dataset: LLM-Generated High-Quality Parallel Data Outperforms Traditional Web-Crawled Data
di: Finkelstein, Mara, et al.
Pubblicazione: (2024) -
CC-GPX: Extracting High-Quality Annotated Geospatial Data from Common Crawl
di: Ilyankou, Ilya, et al.
Pubblicazione: (2024) -
Phased Instruction Fine-Tuning for Large Language Models
di: Pang, Wei, et al.
Pubblicazione: (2024) -
Craw4LLM: Efficient Web Crawling for LLM Pretraining
di: Yu, Shi, et al.
Pubblicazione: (2025)