Craw4LLM: Efficient Web Crawling for LLM Pretraining
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yu, Shi, Liu, Zhiyuan, Xiong, Chenyan |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cleaner Pretraining Corpus Curation with Neural Web Scraping
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models
von: Yu, Zichun, et al.
Veröffentlicht: (2024)
von: Yu, Zichun, et al.
Veröffentlicht: (2024)
Midtraining Bridges Pretraining and Posttraining Distributions
von: Liu, Emmy, et al.
Veröffentlicht: (2025)
von: Liu, Emmy, et al.
Veröffentlicht: (2025)
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
von: Yu, Zichun, et al.
Veröffentlicht: (2026)
von: Yu, Zichun, et al.
Veröffentlicht: (2026)
Group-Level Data Selection for Efficient Pretraining
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
von: Yu, Zichun, et al.
Veröffentlicht: (2025)
Train Yourself as an LLM: Exploring Effects of AI Literacy on Persuasion via Role-playing LLM Training
von: Fan, Qihui, et al.
Veröffentlicht: (2026)
von: Fan, Qihui, et al.
Veröffentlicht: (2026)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
von: Ma, Xuezhe, et al.
Veröffentlicht: (2024)
Toolink: Linking Toolkit Creation and Using through Chain-of-Solving on Open-Source Model
von: Qian, Cheng, et al.
Veröffentlicht: (2023)
von: Qian, Cheng, et al.
Veröffentlicht: (2023)
Efficient Multi-Agent System Training with Data Influence-Oriented Tree Search
von: Shi, Wentao, et al.
Veröffentlicht: (2025)
von: Shi, Wentao, et al.
Veröffentlicht: (2025)
QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining
von: Liu, Fengze, et al.
Veröffentlicht: (2025)
von: Liu, Fengze, et al.
Veröffentlicht: (2025)
Semi-structured LLM Reasoners Can Be Rigorously Audited
von: Leng, Jixuan, et al.
Veröffentlicht: (2025)
von: Leng, Jixuan, et al.
Veröffentlicht: (2025)
Leveraging Web-Crawled Data for High-Quality Fine-Tuning
von: Zhou, Jing, et al.
Veröffentlicht: (2024)
von: Zhou, Jing, et al.
Veröffentlicht: (2024)
Introducing the NewsPaLM MBR and QE Dataset: LLM-Generated High-Quality Parallel Data Outperforms Traditional Web-Crawled Data
von: Finkelstein, Mara, et al.
Veröffentlicht: (2024)
von: Finkelstein, Mara, et al.
Veröffentlicht: (2024)
Web Page Classification using LLMs for Crawling Support
von: Sasazawa, Yuichi, et al.
Veröffentlicht: (2025)
von: Sasazawa, Yuichi, et al.
Veröffentlicht: (2025)
Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset
von: Su, Dan, et al.
Veröffentlicht: (2024)
von: Su, Dan, et al.
Veröffentlicht: (2024)
Understand User Opinions of Large Language Models via LLM-Powered In-the-Moment User Experience Interviews
von: Liu, Mengqiao, et al.
Veröffentlicht: (2025)
von: Liu, Mengqiao, et al.
Veröffentlicht: (2025)
Thinking in a Crowd: How Auxiliary Information Shapes LLM Reasoning
von: Zhao, Haodong, et al.
Veröffentlicht: (2025)
von: Zhao, Haodong, et al.
Veröffentlicht: (2025)
Ultra-FineWeb: Efficient Data Filtering and Verification for High-Quality LLM Training Data
von: Wang, Yudong, et al.
Veröffentlicht: (2025)
von: Wang, Yudong, et al.
Veröffentlicht: (2025)
Dissecting Outlier Dynamics in LLM NVFP4 Pretraining
von: Dong, Peijie, et al.
Veröffentlicht: (2026)
von: Dong, Peijie, et al.
Veröffentlicht: (2026)
LLM Pretraining with Continuous Concepts
von: Tack, Jihoon, et al.
Veröffentlicht: (2025)
von: Tack, Jihoon, et al.
Veröffentlicht: (2025)
Model-Generated Pretraining Signals Improves Zero-Shot Generalization of Text-to-Text Transformers
von: Gong, Linyuan, et al.
Veröffentlicht: (2023)
von: Gong, Linyuan, et al.
Veröffentlicht: (2023)
RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining
von: Vo, Anh-Dung, et al.
Veröffentlicht: (2024)
von: Vo, Anh-Dung, et al.
Veröffentlicht: (2024)
daVinci-LLM:Towards the Science of Pretraining
von: Qin, Yiwei, et al.
Veröffentlicht: (2026)
von: Qin, Yiwei, et al.
Veröffentlicht: (2026)
TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining
von: Li, Jeffrey, et al.
Veröffentlicht: (2025)
von: Li, Jeffrey, et al.
Veröffentlicht: (2025)
Strong Teacher Not Needed? On Distillation in LLM Pretraining
von: Lu, Taiming, et al.
Veröffentlicht: (2026)
von: Lu, Taiming, et al.
Veröffentlicht: (2026)
FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models
von: Kang, Hao, et al.
Veröffentlicht: (2025)
von: Kang, Hao, et al.
Veröffentlicht: (2025)
ThinkNote: Enhancing Knowledge Integration and Utilization of Large Language Models via Constructivist Cognition Modeling
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
Can Performant LLMs Be Ethical? Quantifying the Impact of Web Crawling Opt-Outs
von: Fan, Dongyang, et al.
Veröffentlicht: (2025)
von: Fan, Dongyang, et al.
Veröffentlicht: (2025)
Checkpoint Merging via Bayesian Optimization in LLM Pretraining
von: Liu, Deyuan, et al.
Veröffentlicht: (2024)
von: Liu, Deyuan, et al.
Veröffentlicht: (2024)
The Synergy of Automated Pipelines with Prompt Engineering and Generative AI in Web Crawling
von: Huang, Chau-Jian
Veröffentlicht: (2024)
von: Huang, Chau-Jian
Veröffentlicht: (2024)
WEPO: Web Element Preference Optimization for LLM-based Web Navigation
von: Liu, Jiarun, et al.
Veröffentlicht: (2024)
von: Liu, Jiarun, et al.
Veröffentlicht: (2024)
Say More with Less: Understanding Prompt Learning Behaviors through Gist Compression
von: Li, Xinze, et al.
Veröffentlicht: (2024)
von: Li, Xinze, et al.
Veröffentlicht: (2024)
Benchmark Test-Time Scaling of General LLM Agents
von: Li, Xiaochuan, et al.
Veröffentlicht: (2026)
von: Li, Xiaochuan, et al.
Veröffentlicht: (2026)
AutoRule: Reasoning Chain-of-thought Extracted Rule-based Rewards Improve Preference Learning
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
von: Wang, Tevin, et al.
Veröffentlicht: (2025)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
von: Kang, Hao, et al.
Veröffentlicht: (2024)
von: Kang, Hao, et al.
Veröffentlicht: (2024)
Beyond URLs: Metadata Diversity and Position for Efficient LLM Pretraining
von: Fan, Dongyang, et al.
Veröffentlicht: (2025)
von: Fan, Dongyang, et al.
Veröffentlicht: (2025)
Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning
von: Li, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Li, Xiaochuan, et al.
Veröffentlicht: (2024)
Instability in Downstream Task Performance During LLM Pretraining
von: Nishida, Yuto, et al.
Veröffentlicht: (2025)
von: Nishida, Yuto, et al.
Veröffentlicht: (2025)
LASER: LLM Agent with State-Space Exploration for Web Navigation
von: Ma, Kaixin, et al.
Veröffentlicht: (2023)
von: Ma, Kaixin, et al.
Veröffentlicht: (2023)
Ähnliche Einträge
-
Cleaner Pretraining Corpus Curation with Neural Web Scraping
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024) -
RePro: Training Language Models to Faithfully Recycle the Web for Pretraining
von: Yu, Zichun, et al.
Veröffentlicht: (2025) -
MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models
von: Yu, Zichun, et al.
Veröffentlicht: (2024) -
Midtraining Bridges Pretraining and Posttraining Distributions
von: Liu, Emmy, et al.
Veröffentlicht: (2025) -
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
von: Yu, Zichun, et al.
Veröffentlicht: (2026)