Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Jeffrey, Gardner, Josh, Kang, Doug, Shi, Fangping, Singh, Karanjeet, Li, Chun-Liang, Shandilya, Herumb, Hall, David, Tuzel, Oncel, Liang, Percy, Schmidt, Ludwig, Ansari, Hadi Pour, Faghri, Fartash |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP with Quality Captions: A Strong Pretraining for Vision Tasks
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023)
MUSCLE: A Model Update Strategy for Compatible LLM Evolution
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024)
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023)
TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining
di: Li, Jeffrey, et al.
Pubblicazione: (2025)
di: Li, Jeffrey, et al.
Pubblicazione: (2025)
MobileCLIP2: Improving Multi-Modal Reinforced Training
di: Faghri, Fartash, et al.
Pubblicazione: (2025)
di: Faghri, Fartash, et al.
Pubblicazione: (2025)
TiC-CLIP: Continual Training of CLIP Models
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
di: Garg, Saurabh, et al.
Pubblicazione: (2023)
Proxy-FDA: Proxy-based Feature Distribution Alignment for Fine-tuning Vision Foundation Models without Forgetting
di: Huang, Chen, et al.
Pubblicazione: (2025)
di: Huang, Chen, et al.
Pubblicazione: (2025)
FocalLens: Instruction Tuning Enables Zero-Shot Conditional Image Representations
di: Hsieh, Cheng-Yu, et al.
Pubblicazione: (2025)
di: Hsieh, Cheng-Yu, et al.
Pubblicazione: (2025)
VSAS-Bench: Real-Time Evaluation of Visual Streaming Assistant Models
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2026)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2026)
SAM-CLIP: Merging Vision Foundation Models towards Semantic and Spatial Understanding
di: Wang, Haoxiang, et al.
Pubblicazione: (2023)
di: Wang, Haoxiang, et al.
Pubblicazione: (2023)
Pretraining with hierarchical memories: separating long-tail and common knowledge
di: Pouransari, Hadi, et al.
Pubblicazione: (2025)
di: Pouransari, Hadi, et al.
Pubblicazione: (2025)
CatLIP: CLIP-level Visual Recognition Accuracy with 2.7x Faster Pre-training on Web-scale Image-Text Data
di: Mehta, Sachin, et al.
Pubblicazione: (2024)
di: Mehta, Sachin, et al.
Pubblicazione: (2024)
FastVLM: Efficient Vision Encoding for Vision Language Models
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024)
AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
Data-Centric Lessons To Improve Speech-Language Pretraining
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2025)
Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
di: Hsieh, Yu-Guan, et al.
Pubblicazione: (2024)
Fantastic Pretraining Optimizers and Where to Find Them
di: Wen, Kaiyue, et al.
Pubblicazione: (2025)
di: Wen, Kaiyue, et al.
Pubblicazione: (2025)
Beyond the hierarchy: Systems thinking to progress interprofessional workplace learning
di: Karanjeet Chauhan, et al.
Pubblicazione: (2025)
di: Karanjeet Chauhan, et al.
Pubblicazione: (2025)
Dataset Decomposition: Faster LLM Training with Variable Sequence Length Curriculum
di: Pouransari, Hadi, et al.
Pubblicazione: (2024)
di: Pouransari, Hadi, et al.
Pubblicazione: (2024)
Learning from Self Critique and Refinement for Faithful LLM Summarization
di: Hu, Ting-Yao, et al.
Pubblicazione: (2025)
di: Hu, Ting-Yao, et al.
Pubblicazione: (2025)
LiTo: Surface Light Field Tokenization
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2026)
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2026)
HTML-LSTM: Information Extraction from HTML Tables in Web Pages using Tree-Structured LSTM
di: Kawamura, Kazuki, et al.
Pubblicazione: (2024)
di: Kawamura, Kazuki, et al.
Pubblicazione: (2024)
TrajTok: Learning Trajectory Tokens enables better Video Understanding
di: Zheng, Chenhao, et al.
Pubblicazione: (2026)
di: Zheng, Chenhao, et al.
Pubblicazione: (2026)
GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models
di: Mirzadeh, Iman, et al.
Pubblicazione: (2024)
di: Mirzadeh, Iman, et al.
Pubblicazione: (2024)
RayRoPE: Projective Ray Positional Encoding for Multi-view Attention
di: Wu, Yu, et al.
Pubblicazione: (2026)
di: Wu, Yu, et al.
Pubblicazione: (2026)
3D Shape Tokenization via Latent Flow Matching
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
di: Chang, Jen-Hao Rick, et al.
Pubblicazione: (2024)
Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM
di: Liu, Mengjie, et al.
Pubblicazione: (2025)
di: Liu, Mengjie, et al.
Pubblicazione: (2025)
Benchmarking Distribution Shift in Tabular Data with TableShift
di: Gardner, Josh, et al.
Pubblicazione: (2023)
di: Gardner, Josh, et al.
Pubblicazione: (2023)
Computational Bottlenecks of Training Small-scale Large Language Models
di: Ashkboos, Saleh, et al.
Pubblicazione: (2024)
di: Ashkboos, Saleh, et al.
Pubblicazione: (2024)
Sophia: A Scalable Stochastic Second-order Optimizer for Language Model Pre-training
di: Liu, Hong, et al.
Pubblicazione: (2023)
di: Liu, Hong, et al.
Pubblicazione: (2023)
Large Scale Transfer Learning for Tabular Data via Language Modeling
di: Gardner, Josh, et al.
Pubblicazione: (2024)
di: Gardner, Josh, et al.
Pubblicazione: (2024)
El uso de las redes sociales y la cultura popular para una mejor comprensión intercultural
di: Sait Tuzel
Pubblicazione: (2017)
di: Sait Tuzel
Pubblicazione: (2017)
Anticipatory Music Transformer
di: Thickstun, John, et al.
Pubblicazione: (2023)
di: Thickstun, John, et al.
Pubblicazione: (2023)
Relative Scaling Laws for LLMs
di: Held, William, et al.
Pubblicazione: (2025)
di: Held, William, et al.
Pubblicazione: (2025)
Oldest‐in‐Human Successful Extraction Experience of a Novel Substernal Extravascular Defibrillator
di: Karanjeet Chauhan, et al.
Pubblicazione: (2024)
di: Karanjeet Chauhan, et al.
Pubblicazione: (2024)
Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity
di: Joudaki, Amir, et al.
Pubblicazione: (2025)
di: Joudaki, Amir, et al.
Pubblicazione: (2025)
Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization
di: Samragh, Mohammad, et al.
Pubblicazione: (2024)
di: Samragh, Mohammad, et al.
Pubblicazione: (2024)
ATTIQA: Generalizable Image Quality Feature Extractor using Attribute-aware Pretraining
di: Kwon, Daekyu, et al.
Pubblicazione: (2024)
di: Kwon, Daekyu, et al.
Pubblicazione: (2024)
MARE: Multi-Aspect Rationale Extractor on Unsupervised Rationale Extraction
di: Jiang, Han, et al.
Pubblicazione: (2024)
di: Jiang, Han, et al.
Pubblicazione: (2024)
Documenti analoghi
-
CLIP with Quality Captions: A Strong Pretraining for Vision Tasks
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2024) -
MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
di: Vasu, Pavan Kumar Anasosalu, et al.
Pubblicazione: (2023) -
MUSCLE: A Model Update Strategy for Compatible LLM Evolution
di: Echterhoff, Jessica, et al.
Pubblicazione: (2024) -
Knowledge Transfer from Vision Foundation Models for Efficient Training of Small Task-specific Models
di: Vemulapalli, Raviteja, et al.
Pubblicazione: (2023) -
TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining
di: Li, Jeffrey, et al.
Pubblicazione: (2025)