AICC: Parse HTML Finer, Make Models Better -- A 7.3T AI-Ready Corpus Built by a Model-Based HTML Parser
Fuente:
arXiv
Guardado en:
| Autores principales: | Ma, Ren, Qiu, Jiantao, Xu, Chao, Chu, Pei, Liu, Kaiwen, Ren, Pengli, Qu, Yuan, Peng, Jiahui, Hou, Linfeng, Liu, Mengjie, Lu, Lindong, Ning, Wenchang, Yu, Jia, Min, Rui, Shi, Jin, Chen, Haojiong, Zhang, Peng, Zhang, Wenjian, Jiang, Qian, Hu, Zengjie, Yang, Guoqiang, Li, Zhenxiang, Shang, Fukai, Ma, Runyuan, Su, Chenlin, Tu, Zhongying, Zhang, Wentao, Lin, Dahua, He, Conghui |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM
por: Liu, Mengjie, et al.
Publicado: (2025)
por: Liu, Mengjie, et al.
Publicado: (2025)
HTML-LSTM: Information Extraction from HTML Tables in Web Pages using Tree-Structured LSTM
por: Kawamura, Kazuki, et al.
Publicado: (2024)
por: Kawamura, Kazuki, et al.
Publicado: (2024)
The Case for HTML First Web Development
por: Vepsäläinen, Juho
Publicado: (2026)
por: Vepsäläinen, Juho
Publicado: (2026)
Physics teaching with simulations in HTML5
por: Ema Aveleyra
Publicado: (2016)
por: Ema Aveleyra
Publicado: (2016)
Instruction on the Web: Authoring Tutorials in HTML.
por: Whitley, Katherine M.
Publicado: (1996)
por: Whitley, Katherine M.
Publicado: (1996)
Investigating Public Fine-Tuning Datasets: A Complex Review of Current Practices from a Construction Perspective
por: Ma, Runyuan, et al.
Publicado: (2024)
por: Ma, Runyuan, et al.
Publicado: (2024)
Web-Based Forms for ILL Using HTML.
por: McCloskey, James.
Publicado: (1996)
por: McCloskey, James.
Publicado: (1996)
HTMLCure: Turning Browser Experience into State Guided Repair for Interactive HTML
por: Wu, Jiajun, et al.
Publicado: (2026)
por: Wu, Jiajun, et al.
Publicado: (2026)
A Taxonomy of Testable HTML5 Canvas Issues
por: Macklon, Finlay, et al.
Publicado: (2022)
por: Macklon, Finlay, et al.
Publicado: (2022)
HTML Structure Exploration in 3D Software Cities
por: Hansen, Malte, et al.
Publicado: (2025)
por: Hansen, Malte, et al.
Publicado: (2025)
Domine HTML y DHTML / José López Quijado
por: López Quijado, José
por: López Quijado, José
Domine HTML y DHTML / / José López Quijado
por: López Quijado, José
Publicado: (2008)
por: López Quijado, José
Publicado: (2008)
Domine HTML y DHTML / / José López Quijado
por: López Quijado, José
Publicado: (2008)
por: López Quijado, José
Publicado: (2008)
Magyar Közlöny és rokonai 1945-2022 HTML, ZIP
por: Görög, György
Publicado: (2024)
por: Görög, György
Publicado: (2024)
Second Curve Whitepaper 01 | From HTML to Structural Language
por: Wei, Xinliang
Publicado: (2025)
por: Wei, Xinliang
Publicado: (2025)
Domine HTML y DHTML : Ejemplos / / José López Quijado
por: López Quijado, José
Publicado: (2003)
por: López Quijado, José
Publicado: (2003)
Using HTML / Tom Savola, Alan Westenbroek, Joseph Heck
por: Savola, Tom
por: Savola, Tom
HTML y XHTML / / Chuck Musciano y Bill Kennedy
por: Musciano, Chuck
por: Musciano, Chuck
Scanning HTML at Tens of Gigabytes per Second on ARM Processors
por: Lemire, Daniel
Publicado: (2025)
por: Lemire, Daniel
Publicado: (2025)
Video and HTML: Testing Online Tutorial Formats with Biology Students
por: Craig, Cindy L., et al.
Publicado: (2013)
por: Craig, Cindy L., et al.
Publicado: (2013)
Phishing Website Detection through Multi-Model Analysis of HTML Content
por: Çolhak, Furkan, et al.
Publicado: (2024)
por: Çolhak, Furkan, et al.
Publicado: (2024)
Desarrollo Web con HTML 5 / Francisco J. Arce Anguiano
por: Arce Anguiano, Francisco Javier
Publicado: (2016)
por: Arce Anguiano, Francisco Javier
Publicado: (2016)
LLM-Driven Optimization of HTML Structure to Support Screen Reader Navigation
por: Yu, Yaman, et al.
Publicado: (2025)
por: Yu, Yaman, et al.
Publicado: (2025)
Unlocking the conversion of Web Screenshots into HTML Code with the WebSight Dataset
por: Laurençon, Hugo, et al.
Publicado: (2024)
por: Laurençon, Hugo, et al.
Publicado: (2024)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
por: Xu, Pengxin, et al.
Publicado: (2026)
por: Xu, Pengxin, et al.
Publicado: (2026)
PosterVerse: A Full-Workflow Framework for Commercial-Grade Poster Generation with HTML-Based Scalable Typography
por: Liu, Junle, et al.
Publicado: (2026)
por: Liu, Junle, et al.
Publicado: (2026)
Parser-Oriented Structural Refinement for a Stable Layout Interface in Document Parsing
por: Liu, Fuyuan, et al.
Publicado: (2026)
por: Liu, Fuyuan, et al.
Publicado: (2026)
MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants
por: Zhang, Zuhao, et al.
Publicado: (2026)
por: Zhang, Zuhao, et al.
Publicado: (2026)
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
por: Peng, Jiahui, et al.
Publicado: (2025)
por: Peng, Jiahui, et al.
Publicado: (2025)
Scaling Accessible Mathematics on arXiv: HTML Conversion and MathML 4
por: Ginev, Deyan, et al.
Publicado: (2026)
por: Ginev, Deyan, et al.
Publicado: (2026)
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON
por: Wang, Feng, et al.
Publicado: (2025)
por: Wang, Feng, et al.
Publicado: (2025)
La biblia de HTML 4 [Disco compacto] / Molly E. Holzschlang
por: Holzschlag, Molly E
por: Holzschlag, Molly E
HTML papers on arXiv -- why it is important, and how we made it happen
por: Frankston, Charles, et al.
Publicado: (2024)
por: Frankston, Charles, et al.
Publicado: (2024)
CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers
por: Chen, Weidong, et al.
Publicado: (2026)
por: Chen, Weidong, et al.
Publicado: (2026)
WebGuard++:Interpretable Malicious URL Detection via Bidirectional Fusion of HTML Subgraphs and Multi-Scale Convolutional BERT
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
WebChecker: A Versatile EVL Plugin for Validating HTML Pages with Bootstrap Frameworks
por: Cherukuri, Milind
Publicado: (2025)
por: Cherukuri, Milind
Publicado: (2025)
Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining
por: Li, Jeffrey, et al.
Publicado: (2026)
por: Li, Jeffrey, et al.
Publicado: (2026)
AccessGuru: Leveraging LLMs to Detect and Correct Web Accessibility Violations in HTML Code
por: Fathallah, Nadeen, et al.
Publicado: (2025)
por: Fathallah, Nadeen, et al.
Publicado: (2025)
Decoding Latent Attack Surfaces in LLMs: Prompt Injection via HTML in Web Summarization
por: Verma, Ishaan, et al.
Publicado: (2025)
por: Verma, Ishaan, et al.
Publicado: (2025)
Método heurístico para la anotación automática de Imágenes en documentos HTML
por: Jorge Luis Betancourt González
Publicado: (2015)
por: Jorge Luis Betancourt González
Publicado: (2015)
Ejemplares similares
-
Dripper: Token-Efficient Main HTML Extraction with a Lightweight LM
por: Liu, Mengjie, et al.
Publicado: (2025) -
HTML-LSTM: Information Extraction from HTML Tables in Web Pages using Tree-Structured LSTM
por: Kawamura, Kazuki, et al.
Publicado: (2024) -
The Case for HTML First Web Development
por: Vepsäläinen, Juho
Publicado: (2026) -
Physics teaching with simulations in HTML5
por: Ema Aveleyra
Publicado: (2016) -
Instruction on the Web: Authoring Tutorials in HTML.
por: Whitley, Katherine M.
Publicado: (1996)