olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Poznanski, Jake, Rangapur, Aman, Borchardt, Jon, Dunkelberger, Jason, Huff, Regan, Lin, Daniel, Wilhelm, Christopher, Lo, Kyle, Soldaini, Luca |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
di: Poznanski, Jake, et al.
Pubblicazione: (2025)
The Battle of LLMs: A Comparative Study in Conversational QA Tasks
di: Rangapur, Aryan, et al.
Pubblicazione: (2024)
di: Rangapur, Aryan, et al.
Pubblicazione: (2024)
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
di: Rangapur, Aman, et al.
Pubblicazione: (2023)
di: Rangapur, Aman, et al.
Pubblicazione: (2023)
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
di: Wang, Haoran, et al.
Pubblicazione: (2024)
di: Wang, Haoran, et al.
Pubblicazione: (2024)
OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
di: Soldaini, Luca, et al.
Pubblicazione: (2024)
How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs
di: Chang, Yapei, et al.
Pubblicazione: (2026)
di: Chang, Yapei, et al.
Pubblicazione: (2026)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
di: Baral, Sami, et al.
Pubblicazione: (2025)
di: Baral, Sami, et al.
Pubblicazione: (2025)
Automatic Detection of Research Values from Scientific Abstracts Across Computer Science Subfields
di: Jiang, Hang, et al.
Pubblicazione: (2025)
di: Jiang, Hang, et al.
Pubblicazione: (2025)
RouterRetriever: Routing over a Mixture of Expert Embedding Models
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
di: Lee, Hyunji, et al.
Pubblicazione: (2024)
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
di: Lucy, Li, et al.
Pubblicazione: (2024)
di: Lucy, Li, et al.
Pubblicazione: (2024)
Exploring Fusion Strategies for Multimodal Vision-Language Systems
di: Willis, Regan, et al.
Pubblicazione: (2025)
di: Willis, Regan, et al.
Pubblicazione: (2025)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
di: Shao, Rulin, et al.
Pubblicazione: (2024)
di: Shao, Rulin, et al.
Pubblicazione: (2024)
A useful representation of TESS light curves
di: Poznanski, Dovi
Pubblicazione: (2026)
di: Poznanski, Dovi
Pubblicazione: (2026)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
di: Wettig, Alexander, et al.
Pubblicazione: (2025)
KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions
di: Xu, Fangyuan, et al.
Pubblicazione: (2024)
di: Xu, Fangyuan, et al.
Pubblicazione: (2024)
LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models
di: Aman, Shaik
Pubblicazione: (2026)
di: Aman, Shaik
Pubblicazione: (2026)
LoPace: A Lossless Optimized Prompt Accurate Compression Engine for Large Language Model Applications
di: Ulla, Aman
Pubblicazione: (2026)
di: Ulla, Aman
Pubblicazione: (2026)
Machine Translation for Ge'ez Language
di: Wassie, Aman Kassahun
Pubblicazione: (2023)
di: Wassie, Aman Kassahun
Pubblicazione: (2023)
Bayesian model mixing with multi-reference energy density functional
di: Sharma, Aman, et al.
Pubblicazione: (2024)
di: Sharma, Aman, et al.
Pubblicazione: (2024)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
di: Liu, Jiacheng, et al.
Pubblicazione: (2024)
Contrast: A Hybrid Architecture of Transformers and State Space Models for Low-Level Vision
di: Urumbekov, Aman, et al.
Pubblicazione: (2025)
di: Urumbekov, Aman, et al.
Pubblicazione: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
di: Sinha, Neelabh, et al.
Pubblicazione: (2024)
Understanding Inference-Time Token Allocation and Coverage Limits in Agentic Hardware Verification
di: Patel, Vihaan, et al.
Pubblicazione: (2026)
di: Patel, Vihaan, et al.
Pubblicazione: (2026)
2 OLMo 2 Furious
di: OLMo, Team, et al.
Pubblicazione: (2024)
di: OLMo, Team, et al.
Pubblicazione: (2024)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
di: Sharma, Aman, et al.
Pubblicazione: (2026)
di: Sharma, Aman, et al.
Pubblicazione: (2026)
How Culturally Aware are Vision-Language Models?
di: Burda-Lassen, Olena, et al.
Pubblicazione: (2024)
di: Burda-Lassen, Olena, et al.
Pubblicazione: (2024)
ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset
di: DatologyAI, et al.
Pubblicazione: (2026)
di: DatologyAI, et al.
Pubblicazione: (2026)
Olmix: A Framework for Data Mixing Throughout LM Development
di: Chen, Mayee F., et al.
Pubblicazione: (2026)
di: Chen, Mayee F., et al.
Pubblicazione: (2026)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
di: Sharma, Aditya, et al.
Pubblicazione: (2024)
Leveraging Large Language Models for Web Scraping
di: Ahluwalia, Aman, et al.
Pubblicazione: (2024)
di: Ahluwalia, Aman, et al.
Pubblicazione: (2024)
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
di: Shi, Yuling, et al.
Pubblicazione: (2026)
di: Shi, Yuling, et al.
Pubblicazione: (2026)
Improved Alignment of Modalities in Large Vision Language Models
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
di: Jangra, Kartik, et al.
Pubblicazione: (2025)
State of AI: An Empirical 100 Trillion Token Study with OpenRouter
di: Aubakirova, Malika, et al.
Pubblicazione: (2026)
di: Aubakirova, Malika, et al.
Pubblicazione: (2026)
Zyda-2: a 5 Trillion Token High-Quality Dataset
di: Tokpanov, Yury, et al.
Pubblicazione: (2024)
di: Tokpanov, Yury, et al.
Pubblicazione: (2024)
Anticipatory Gains and Event-Driven Losses in Blockchain-Based Fan Tokens: Evidence from the FIFA World Cup
di: Saggu, Aman, et al.
Pubblicazione: (2024)
di: Saggu, Aman, et al.
Pubblicazione: (2024)
test
di: Goel, Aman
Pubblicazione: (2025)
di: Goel, Aman
Pubblicazione: (2025)
Sarvaprakataviveka
di: Chawla, Aman
Pubblicazione: (2025)
di: Chawla, Aman
Pubblicazione: (2025)
RooAgent: An LLM Agent for Root-Based High Energy Physics Analysis
di: Desai, Aman
Pubblicazione: (2026)
di: Desai, Aman
Pubblicazione: (2026)
Decoupling Forward Aggregation and Backward Propagation for Robust Neural Computation: a Python Study
di: Chawla, Aman
Pubblicazione: (2026)
di: Chawla, Aman
Pubblicazione: (2026)
Documenti analoghi
-
olmOCR 2: Unit Test Rewards for Document OCR
di: Poznanski, Jake, et al.
Pubblicazione: (2025) -
The Battle of LLMs: A Comparative Study in Conversational QA Tasks
di: Rangapur, Aryan, et al.
Pubblicazione: (2024) -
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
di: Rangapur, Aman, et al.
Pubblicazione: (2023) -
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
di: Wang, Haoran, et al.
Pubblicazione: (2024) -
OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens
di: Liu, Jiacheng, et al.
Pubblicazione: (2025)