olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Poznanski, Jake, Rangapur, Aman, Borchardt, Jon, Dunkelberger, Jason, Huff, Regan, Lin, Daniel, Wilhelm, Christopher, Lo, Kyle, Soldaini, Luca |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
olmOCR 2: Unit Test Rewards for Document OCR
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
von: Poznanski, Jake, et al.
Veröffentlicht: (2025)
The Battle of LLMs: A Comparative Study in Conversational QA Tasks
von: Rangapur, Aryan, et al.
Veröffentlicht: (2024)
von: Rangapur, Aryan, et al.
Veröffentlicht: (2024)
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
von: Rangapur, Aman, et al.
Veröffentlicht: (2023)
von: Rangapur, Aman, et al.
Veröffentlicht: (2023)
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
von: Wang, Haoran, et al.
Veröffentlicht: (2024)
von: Wang, Haoran, et al.
Veröffentlicht: (2024)
OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens
von: Liu, Jiacheng, et al.
Veröffentlicht: (2025)
von: Liu, Jiacheng, et al.
Veröffentlicht: (2025)
Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research
von: Soldaini, Luca, et al.
Veröffentlicht: (2024)
von: Soldaini, Luca, et al.
Veröffentlicht: (2024)
How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs
von: Chang, Yapei, et al.
Veröffentlicht: (2026)
von: Chang, Yapei, et al.
Veröffentlicht: (2026)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
von: Baral, Sami, et al.
Veröffentlicht: (2025)
von: Baral, Sami, et al.
Veröffentlicht: (2025)
Automatic Detection of Research Values from Scientific Abstracts Across Computer Science Subfields
von: Jiang, Hang, et al.
Veröffentlicht: (2025)
von: Jiang, Hang, et al.
Veröffentlicht: (2025)
RouterRetriever: Routing over a Mixture of Expert Embedding Models
von: Lee, Hyunji, et al.
Veröffentlicht: (2024)
von: Lee, Hyunji, et al.
Veröffentlicht: (2024)
Mathfish: Evaluating Language Model Math Reasoning via Grounding in Educational Curricula
von: Lucy, Li, et al.
Veröffentlicht: (2024)
von: Lucy, Li, et al.
Veröffentlicht: (2024)
Exploring Fusion Strategies for Multimodal Vision-Language Systems
von: Willis, Regan, et al.
Veröffentlicht: (2025)
von: Willis, Regan, et al.
Veröffentlicht: (2025)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
von: Shao, Rulin, et al.
Veröffentlicht: (2024)
von: Shao, Rulin, et al.
Veröffentlicht: (2024)
A useful representation of TESS light curves
von: Poznanski, Dovi
Veröffentlicht: (2026)
von: Poznanski, Dovi
Veröffentlicht: (2026)
Organize the Web: Constructing Domains Enhances Pre-Training Data Curation
von: Wettig, Alexander, et al.
Veröffentlicht: (2025)
von: Wettig, Alexander, et al.
Veröffentlicht: (2025)
KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions
von: Xu, Fangyuan, et al.
Veröffentlicht: (2024)
von: Xu, Fangyuan, et al.
Veröffentlicht: (2024)
LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models
von: Aman, Shaik
Veröffentlicht: (2026)
von: Aman, Shaik
Veröffentlicht: (2026)
LoPace: A Lossless Optimized Prompt Accurate Compression Engine for Large Language Model Applications
von: Ulla, Aman
Veröffentlicht: (2026)
von: Ulla, Aman
Veröffentlicht: (2026)
Machine Translation for Ge'ez Language
von: Wassie, Aman Kassahun
Veröffentlicht: (2023)
von: Wassie, Aman Kassahun
Veröffentlicht: (2023)
Bayesian model mixing with multi-reference energy density functional
von: Sharma, Aman, et al.
Veröffentlicht: (2024)
von: Sharma, Aman, et al.
Veröffentlicht: (2024)
Infini-gram: Scaling Unbounded n-gram Language Models to a Trillion Tokens
von: Liu, Jiacheng, et al.
Veröffentlicht: (2024)
von: Liu, Jiacheng, et al.
Veröffentlicht: (2024)
Contrast: A Hybrid Architecture of Transformers and State Space Models for Low-Level Vision
von: Urumbekov, Aman, et al.
Veröffentlicht: (2025)
von: Urumbekov, Aman, et al.
Veröffentlicht: (2025)
Guiding Vision-Language Model Selection for Visual Question-Answering Across Tasks, Domains, and Knowledge Types
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
von: Sinha, Neelabh, et al.
Veröffentlicht: (2024)
Understanding Inference-Time Token Allocation and Coverage Limits in Agentic Hardware Verification
von: Patel, Vihaan, et al.
Veröffentlicht: (2026)
von: Patel, Vihaan, et al.
Veröffentlicht: (2026)
2 OLMo 2 Furious
von: OLMo, Team, et al.
Veröffentlicht: (2024)
von: OLMo, Team, et al.
Veröffentlicht: (2024)
EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages
von: Sharma, Aman, et al.
Veröffentlicht: (2026)
von: Sharma, Aman, et al.
Veröffentlicht: (2026)
ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset
von: DatologyAI, et al.
Veröffentlicht: (2026)
von: DatologyAI, et al.
Veröffentlicht: (2026)
How Culturally Aware are Vision-Language Models?
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
von: Burda-Lassen, Olena, et al.
Veröffentlicht: (2024)
Olmix: A Framework for Data Mixing Throughout LM Development
von: Chen, Mayee F., et al.
Veröffentlicht: (2026)
von: Chen, Mayee F., et al.
Veröffentlicht: (2026)
GeoCoder: Solving Geometry Problems by Generating Modular Code through Vision-Language Models
von: Sharma, Aditya, et al.
Veröffentlicht: (2024)
von: Sharma, Aditya, et al.
Veröffentlicht: (2024)
Leveraging Large Language Models for Web Scraping
von: Ahluwalia, Aman, et al.
Veröffentlicht: (2024)
von: Ahluwalia, Aman, et al.
Veröffentlicht: (2024)
CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding
von: Shi, Yuling, et al.
Veröffentlicht: (2026)
von: Shi, Yuling, et al.
Veröffentlicht: (2026)
Improved Alignment of Modalities in Large Vision Language Models
von: Jangra, Kartik, et al.
Veröffentlicht: (2025)
von: Jangra, Kartik, et al.
Veröffentlicht: (2025)
State of AI: An Empirical 100 Trillion Token Study with OpenRouter
von: Aubakirova, Malika, et al.
Veröffentlicht: (2026)
von: Aubakirova, Malika, et al.
Veröffentlicht: (2026)
Zyda-2: a 5 Trillion Token High-Quality Dataset
von: Tokpanov, Yury, et al.
Veröffentlicht: (2024)
von: Tokpanov, Yury, et al.
Veröffentlicht: (2024)
Anticipatory Gains and Event-Driven Losses in Blockchain-Based Fan Tokens: Evidence from the FIFA World Cup
von: Saggu, Aman, et al.
Veröffentlicht: (2024)
von: Saggu, Aman, et al.
Veröffentlicht: (2024)
test
von: Goel, Aman
Veröffentlicht: (2025)
von: Goel, Aman
Veröffentlicht: (2025)
Sarvaprakataviveka
von: Chawla, Aman
Veröffentlicht: (2025)
von: Chawla, Aman
Veröffentlicht: (2025)
RooAgent: An LLM Agent for Root-Based High Energy Physics Analysis
von: Desai, Aman
Veröffentlicht: (2026)
von: Desai, Aman
Veröffentlicht: (2026)
Decoupling Forward Aggregation and Backward Propagation for Robust Neural Computation: a Python Study
von: Chawla, Aman
Veröffentlicht: (2026)
von: Chawla, Aman
Veröffentlicht: (2026)
Ähnliche Einträge
-
olmOCR 2: Unit Test Rewards for Document OCR
von: Poznanski, Jake, et al.
Veröffentlicht: (2025) -
The Battle of LLMs: A Comparative Study in Conversational QA Tasks
von: Rangapur, Aryan, et al.
Veröffentlicht: (2024) -
Fin-Fact: A Benchmark Dataset for Multimodal Financial Fact Checking and Explanation Generation
von: Rangapur, Aman, et al.
Veröffentlicht: (2023) -
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
von: Wang, Haoran, et al.
Veröffentlicht: (2024) -
OLMoTrace: Tracing Language Model Outputs Back to Trillions of Training Tokens
von: Liu, Jiacheng, et al.
Veröffentlicht: (2025)