BigDocs: An Open Dataset for Training Multimodal Models on Document and Code Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Rodriguez, Juan, Jian, Xiangru, Panigrahi, Siba Smarak, Zhang, Tianyu, Feizi, Aarash, Puri, Abhay, Kalkunte, Akshay, Savard, François, Masry, Ahmed, Nayak, Shravan, Awal, Rabiul, Massoud, Mahsa, Abaskohi, Amirhossein, Li, Zichao, Wang, Suyuchen, Noël, Pierre-André, Richter, Mats Leon, Vadacchino, Saverio, Agarwal, Shubham, Biswas, Sanket, Shanian, Sara, Zhang, Ying, Bolger, Noah, MacDonald, Kurt, Fauvel, Simon, Tejaswi, Sathwik, Sunkara, Srinivas, Monteiro, Joao, Dvijotham, Krishnamurthy DJ, Scholak, Torsten, Chapados, Nicolas, Kharagani, Sepideh, Hughes, Sean, Özsu, M., Reddy, Siva, Pedersoli, Marco, Bengio, Yoshua, Pal, Christopher, Laradji, Issam, Gella, Spandana, Taslakian, Perouz, Vazquez, David, Rajeswar, Sai |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
por: Wang, Suyuchen, et al.
Publicado: (2025)
por: Wang, Suyuchen, et al.
Publicado: (2025)
MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents
por: Gurung, Alexander, et al.
Publicado: (2026)
por: Gurung, Alexander, et al.
Publicado: (2026)
StarFlow: Generating Structured Workflow Outputs From Sketch Images
por: Bechard, Patrice, et al.
Publicado: (2025)
por: Bechard, Patrice, et al.
Publicado: (2025)
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
por: Abaskohi, Amirhossein, et al.
Publicado: (2024)
por: Abaskohi, Amirhossein, et al.
Publicado: (2024)
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
por: Masry, Ahmed, et al.
Publicado: (2025)
por: Masry, Ahmed, et al.
Publicado: (2025)
WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation
por: Awal, Rabiul, et al.
Publicado: (2025)
por: Awal, Rabiul, et al.
Publicado: (2025)
UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction
por: Nayak, Shravan, et al.
Publicado: (2025)
por: Nayak, Shravan, et al.
Publicado: (2025)
ColMate: Contrastive Late Interaction and Masked Text for Multimodal Document Retrieval
por: Masry, Ahmed, et al.
Publicado: (2025)
por: Masry, Ahmed, et al.
Publicado: (2025)
Rendering-Aware Reinforcement Learning for Vector Graphics Generation
por: Rodriguez, Juan A., et al.
Publicado: (2025)
por: Rodriguez, Juan A., et al.
Publicado: (2025)
PairBench: Are Vision-Language Models Reliable at Comparing What They See?
por: Feizi, Aarash, et al.
Publicado: (2025)
por: Feizi, Aarash, et al.
Publicado: (2025)
InsightBench: Evaluating Business Analytics Agents Through Multi-Step Insight Generation
por: Sahu, Gaurav, et al.
Publicado: (2024)
por: Sahu, Gaurav, et al.
Publicado: (2024)
Scope: Selective Cross-modal Orchestration of Visual Perception Experts
por: Zhang, Tianyu, et al.
Publicado: (2025)
por: Zhang, Tianyu, et al.
Publicado: (2025)
Mem-$π$: Adaptive Memory through Learning When and What to Generate
por: Wang, Xiaoqiang, et al.
Publicado: (2026)
por: Wang, Xiaoqiang, et al.
Publicado: (2026)
CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents
por: Jian, Xiangru, et al.
Publicado: (2026)
por: Jian, Xiangru, et al.
Publicado: (2026)
Grounding Computer Use Agents on Human Demonstrations
por: Feizi, Aarash, et al.
Publicado: (2025)
por: Feizi, Aarash, et al.
Publicado: (2025)
VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text
por: Zhang, Tianyu, et al.
Publicado: (2024)
por: Zhang, Tianyu, et al.
Publicado: (2024)
VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing
por: Rodriguez, Juan, et al.
Publicado: (2026)
por: Rodriguez, Juan, et al.
Publicado: (2026)
RepLiQA: A Question-Answering Dataset for Benchmarking LLMs on Unseen Reference Content
por: Monteiro, Joao, et al.
Publicado: (2024)
por: Monteiro, Joao, et al.
Publicado: (2024)
AgentAda: Skill-Adaptive Data Analytics for Tailored Insight Discovery
por: Abaskohi, Amirhossein, et al.
Publicado: (2025)
por: Abaskohi, Amirhossein, et al.
Publicado: (2025)
BigCharts-R1: Enhanced Chart Reasoning with Visual Reinforcement Finetuning
por: Masry, Ahmed, et al.
Publicado: (2025)
por: Masry, Ahmed, et al.
Publicado: (2025)
Efficient Dynamics Modeling in Interactive Environments with Koopman Theory
por: Mondal, Arnab Kumar, et al.
Publicado: (2023)
por: Mondal, Arnab Kumar, et al.
Publicado: (2023)
Improved Canonicalization for Model Agnostic Equivariance
por: Panigrahi, Siba Smarak, et al.
Publicado: (2024)
por: Panigrahi, Siba Smarak, et al.
Publicado: (2024)
DRBench: A Realistic Benchmark for Enterprise Deep Research
por: Abaskohi, Amirhossein, et al.
Publicado: (2025)
por: Abaskohi, Amirhossein, et al.
Publicado: (2025)
HeurekaBench: A Benchmarking Framework for AI Co-scientist
por: Panigrahi, Siba Smarak, et al.
Publicado: (2026)
por: Panigrahi, Siba Smarak, et al.
Publicado: (2026)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
por: Monteiro, João, et al.
Publicado: (2024)
por: Monteiro, João, et al.
Publicado: (2024)
Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA
por: Maheshwary, Rishabh, et al.
Publicado: (2025)
por: Maheshwary, Rishabh, et al.
Publicado: (2025)
BiXSE: Improving Dense Retrieval via Probabilistic Graded Relevance Distillation
por: Tsirigotis, Christos, et al.
Publicado: (2025)
por: Tsirigotis, Christos, et al.
Publicado: (2025)
StarVector: Generating Scalable Vector Graphics Code from Images and Text
por: Rodriguez, Juan A., et al.
Publicado: (2023)
por: Rodriguez, Juan A., et al.
Publicado: (2023)
Unsupervised Process Reward Models
por: Gadetsky, Artyom, et al.
Publicado: (2026)
por: Gadetsky, Artyom, et al.
Publicado: (2026)
Whittaker-Henderson smoother for long satellite image time series interpolation
por: Fauvel, Mathieu
Publicado: (2026)
por: Fauvel, Mathieu
Publicado: (2026)
Utilizing Multicultural Reading Resource Materials To Improve Reading Motivation and Performance among High School Students.
por: Fauvel, Monique
Publicado: (1991)
por: Fauvel, Monique
Publicado: (1991)
Which CE requirement applies to me? / Sheila J. Kalkunte
por: Kalkunte, Sheila J
por: Kalkunte, Sheila J
Hierarchical Retrieval at Scale: Bridging Transparency and Efficiency
por: Gupta, Shubham, et al.
Publicado: (2025)
por: Gupta, Shubham, et al.
Publicado: (2025)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
por: Yang, Qian, et al.
Publicado: (2026)
por: Yang, Qian, et al.
Publicado: (2026)
Learning to Defer for Causal Discovery with Imperfect Experts
por: Clivio, Oscar, et al.
Publicado: (2025)
por: Clivio, Oscar, et al.
Publicado: (2025)
IntentGPT: Few-shot Intent Discovery with Large Language Models
por: Rodriguez, Juan A., et al.
Publicado: (2024)
por: Rodriguez, Juan A., et al.
Publicado: (2024)
Textes inédits concernant les Tortues de terre gigantesques de l'île Juan de Nove (I. Farquhar) [océan Indien]
por: Fauvel, A A
Publicado: (1900)
por: Fauvel, A A
Publicado: (1900)
Using Vocabulary Drills Incorporating Assimilated Foreign Words To Improve Reading Competence in a Sophomore Class.
por: Fauvel, Monique Crandell
Publicado: (1990)
por: Fauvel, Monique Crandell
Publicado: (1990)
The Invention Factory: Thomas Edison's Laboratories. Teaching with Historic Places.
por: Bolger, Benjamin
Publicado: (1999)
por: Bolger, Benjamin
Publicado: (1999)
Foundations and Scoping of Data Science
por: Özsu, M. Tamer
Publicado: (2023)
por: Özsu, M. Tamer
Publicado: (2023)
Ejemplares similares
-
Improving GUI Grounding with Explicit Position-to-Coordinate Mapping
por: Wang, Suyuchen, et al.
Publicado: (2025) -
MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents
por: Gurung, Alexander, et al.
Publicado: (2026) -
StarFlow: Generating Structured Workflow Outputs From Sketch Images
por: Bechard, Patrice, et al.
Publicado: (2025) -
FM2DS: Few-Shot Multimodal Multihop Data Synthesis with Knowledge Distillation for Question Answering
por: Abaskohi, Amirhossein, et al.
Publicado: (2024) -
AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
por: Masry, Ahmed, et al.
Publicado: (2025)