Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Baode, Wu, Biao, Li, Weizhen, Fang, Meng, Huang, Zuming, Huang, Jun, Wang, Haozhe, Liang, Yanjie, Chen, Ling, Chu, Wei, Qi, Yuan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach
par: Wu, Biao, et autres
Publié: (2026)
par: Wu, Biao, et autres
Publié: (2026)
Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems
par: Yan, Junfeng, et autres
Publié: (2025)
par: Yan, Junfeng, et autres
Publié: (2025)
PaperVoyager : Building Interactive Web with Visual Language Models
par: Dai, Dasen, et autres
Publié: (2026)
par: Dai, Dasen, et autres
Publié: (2026)
I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications
par: Dai, Dasen, et autres
Publié: (2026)
par: Dai, Dasen, et autres
Publié: (2026)
DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models
par: Wu, Biao, et autres
Publié: (2026)
par: Wu, Biao, et autres
Publié: (2026)
Toward Architecture-Aware Evaluation Metrics for LLM Agents
par: Souza, Débora, et autres
Publié: (2026)
par: Souza, Débora, et autres
Publié: (2026)
Remote Sensing-Oriented World Model
par: Lu, Yuxi, et autres
Publié: (2025)
par: Lu, Yuxi, et autres
Publié: (2025)
Parsing Akkadian Verbs with Prolog
par: Macks, Aaron
Publié: (2024)
par: Macks, Aaron
Publié: (2024)
Automatic Prediction of the Performance of Every Parser
par: Biçici, Ergun
Publié: (2024)
par: Biçici, Ergun
Publié: (2024)
HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs
par: Cherif, Ahmed
Publié: (2026)
par: Cherif, Ahmed
Publié: (2026)
Enhancing Document AI Data Generation Through Graph-Based Synthetic Layouts
par: Agarwal, Amit, et autres
Publié: (2024)
par: Agarwal, Amit, et autres
Publié: (2024)
PromptSAM+: Malware Detection based on Prompt Segment Anything Model
par: Wei, Xingyuan, et autres
Publié: (2024)
par: Wei, Xingyuan, et autres
Publié: (2024)
KSHSeek: Data-Driven Approaches to Mitigating and Detecting Knowledge-Shortcut Hallucinations in Generative Models
par: Liu, Zhongxin, et autres
Publié: (2025)
par: Liu, Zhongxin, et autres
Publié: (2025)
Documentation Retrieval Improves Planning Language Generation
par: Wang, Renxiang, et autres
Publié: (2025)
par: Wang, Renxiang, et autres
Publié: (2025)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
par: Chua, Jaymari, et autres
Publié: (2025)
par: Chua, Jaymari, et autres
Publié: (2025)
CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems
par: Sun, Kangkang, et autres
Publié: (2026)
par: Sun, Kangkang, et autres
Publié: (2026)
UIPress: Bringing Optical Token Compression to UI-to-Code Generation
par: Dai, Dasen, et autres
Publié: (2026)
par: Dai, Dasen, et autres
Publié: (2026)
Fine-tuning of Large Language Models for Constituency Parsing Using a Sequence to Sequence Approach
par: Delgado, Francisco Jose Cortes, et autres
Publié: (2025)
par: Delgado, Francisco Jose Cortes, et autres
Publié: (2025)
Circularity and Symmetries of $p$ and $p^{2}$-polygons
par: Haag, Rolf
Publié: (2025)
par: Haag, Rolf
Publié: (2025)
AdaDec: A Uncertainty-Guided Lookahead Decoding Framework for LLM-Based Code Generation
par: He, Kaifeng, et autres
Publié: (2025)
par: He, Kaifeng, et autres
Publié: (2025)
PDFMathTranslate: Scientific Document Translation Preserving Layouts
par: Ouyang, Rongxin, et autres
Publié: (2025)
par: Ouyang, Rongxin, et autres
Publié: (2025)
Taking Flight with Dialogue: Enabling Natural Language Control for PX4-based Drone Agent
par: Lim, Shoon Kit, et autres
Publié: (2025)
par: Lim, Shoon Kit, et autres
Publié: (2025)
Story2Proposal: A Scaffold for Structured Scientific Paper Writing
par: Qian, Zhuoyang, et autres
Publié: (2026)
par: Qian, Zhuoyang, et autres
Publié: (2026)
SCULPT: Constraint-Guided Pruned MCTS that Carves Efficient Paths for Mathematical Reasoning
par: Fang, Qitong, et autres
Publié: (2026)
par: Fang, Qitong, et autres
Publié: (2026)
Spatially-Aware Speaker for Vision-and-Language Navigation Instruction Generation
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
par: Gopinathan, Muraleekrishna, et autres
Publié: (2024)
elsciRL: Integrating Language Solutions into Reinforcement Learning Problem Settings
par: Osborne, Philip, et autres
Publié: (2025)
par: Osborne, Philip, et autres
Publié: (2025)
EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning
par: Sauter, Andreas, et autres
Publié: (2026)
par: Sauter, Andreas, et autres
Publié: (2026)
Harnessing Negative Signals: Reinforcement Distillation from Teacher Data for LLM Reasoning
par: Xu, Shuyao, et autres
Publié: (2025)
par: Xu, Shuyao, et autres
Publié: (2025)
JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR
par: Chen, Xinjie, et autres
Publié: (2026)
par: Chen, Xinjie, et autres
Publié: (2026)
SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling
par: Aharon, Eliya Naomi, et autres
Publié: (2026)
par: Aharon, Eliya Naomi, et autres
Publié: (2026)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews
par: Li, Bowen, et autres
Publié: (2026)
par: Li, Bowen, et autres
Publié: (2026)
ContextBench: A Benchmark for Context Retrieval in Coding Agents
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
Pharos-ESG: A Framework for Multimodal Parsing, Contextual Narration, and Hierarchical Labeling of ESG Report
par: Chen, Yan, et autres
Publié: (2025)
par: Chen, Yan, et autres
Publié: (2025)
Mobile Phone Sensor-based Nigerian Driving Dataset to Detect Alcohol-influenced Behaviours
par: Thompson, Iniakpokeikiye Peter, et autres
Publié: (2025)
par: Thompson, Iniakpokeikiye Peter, et autres
Publié: (2025)
Random Heterogeneous Neurochaos Learning Architecture for Data Classification
par: S, Remya Ajai A, et autres
Publié: (2024)
par: S, Remya Ajai A, et autres
Publié: (2024)
The Hidden Attention of Mamba Models
par: Ali, Ameen, et autres
Publié: (2024)
par: Ali, Ameen, et autres
Publié: (2024)
Retrieval and Augmentation of Domain Knowledge for Text-to-SQL Semantic Parsing
par: Patwardhan, Manasi, et autres
Publié: (2025)
par: Patwardhan, Manasi, et autres
Publié: (2025)
Layer-Aware Embedding Fusion for LLMs in Text Classifications
par: Gwak, Jiho, et autres
Publié: (2025)
par: Gwak, Jiho, et autres
Publié: (2025)
Documents similaires
-
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025) -
Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach
par: Wu, Biao, et autres
Publié: (2026) -
Automotive-ENV: Benchmarking Multimodal Agents in Vehicle Interface Systems
par: Yan, Junfeng, et autres
Publié: (2025) -
PaperVoyager : Building Interactive Web with Visual Language Models
par: Dai, Dasen, et autres
Publié: (2026) -
I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications
par: Dai, Dasen, et autres
Publié: (2026)