PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Junjie, Zhang, Yuxiang, Liu, Minghao, Zhang, Yin, Ji, Yatai, Xuan, Weihao, Lin, Nie, Zhu, Kang, Lin, Zhiqiang, Ren, Yiming, Jiang, Chunyang, Yu, Yiyao, Wang, Zekun, Wang, Tiezhen, Huang, Wenhao, Fu, Jie, Lin, Qunshu, Yang, Yujiu, Zhang, Ge, Yuan, Ruibin, Chen, Bei, Chen, Wenhu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
by: Ren, Yiming, et al.
Published: (2026)
by: Ren, Yiming, et al.
Published: (2026)
Solving Math Word Problems via Cooperative Reasoning induced Language Models
by: Zhu, Xinyu, et al.
Published: (2022)
by: Zhu, Xinyu, et al.
Published: (2022)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
by: Ren, Yiming, et al.
Published: (2026)
by: Ren, Yiming, et al.
Published: (2026)
Decentralized Physical Infrastructure Network (DePIN): Challenges and Opportunities
by: Lin, Zhibin, et al.
Published: (2024)
by: Lin, Zhibin, et al.
Published: (2024)
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
by: Ren, Yiming, et al.
Published: (2025)
by: Ren, Yiming, et al.
Published: (2025)
A Survey of Reasoning in Autonomous Driving Systems: Open Challenges and Emerging Paradigms
by: Yu, Kejin, et al.
Published: (2026)
by: Yu, Kejin, et al.
Published: (2026)
O-DisCo-Edit: Object Distortion Control for Unified Realistic Video Editing
by: Chen, Yuqing, et al.
Published: (2025)
by: Chen, Yuqing, et al.
Published: (2025)
Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm Perspective
by: Yu, Yiyao, et al.
Published: (2025)
by: Yu, Yiyao, et al.
Published: (2025)
Improvement in Inter‐Layer Failure and Residual Flexural Properties of Carbon/Aramid Fiber Hybrid Composites With Multiscale Fiber‐Interleaving Under Low‐Velocity Impact Load
by: Hangyan Wang, et al.
Published: (2025)
by: Hangyan Wang, et al.
Published: (2025)
TIGERScore: Towards Building Explainable Metric for All Text Generation Tasks
by: Jiang, Dongfu, et al.
Published: (2023)
by: Jiang, Dongfu, et al.
Published: (2023)
Why Tropical Cyclones Over Oceanic Cyclonic Eddies Can Be Intensified in Global Basins
by: Lingwei Wu, et al.
Published: (2026)
by: Lingwei Wu, et al.
Published: (2026)
Lean-STaR: Learning to Interleave Thinking and Proving
by: Lin, Haohan, et al.
Published: (2024)
by: Lin, Haohan, et al.
Published: (2024)
SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units
by: Wang, Ruibin, et al.
Published: (2026)
by: Wang, Ruibin, et al.
Published: (2026)
CMMMU: A Chinese Massive Multi-discipline Multimodal Understanding Benchmark
by: Zhang, Ge, et al.
Published: (2024)
by: Zhang, Ge, et al.
Published: (2024)
SparseX: Efficient Segment-Level KV Cache Sharing for Interleaved LLM Serving
by: Zhang, Quqing, et al.
Published: (2026)
by: Zhang, Quqing, et al.
Published: (2026)
Supervised Learning Model for Key Frame Identification from Cow Teat Videos
by: Wang, Minghao, et al.
Published: (2024)
by: Wang, Minghao, et al.
Published: (2024)
VideoScore2: Think before You Score in Generative Video Evaluation
by: He, Xuan, et al.
Published: (2025)
by: He, Xuan, et al.
Published: (2025)
Multimodal DeepResearcher: Generating Text-Chart Interleaved Reports From Scratch with Agentic Framework
by: Yang, Zhaorui, et al.
Published: (2025)
by: Yang, Zhaorui, et al.
Published: (2025)
Efficient and Stable Quantum‐Dot Light‐Emitting Diodes with Trilayer PIN Architecture
by: Zhe Wang, et al.
Published: (2024)
by: Zhe Wang, et al.
Published: (2024)
ConcertoRL: An Innovative Time-Interleaved Reinforcement Learning Approach for Enhanced Control in Direct-Drive Tandem-Wing Vehicles
by: Zhang, Minghao, et al.
Published: (2024)
by: Zhang, Minghao, et al.
Published: (2024)
Soybean Auxin Transporter PIN3 Regulates Nitrate Acquisition to Improve Nitrogen Use and Seed Traits
by: Huifang Xu, et al.
Published: (2025)
by: Huifang Xu, et al.
Published: (2025)
PTD-SQL: Partitioning and Targeted Drilling with LLMs in Text-to-SQL
by: Luo, Ruilin, et al.
Published: (2024)
by: Luo, Ruilin, et al.
Published: (2024)
Modeling and Control of AWOISV: A Filtered Tube-Based MPC Approach for Simultaneous Tracking of Lateral Position and Heading Angle
by: Yang, Xu, et al.
Published: (2025)
by: Yang, Xu, et al.
Published: (2025)
CogDoc: Towards Unified thinking in Documents
by: Xu, Qixin, et al.
Published: (2025)
by: Xu, Qixin, et al.
Published: (2025)
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
by: Wu, Yuhuan, et al.
Published: (2026)
by: Wu, Yuhuan, et al.
Published: (2026)
Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning
by: Wang, Haozhe, et al.
Published: (2025)
by: Wang, Haozhe, et al.
Published: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
by: Wang, Alex Jinpeng, et al.
Published: (2024)
by: Wang, Alex Jinpeng, et al.
Published: (2024)
MANTIS: Interleaved Multi-Image Instruction Tuning
by: Jiang, Dongfu, et al.
Published: (2024)
by: Jiang, Dongfu, et al.
Published: (2024)
CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System
by: Lin, Zexin, et al.
Published: (2026)
by: Lin, Zexin, et al.
Published: (2026)
Reward Modeling from Natural Language Human Feedback
by: Wang, Zongqi, et al.
Published: (2026)
by: Wang, Zongqi, et al.
Published: (2026)
PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
by: Zhang, Yizhen, et al.
Published: (2025)
by: Zhang, Yizhen, et al.
Published: (2025)
Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO
by: Ren, Yiming, et al.
Published: (2026)
by: Ren, Yiming, et al.
Published: (2026)
GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver
by: Chen, Yuqing, et al.
Published: (2026)
by: Chen, Yuqing, et al.
Published: (2026)
Time Resolution of a Novel Ultra-fast Graphene-Optimized 4H-SiC PIN
by: Xiao, Suyu, et al.
Published: (2026)
by: Xiao, Suyu, et al.
Published: (2026)
The phase diagram of kernel interpolation in large dimensions
by: Zhang, Haobo, et al.
Published: (2024)
by: Zhang, Haobo, et al.
Published: (2024)
The Ultrasound and Genetic Characteristics of Fetuses With Laterality Defects—A Prenatal Cohort in Asian Population
by: Wu Yi, et al.
Published: (2025)
by: Wu Yi, et al.
Published: (2025)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
by: Ye, Weihao, et al.
Published: (2024)
by: Ye, Weihao, et al.
Published: (2024)
IDA-VLM: Towards Movie Understanding via ID-Aware Large Vision-Language Model
by: Ji, Yatai, et al.
Published: (2024)
by: Ji, Yatai, et al.
Published: (2024)
Objaverse++: Curated 3D Object Dataset with Quality Annotations
by: Lin, Chendi, et al.
Published: (2025)
by: Lin, Chendi, et al.
Published: (2025)
From Procedural Skills to Strategy Genes: Towards Experience-Driven Test-Time Evolution
by: Wang, Junjie, et al.
Published: (2026)
by: Wang, Junjie, et al.
Published: (2026)
Similar Items
-
SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature
by: Ren, Yiming, et al.
Published: (2026) -
Solving Math Word Problems via Cooperative Reasoning induced Language Models
by: Zhu, Xinyu, et al.
Published: (2022) -
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
by: Ren, Yiming, et al.
Published: (2026) -
Decentralized Physical Infrastructure Network (DePIN): Challenges and Opportunities
by: Lin, Zhibin, et al.
Published: (2024) -
AnyCap Project: A Unified Framework, Dataset, and Benchmark for Controllable Omni-modal Captioning
by: Ren, Yiming, et al.
Published: (2025)