Enregistré dans:
| Auteurs principaux: | Thuon, Nimol, Du, Jun |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2512.11849 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Khmer Semantic Search Engine (KSE): Digital Information Access and Document Retrieval
par: Thuon, Nimol
Publié: (2024)
par: Thuon, Nimol
Publié: (2024)
KSW: Khmer Stop Word based Dictionary for Keyword Extraction
par: Thuon, Nimol, et autres
Publié: (2024)
par: Thuon, Nimol, et autres
Publié: (2024)
Automatic Layout Planning for Visually-Rich Documents with Instruction-Following Models
par: Zhu, Wanrong, et autres
Publié: (2024)
par: Zhu, Wanrong, et autres
Publié: (2024)
BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models
par: Arnould, Ludovic, et autres
Publié: (2025)
par: Arnould, Ludovic, et autres
Publié: (2025)
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
par: Han, Songhao, et autres
Publié: (2024)
par: Han, Songhao, et autres
Publié: (2024)
Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
par: Wang, Baode, et autres
Publié: (2025)
par: Wang, Baode, et autres
Publié: (2025)
Towards Khmer Scene Document Layout Detection
par: Kong, Marry, et autres
Publié: (2026)
par: Kong, Marry, et autres
Publié: (2026)
FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs
par: Asokan, Mothilal, et autres
Publié: (2025)
par: Asokan, Mothilal, et autres
Publié: (2025)
Development of an open education resources (OER) system: a comparative analysis and implementation approach
par: Thuon, Nimol, et autres
Publié: (2024)
par: Thuon, Nimol, et autres
Publié: (2024)
EmoMeta: A Multimodal Dataset for Fine-grained Emotion Classification in Chinese Metaphors
par: Lu, Xingyuan, et autres
Publié: (2025)
par: Lu, Xingyuan, et autres
Publié: (2025)
ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps
par: Feng, Sicheng, et autres
Publié: (2025)
par: Feng, Sicheng, et autres
Publié: (2025)
VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning
par: Wu, Xueqing, et autres
Publié: (2024)
par: Wu, Xueqing, et autres
Publié: (2024)
LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding
par: Fujitake, Masato
Publié: (2024)
par: Fujitake, Masato
Publié: (2024)
PP-DocLayout: A Unified Document Layout Detection Model to Accelerate Large-Scale Data Construction
par: Sun, Ting, et autres
Publié: (2025)
par: Sun, Ting, et autres
Publié: (2025)
Evaluating Automated Radiology Report Quality through Fine-Grained Phrasal Grounding of Clinical Findings
par: Mahmood, Razi, et autres
Publié: (2024)
par: Mahmood, Razi, et autres
Publié: (2024)
Medical Image Synthesis via Fine-Grained Image-Text Alignment and Anatomy-Pathology Prompting
par: Chen, Wenting, et autres
Publié: (2024)
par: Chen, Wenting, et autres
Publié: (2024)
DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation
par: Wang, Zun, et autres
Publié: (2024)
par: Wang, Zun, et autres
Publié: (2024)
AC-Lite : A Lightweight Image Captioning Model for Low-Resource Assamese Language
par: Choudhury, Pankaj, et autres
Publié: (2025)
par: Choudhury, Pankaj, et autres
Publié: (2025)
Fine-Grained Image-Text Alignment in Medical Imaging Enables Explainable Cyclic Image-Report Generation
par: Chen, Wenting, et autres
Publié: (2023)
par: Chen, Wenting, et autres
Publié: (2023)
MMGeoLM: Hard Negative Contrastive Learning for Fine-Grained Geometric Understanding in Large Multimodal Models
par: Sun, Kai, et autres
Publié: (2025)
par: Sun, Kai, et autres
Publié: (2025)
HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities
par: Dönmez, Esra, et autres
Publié: (2026)
par: Dönmez, Esra, et autres
Publié: (2026)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
par: Wan, Yixin, et autres
Publié: (2025)
par: Wan, Yixin, et autres
Publié: (2025)
Order Is Not Layout: Order-to-Space Bias in Image Generation
par: Zhang, Yongkang, et autres
Publié: (2026)
par: Zhang, Yongkang, et autres
Publié: (2026)
Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception
par: Wei, Lai, et autres
Publié: (2026)
par: Wei, Lai, et autres
Publié: (2026)
DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting
par: Islam, Md Mofijul, et autres
Publié: (2026)
par: Islam, Md Mofijul, et autres
Publié: (2026)
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
par: Gao, Yufei, et autres
Publié: (2025)
par: Gao, Yufei, et autres
Publié: (2025)
Layout-Aware Parsing Meets Efficient LLMs: A Unified, Scalable Framework for Resume Information Extraction and Evaluation
par: Zhu, Fanwei, et autres
Publié: (2025)
par: Zhu, Fanwei, et autres
Publié: (2025)
KhmerST: A Low-Resource Khmer Scene Text Detection and Recognition Benchmark
par: Nom, Vannkinh, et autres
Publié: (2024)
par: Nom, Vannkinh, et autres
Publié: (2024)
PIN: A Knowledge-Intensive Dataset for Paired and Interleaved Multimodal Documents
par: Wang, Junjie, et autres
Publié: (2024)
par: Wang, Junjie, et autres
Publié: (2024)
Infer Induced Sentiment of Comment Response to Video: A New Task, Dataset and Baseline
par: Jia, Qi, et autres
Publié: (2024)
par: Jia, Qi, et autres
Publié: (2024)
VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages
par: Atuhurra, Jesse, et autres
Publié: (2025)
par: Atuhurra, Jesse, et autres
Publié: (2025)
CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception
par: Carvalho, Miguel, et autres
Publié: (2025)
par: Carvalho, Miguel, et autres
Publié: (2025)
RanLayNet: A Dataset for Document Layout Detection used for Domain Adaptation and Generalization
par: Anand, Avinash, et autres
Publié: (2024)
par: Anand, Avinash, et autres
Publié: (2024)
Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models
par: Jiang, Jiachen, et autres
Publié: (2025)
par: Jiang, Jiachen, et autres
Publié: (2025)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
par: Cho, Jaemin, et autres
Publié: (2023)
par: Cho, Jaemin, et autres
Publié: (2023)
GameTileNet: A Semantic Dataset for Low-Resolution Game Art in Procedural Content Generation
par: Chen, Yi-Chun, et autres
Publié: (2025)
par: Chen, Yi-Chun, et autres
Publié: (2025)
AnnoPage Dataset: Dataset of Non-Textual Elements in Documents with Fine-Grained Categorization
par: Kišš, Martin, et autres
Publié: (2025)
par: Kišš, Martin, et autres
Publié: (2025)
VideoComp: Advancing Fine-Grained Compositional and Temporal Alignment in Video-Text Models
par: Kim, Dahun, et autres
Publié: (2025)
par: Kim, Dahun, et autres
Publié: (2025)
Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting
par: Zhao, Xiaohan, et autres
Publié: (2026)
par: Zhao, Xiaohan, et autres
Publié: (2026)
Documents similaires
-
Khmer Semantic Search Engine (KSE): Digital Information Access and Document Retrieval
par: Thuon, Nimol
Publié: (2024) -
KSW: Khmer Stop Word based Dictionary for Keyword Extraction
par: Thuon, Nimol, et autres
Publié: (2024) -
Automatic Layout Planning for Visually-Rich Documents with Instruction-Following Models
par: Zhu, Wanrong, et autres
Publié: (2024) -
BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models
par: Arnould, Ludovic, et autres
Publié: (2025) -
VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection
par: Han, Songhao, et autres
Publié: (2024)