Saved in:
| Main Authors: | Qiu, Jielin, Han, William, Wang, Winfred, Yang, Zhengyuan, Li, Linjie, Wang, Jianfeng, Faloutsos, Christos, Li, Lei, Wang, Lijuan |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2403.12339 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evaluating Durability: Benchmark Insights into Multimodal Watermarking
by: Qiu, Jielin, et al.
Published: (2024)
by: Qiu, Jielin, et al.
Published: (2024)
SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM
by: Qiu, Jielin, et al.
Published: (2024)
by: Qiu, Jielin, et al.
Published: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
by: Yu, Weihao, et al.
Published: (2023)
by: Yu, Weihao, et al.
Published: (2023)
Bring Metric Functions into Diffusion Models
by: An, Jie, et al.
Published: (2024)
by: An, Jie, et al.
Published: (2024)
OpenTab: Advancing Large Language Models as Open-domain Table Reasoners
by: Kong, Kezhi, et al.
Published: (2024)
by: Kong, Kezhi, et al.
Published: (2024)
Beyond Boundaries: Learning a Universal Entity Taxonomy across Datasets and Languages for Open Named Entity Recognition
by: Yang, Yuming, et al.
Published: (2024)
by: Yang, Yuming, et al.
Published: (2024)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
by: Liu, Qin, et al.
Published: (2024)
by: Liu, Qin, et al.
Published: (2024)
FraudFox: Adaptable Fraud Detection in the Real World
by: Butler, Matthew, et al.
Published: (2026)
by: Butler, Matthew, et al.
Published: (2026)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
by: Yu, Weihao, et al.
Published: (2024)
by: Yu, Weihao, et al.
Published: (2024)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
by: Wang, Alex Jinpeng, et al.
Published: (2025)
by: Wang, Alex Jinpeng, et al.
Published: (2025)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
by: Yang, Zhengyuan, et al.
Published: (2023)
by: Yang, Zhengyuan, et al.
Published: (2023)
DANCER: Entity Description Augmented Named Entity Corrector for Automatic Speech Recognition
by: Wang, Yi-Cheng, et al.
Published: (2024)
by: Wang, Yi-Cheng, et al.
Published: (2024)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
by: He, Xuehai, et al.
Published: (2024)
by: He, Xuehai, et al.
Published: (2024)
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
by: Li, Jinyuan, et al.
Published: (2024)
by: Li, Jinyuan, et al.
Published: (2024)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
by: Liu, Fuxiao, et al.
Published: (2023)
by: Liu, Fuxiao, et al.
Published: (2023)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
by: Zheng, Xiangxi, et al.
Published: (2025)
by: Zheng, Xiangxi, et al.
Published: (2025)
EIoU-EMC: A Novel Loss for Domain-specific Nested Entity Recognition
by: Zhang, Jian, et al.
Published: (2025)
by: Zhang, Jian, et al.
Published: (2025)
Large Language Models Struggle in Token-Level Clinical Named Entity Recognition
by: Lu, Qiuhao, et al.
Published: (2024)
by: Lu, Qiuhao, et al.
Published: (2024)
Hypergraph based Understanding for Document Semantic Entity Recognition
by: Li, Qiwei, et al.
Published: (2024)
by: Li, Qiwei, et al.
Published: (2024)
TextAtlas5M: A Large-scale Dataset for Dense Text Image Generation
by: Wang, Alex Jinpeng, et al.
Published: (2025)
by: Wang, Alex Jinpeng, et al.
Published: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
by: Wang, Alex Jinpeng, et al.
Published: (2024)
by: Wang, Alex Jinpeng, et al.
Published: (2024)
FiNER-ORD: Financial Named Entity Recognition Open Research Dataset
by: Shah, Agam, et al.
Published: (2023)
by: Shah, Agam, et al.
Published: (2023)
Self-Improving for Zero-Shot Named Entity Recognition with Large Language Models
by: Xie, Tingyu, et al.
Published: (2023)
by: Xie, Tingyu, et al.
Published: (2023)
WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition
by: Ning, Shan, et al.
Published: (2026)
by: Ning, Shan, et al.
Published: (2026)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
by: Cho, Jaemin, et al.
Published: (2023)
by: Cho, Jaemin, et al.
Published: (2023)
A Unified Biomedical Named Entity Recognition Framework with Large Language Models
by: Lv, Tengxiao, et al.
Published: (2025)
by: Lv, Tengxiao, et al.
Published: (2025)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
by: Yan, An, et al.
Published: (2024)
by: Yan, An, et al.
Published: (2024)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
by: Zhai, Yuanhao, et al.
Published: (2024)
by: Zhai, Yuanhao, et al.
Published: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
by: Lin, Yan-Bo, et al.
Published: (2025)
by: Lin, Yan-Bo, et al.
Published: (2025)
Assessment of Generative Named Entity Recognition in the Era of Large Language Models
by: Zhan, Qi, et al.
Published: (2026)
by: Zhan, Qi, et al.
Published: (2026)
Rethinking Negative Instances for Generative Named Entity Recognition
by: Ding, Yuyang, et al.
Published: (2024)
by: Ding, Yuyang, et al.
Published: (2024)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
by: Mao, Dongxing, et al.
Published: (2026)
by: Mao, Dongxing, et al.
Published: (2026)
Leveraging Large Language Models for Rare Disease Named Entity Recognition
by: Xi, Nan Miles, et al.
Published: (2025)
by: Xi, Nan Miles, et al.
Published: (2025)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
by: Hao, Yunzhuo, et al.
Published: (2025)
by: Hao, Yunzhuo, et al.
Published: (2025)
LTNER: Large Language Model Tagging for Named Entity Recognition with Contextualized Entity Marking
by: Yan, Faren, et al.
Published: (2024)
by: Yan, Faren, et al.
Published: (2024)
LAKEGEN: A LLM-based Tabular Corpus Generator for Evaluating Dataset Discovery in Data Lakes
by: Dai, Zhenwei, et al.
Published: (2025)
by: Dai, Zhenwei, et al.
Published: (2025)
OpenNER 1.0: Standardized Open-Access Named Entity Recognition Datasets in 50+ Languages
by: Palen-Michel, Chester, et al.
Published: (2024)
by: Palen-Michel, Chester, et al.
Published: (2024)
Entity Disambiguation via Fusion Entity Decoding
by: Wang, Junxiong, et al.
Published: (2024)
by: Wang, Junxiong, et al.
Published: (2024)
Named Entity Recognition Under Domain Shift via Metric Learning for Life Sciences
by: Liu, Hongyi, et al.
Published: (2024)
by: Liu, Hongyi, et al.
Published: (2024)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
by: Liao, Jiaqi, et al.
Published: (2025)
by: Liao, Jiaqi, et al.
Published: (2025)
Similar Items
-
Evaluating Durability: Benchmark Insights into Multimodal Watermarking
by: Qiu, Jielin, et al.
Published: (2024) -
SnapNTell: Enhancing Entity-Centric Visual Question Answering with Retrieval Augmented Multimodal LLM
by: Qiu, Jielin, et al.
Published: (2024) -
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
by: Yu, Weihao, et al.
Published: (2023) -
Bring Metric Functions into Diffusion Models
by: An, Jie, et al.
Published: (2024) -
OpenTab: Advancing Large Language Models as Open-domain Table Reasoners
by: Kong, Kezhi, et al.
Published: (2024)