Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Jinyuan, Li, Ziyan, Li, Han, Yu, Jianfei, Xia, Rui, Sun, Di, Pan, Gang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
por: Li, Jinyuan, et al.
Publicado: (2024)
por: Li, Jinyuan, et al.
Publicado: (2024)
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
por: Cui, Shiyao, et al.
Publicado: (2023)
por: Cui, Shiyao, et al.
Publicado: (2023)
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
por: Huang, Shunyu, et al.
Publicado: (2026)
por: Huang, Shunyu, et al.
Publicado: (2026)
SemEval-2024 Task 3: Multimodal Emotion Cause Analysis in Conversations
por: Wang, Fanfan, et al.
Publicado: (2024)
por: Wang, Fanfan, et al.
Publicado: (2024)
Explainable Multimodal Emotion Recognition
por: Lian, Zheng, et al.
Publicado: (2023)
por: Lian, Zheng, et al.
Publicado: (2023)
Calibrating Multimodal Consensus for Emotion Recognition
por: Zhong, Guowei, et al.
Publicado: (2025)
por: Zhong, Guowei, et al.
Publicado: (2025)
HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
por: Zhou, Chuhao, et al.
Publicado: (2025)
por: Zhou, Chuhao, et al.
Publicado: (2025)
Multi-level Mixture of Experts for Multimodal Entity Linking
por: Hu, Zhiwei, et al.
Publicado: (2025)
por: Hu, Zhiwei, et al.
Publicado: (2025)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
por: Gao, Shibo, et al.
Publicado: (2025)
por: Gao, Shibo, et al.
Publicado: (2025)
Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors
por: Li, Jia, et al.
Publicado: (2025)
por: Li, Jia, et al.
Publicado: (2025)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
por: Liu, Hao, et al.
Publicado: (2025)
por: Liu, Hao, et al.
Publicado: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
Training Data Efficiency in Multimodal Process Reward Models
por: Li, Jinyuan, et al.
Publicado: (2026)
por: Li, Jinyuan, et al.
Publicado: (2026)
Crafting Dynamic Virtual Activities with Advanced Multimodal Models
por: Li, Changyang, et al.
Publicado: (2024)
por: Li, Changyang, et al.
Publicado: (2024)
Revise, Reason, and Recognize: LLM-Based Emotion Recognition via Emotion-Specific Prompts and ASR Error Correction
por: Li, Yuanchao, et al.
Publicado: (2024)
por: Li, Yuanchao, et al.
Publicado: (2024)
MCIHN: A Hybrid Network Model Based on Multi-path Cross-modal Interaction for Multimodal Emotion Recognition
por: Zhang, Haoyang, et al.
Publicado: (2025)
por: Zhang, Haoyang, et al.
Publicado: (2025)
LLM-Guided Semantic Relational Reasoning for Multimodal Intent Recognition
por: Zhou, Qianrui, et al.
Publicado: (2025)
por: Zhou, Qianrui, et al.
Publicado: (2025)
Multimodal Sentiment Analysis Based on Causal Reasoning
por: Chen, Fuhai, et al.
Publicado: (2024)
por: Chen, Fuhai, et al.
Publicado: (2024)
MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces
por: E, Shaojun, et al.
Publicado: (2025)
por: E, Shaojun, et al.
Publicado: (2025)
SACRED: A Faithful Annotated Multimedia Multimodal Multilingual Dataset for Classifying Connectedness Types in Online Spirituality
por: Guan, Qinghao, et al.
Publicado: (2026)
por: Guan, Qinghao, et al.
Publicado: (2026)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
por: Zhang, Hanlei, et al.
Publicado: (2024)
por: Zhang, Hanlei, et al.
Publicado: (2024)
Mutual Information-based Representations Disentanglement for Unaligned Multimodal Language Sequences
por: Qian, Fan, et al.
Publicado: (2024)
por: Qian, Fan, et al.
Publicado: (2024)
Multi-modal Speech Emotion Recognition via Feature Distribution Adaptation Network
por: Li, Shaokai, et al.
Publicado: (2024)
por: Li, Shaokai, et al.
Publicado: (2024)
Wavelet-Decoupling Contrastive Enhancement Network for Fine-Grained Skeleton-Based Action Recognition
por: Chang, Haochen, et al.
Publicado: (2024)
por: Chang, Haochen, et al.
Publicado: (2024)
Grounded Chain-of-Thought for Multimodal Large Language Models
por: Wu, Qiong, et al.
Publicado: (2025)
por: Wu, Qiong, et al.
Publicado: (2025)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
por: Zhao, Yi, et al.
Publicado: (2025)
por: Zhao, Yi, et al.
Publicado: (2025)
Hierarchical Aligned Multimodal Learning for NER on Tweet Posts
por: Liu, Peipei, et al.
Publicado: (2023)
por: Liu, Peipei, et al.
Publicado: (2023)
AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards
por: Pan, Yiming, et al.
Publicado: (2026)
por: Pan, Yiming, et al.
Publicado: (2026)
Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models
por: Xu, Yifang, et al.
Publicado: (2025)
por: Xu, Yifang, et al.
Publicado: (2025)
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
por: Luo, Wen, et al.
Publicado: (2024)
por: Luo, Wen, et al.
Publicado: (2024)
FastCache: Optimizing Multimodal LLM Serving through Lightweight KV-Cache Compression Framework
por: Zhu, Jianian, et al.
Publicado: (2025)
por: Zhu, Jianian, et al.
Publicado: (2025)
Differentiating Emigration from Return Migration of Scholars Using Name-Based Nationality Detection Models
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
por: Ghorbanpour, Faeze, et al.
Publicado: (2025)
LiftProj: Space Lifting and Projection-Based Panorama Stitching
por: Jia, Yuan, et al.
Publicado: (2025)
por: Jia, Yuan, et al.
Publicado: (2025)
Remember Past, Anticipate Future: Learning Continual Multimodal Misinformation Detectors
por: Wang, Bing, et al.
Publicado: (2025)
por: Wang, Bing, et al.
Publicado: (2025)
Retrieval-Augmented Multimodal Model for Fake News Detection
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
por: Ilaslan, Muhammet Furkan, et al.
Publicado: (2024)
CMATH: Cross-Modality Augmented Transformer with Hierarchical Variational Distillation for Multimodal Emotion Recognition in Conversation
por: Zhu, Xiaofei, et al.
Publicado: (2024)
por: Zhu, Xiaofei, et al.
Publicado: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
por: Cui, Shiyao, et al.
Publicado: (2025)
por: Cui, Shiyao, et al.
Publicado: (2025)
Language-Guided Diffusion Model for Visual Grounding
por: Chen, Sijia, et al.
Publicado: (2023)
por: Chen, Sijia, et al.
Publicado: (2023)
Ejemplares similares
-
LLMs as Bridges: Reformulating Grounded Multimodal Named Entity Recognition
por: Li, Jinyuan, et al.
Publicado: (2024) -
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
por: Cui, Shiyao, et al.
Publicado: (2023) -
SkeFi: Cross-Modal Knowledge Transfer for Wireless Skeleton-Based Action Recognition
por: Huang, Shunyu, et al.
Publicado: (2026) -
SemEval-2024 Task 3: Multimodal Emotion Cause Analysis in Conversations
por: Wang, Fanfan, et al.
Publicado: (2024) -
Explainable Multimodal Emotion Recognition
por: Lian, Zheng, et al.
Publicado: (2023)