Algorithm Research of ELMo Word Embedding and Deep Learning Multimodal Transformer in Image Description
Fuente:
arXiv
Saved in:
| Main Authors: | Cheng, Xiaohan, Mei, Taiyuan, Zi, Yun, Wang, Qi, Gao, Zijun, Yang, Haowei |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
An Enhanced Encoder-Decoder Network Architecture for Reducing Information Loss in Image Semantic Segmentation
by: Gao, Zijun, et al.
Published: (2024)
by: Gao, Zijun, et al.
Published: (2024)
Enhancing Convolutional Neural Networks with Higher-Order Numerical Difference Methods
by: Wang, Qi, et al.
Published: (2024)
by: Wang, Qi, et al.
Published: (2024)
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
by: Mei, Taiyuan, et al.
Published: (2024)
by: Mei, Taiyuan, et al.
Published: (2024)
ImageInWords: Unlocking Hyper-Detailed Image Descriptions
by: Garg, Roopal, et al.
Published: (2024)
by: Garg, Roopal, et al.
Published: (2024)
Embedding Radiomics into Vision Transformers for Multimodal Medical Image Classification
by: Yang, Zhenyu, et al.
Published: (2025)
by: Yang, Zhenyu, et al.
Published: (2025)
Advancements in Feature Extraction Recognition of Medical Imaging Systems Through Deep Learning Technique
by: Zhan, Qishi, et al.
Published: (2024)
by: Zhan, Qishi, et al.
Published: (2024)
Research on Edge Detection of LiDAR Images Based on Artificial Intelligence Technology
by: Yang, Haowei, et al.
Published: (2024)
by: Yang, Haowei, et al.
Published: (2024)
GeoBench: Rethinking Multimodal Geometric Problem-Solving via Hierarchical Evaluation
by: Feng, Yuan, et al.
Published: (2025)
by: Feng, Yuan, et al.
Published: (2025)
Research on Image Recognition Technology Based on Multimodal Deep Learning
by: Wang, Jinyin, et al.
Published: (2024)
by: Wang, Jinyin, et al.
Published: (2024)
LGD: Leveraging Generative Descriptions for Zero-Shot Referring Image Segmentation
by: Li, Jiachen, et al.
Published: (2025)
by: Li, Jiachen, et al.
Published: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
by: Wang, Alex Jinpeng, et al.
Published: (2025)
by: Wang, Alex Jinpeng, et al.
Published: (2025)
Learning Continuous 3D Words for Text-to-Image Generation
by: Cheng, Ta-Ying, et al.
Published: (2024)
by: Cheng, Ta-Ying, et al.
Published: (2024)
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
by: Jain, Jitesh, et al.
Published: (2024)
by: Jain, Jitesh, et al.
Published: (2024)
TDEC: Deep Embedded Image Clustering with Transformer and Distribution Information
by: Zhang, Ruilin, et al.
Published: (2026)
by: Zhang, Ruilin, et al.
Published: (2026)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
by: Tang, Changli, et al.
Published: (2025)
by: Tang, Changli, et al.
Published: (2025)
Comp-X: On Defining an Interactive Learned Image Compression Paradigm With Expert-driven LLM Agent
by: Gao, Yixin, et al.
Published: (2025)
by: Gao, Yixin, et al.
Published: (2025)
Texture-aware Intrinsic Image Decomposition with Model- and Learning-based Priors
by: Wang, Xiaodong, et al.
Published: (2025)
by: Wang, Xiaodong, et al.
Published: (2025)
An Adaptor for Triggering Semi-Supervised Learning to Out-of-Box Serve Deep Image Clustering
by: Duan, Yue, et al.
Published: (2025)
by: Duan, Yue, et al.
Published: (2025)
Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings
by: Jiang, Haonan, et al.
Published: (2026)
by: Jiang, Haonan, et al.
Published: (2026)
Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs
by: Li, Qi, et al.
Published: (2026)
by: Li, Qi, et al.
Published: (2026)
HySurvPred: Multimodal Hyperbolic Embedding with Angle-Aware Hierarchical Contrastive Learning and Uncertainty Constraints for Survival Prediction
by: Yang, Jiaqi, et al.
Published: (2025)
by: Yang, Jiaqi, et al.
Published: (2025)
Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning
by: Zhong, Hui, et al.
Published: (2026)
by: Zhong, Hui, et al.
Published: (2026)
Image-to-Image Translation Framework Embedded with Rotation Symmetry Priors
by: Tan, Feiyu, et al.
Published: (2026)
by: Tan, Feiyu, et al.
Published: (2026)
Unified Pix Token And Word Token Generative Language Model
by: Leung, Haun, et al.
Published: (2026)
by: Leung, Haun, et al.
Published: (2026)
MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description
by: Yang, Cong, et al.
Published: (2024)
by: Yang, Cong, et al.
Published: (2024)
Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception
by: Nan, Xinyu, et al.
Published: (2026)
by: Nan, Xinyu, et al.
Published: (2026)
Masked Attribute Description Embedding for Cloth-Changing Person Re-identification
by: Peng, Chunlei, et al.
Published: (2024)
by: Peng, Chunlei, et al.
Published: (2024)
DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning
by: Lu, Jialang, et al.
Published: (2025)
by: Lu, Jialang, et al.
Published: (2025)
Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs
by: Gu, Tiancheng, et al.
Published: (2025)
by: Gu, Tiancheng, et al.
Published: (2025)
Reminding Multimodal Large Language Models of Object-aware Knowledge with Retrieved Tags
by: Qi, Daiqing, et al.
Published: (2024)
by: Qi, Daiqing, et al.
Published: (2024)
Research on Deep Learning Model of Feature Extraction Based on Convolutional Neural Network
by: Liu, Houze, et al.
Published: (2024)
by: Liu, Houze, et al.
Published: (2024)
Selectively Informative Description can Reduce Undesired Embedding Entanglements in Text-to-Image Personalization
by: Kim, Jimyeong, et al.
Published: (2024)
by: Kim, Jimyeong, et al.
Published: (2024)
Research on Splicing Image Detection Algorithms Based on Natural Image Statistical Characteristics
by: Xiang, Ao, et al.
Published: (2024)
by: Xiang, Ao, et al.
Published: (2024)
MARL-MambaContour: Unleashing Multi-Agent Deep Reinforcement Learning for Active Contour Optimization in Medical Image Segmentation
by: Zhang, Ruicheng, et al.
Published: (2025)
by: Zhang, Ruicheng, et al.
Published: (2025)
Reasoning Guided Embeddings: Leveraging MLLM Reasoning for Improved Multimodal Retrieval
by: Liu, Chunxu, et al.
Published: (2025)
by: Liu, Chunxu, et al.
Published: (2025)
Cross Paradigm Representation and Alignment Transformer for Image Deraining
by: Zou, Shun, et al.
Published: (2025)
by: Zou, Shun, et al.
Published: (2025)
A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering
by: Huang, Xiaofei, et al.
Published: (2022)
by: Huang, Xiaofei, et al.
Published: (2022)
MEDBind: Unifying Language and Multimodal Medical Data Embeddings
by: Gao, Yuan, et al.
Published: (2024)
by: Gao, Yuan, et al.
Published: (2024)
FTCFormer: Fuzzy Token Clustering Transformer for Image Classification
by: Bao, Muyi, et al.
Published: (2025)
by: Bao, Muyi, et al.
Published: (2025)
GIM: Learning Generalizable Image Matcher From Internet Videos
by: Shen, Xuelun, et al.
Published: (2024)
by: Shen, Xuelun, et al.
Published: (2024)
Similar Items
-
An Enhanced Encoder-Decoder Network Architecture for Reducing Information Loss in Image Semantic Segmentation
by: Gao, Zijun, et al.
Published: (2024) -
Enhancing Convolutional Neural Networks with Higher-Order Numerical Difference Methods
by: Wang, Qi, et al.
Published: (2024) -
Efficiency optimization of large-scale language models based on deep learning in natural language processing tasks
by: Mei, Taiyuan, et al.
Published: (2024) -
ImageInWords: Unlocking Hyper-Detailed Image Descriptions
by: Garg, Roopal, et al.
Published: (2024) -
Embedding Radiomics into Vision Transformers for Multimodal Medical Image Classification
by: Yang, Zhenyu, et al.
Published: (2025)