Visual Language Model based Cross-modal Semantic Communication Systems
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Feibo, Tang, Chuanguo, Dong, Li, Wang, Kezhi, Yang, Kun, Pan, Cunhua |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
par: Jiang, Feibo, et autres
Publié: (2026)
par: Jiang, Feibo, et autres
Publié: (2026)
M4SC: An MLLM-based Multi-modal, Multi-task and Multi-user Semantic Communication System
par: Jiang, Feibo, et autres
Publié: (2025)
par: Jiang, Feibo, et autres
Publié: (2025)
Lightweight Vision Model-based Multi-user Semantic Communication Systems
par: Jiang, Feibo, et autres
Publié: (2025)
par: Jiang, Feibo, et autres
Publié: (2025)
Personalized Federated Learning for Generative AI-Assisted Semantic Communications
par: Peng, Yubo, et autres
Publié: (2024)
par: Peng, Yubo, et autres
Publié: (2024)
Large Generative Model Assisted 3D Semantic Communication
par: Jiang, Feibo, et autres
Publié: (2024)
par: Jiang, Feibo, et autres
Publié: (2024)
Large AI Model Empowered Multimodal Semantic Communications
par: Jiang, Feibo, et autres
Publié: (2023)
par: Jiang, Feibo, et autres
Publié: (2023)
CommGPT: A Graph and Retrieval-Augmented Multimodal Communication Foundation Model
par: Jiang, Feibo, et autres
Publié: (2025)
par: Jiang, Feibo, et autres
Publié: (2025)
Token Communications: A Large Model-Driven Framework for Cross-modal Context-aware Semantic Communications
par: Qiao, Li, et autres
Publié: (2025)
par: Qiao, Li, et autres
Publié: (2025)
Agentic AI Empowered Multi-UAV Trajectory Optimization in Low-Altitude Economy Networks
par: Jiang, Feibo, et autres
Publié: (2025)
par: Jiang, Feibo, et autres
Publié: (2025)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
par: Cai, Rui, et autres
Publié: (2024)
par: Cai, Rui, et autres
Publié: (2024)
Large Generative Model-assisted Talking-face Semantic Communication System
par: Jiang, Feibo, et autres
Publié: (2024)
par: Jiang, Feibo, et autres
Publié: (2024)
A Comprehensive Survey of Large AI Models for Future Communications: Foundations, Applications and Challenges
par: Jiang, Feibo, et autres
Publié: (2025)
par: Jiang, Feibo, et autres
Publié: (2025)
Personalized Wireless Federated Learning for Large Language Models
par: Jiang, Feibo, et autres
Publié: (2024)
par: Jiang, Feibo, et autres
Publié: (2024)
Aerial Agentic AI: Synergizing LLM and SLM for Low-Altitude Wireless Networks
par: Dong, Li, et autres
Publié: (2026)
par: Dong, Li, et autres
Publié: (2026)
WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering
par: Zhu, Yingjian, et autres
Publié: (2026)
par: Zhu, Yingjian, et autres
Publié: (2026)
Generative Semantic Communication via Alternating Dual-Domain Posterior Sampling
par: Tang, Shunpu, et autres
Publié: (2026)
par: Tang, Shunpu, et autres
Publié: (2026)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
Editable-DeepSC: Reliable Cross-Modal Semantic Communications for Facial Editing
par: Chen, Bin, et autres
Publié: (2024)
par: Chen, Bin, et autres
Publié: (2024)
MMSearch: Benchmarking the Potential of Large Models as Multi-modal Search Engines
par: Jiang, Dongzhi, et autres
Publié: (2024)
par: Jiang, Dongzhi, et autres
Publié: (2024)
ICDM: Interference Cancellation Diffusion Models for Wireless Semantic Communications
par: Wu, Tong, et autres
Publié: (2025)
par: Wu, Tong, et autres
Publié: (2025)
Explainable Semantic Federated Learning Enabled Industrial Edge Network for Fire Surveillance
par: Dong, Li, et autres
Publié: (2024)
par: Dong, Li, et autres
Publié: (2024)
VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents
par: Yu, Shi, et autres
Publié: (2024)
par: Yu, Shi, et autres
Publié: (2024)
Vision Transformer-based Semantic Communications With Importance-Aware Quantization
par: Park, Joohyuk, et autres
Publié: (2024)
par: Park, Joohyuk, et autres
Publié: (2024)
Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering
par: Dong, Junnan, et autres
Publié: (2024)
par: Dong, Junnan, et autres
Publié: (2024)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
CAST: Cross-modal Alignment Similarity Test for Vision Language Models
par: Dagan, Gautier, et autres
Publié: (2024)
par: Dagan, Gautier, et autres
Publié: (2024)
Skip-It? Theoretical Conditions for Layer Skipping in Vision-Language Models
par: Hartman, Max, et autres
Publié: (2025)
par: Hartman, Max, et autres
Publié: (2025)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
Recursive Vision Transformer with Dynamic Depth and Width Adjustment for Resource-Efficient Image Semantic Communication
par: Zhang, Zhilong, et autres
Publié: (2026)
par: Zhang, Zhilong, et autres
Publié: (2026)
Multimodal LLM Enhanced Cross-lingual Cross-modal Retrieval
par: Wang, Yabing, et autres
Publié: (2024)
par: Wang, Yabing, et autres
Publié: (2024)
Computed Tomography Visual Question Answering with Cross-modal Feature Graphing
par: Tian, Yuanhe, et autres
Publié: (2025)
par: Tian, Yuanhe, et autres
Publié: (2025)
Learning Visual Composition through Improved Semantic Guidance
par: Stone, Austin, et autres
Publié: (2024)
par: Stone, Austin, et autres
Publié: (2024)
Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect
par: Kouwenhoven, Tom, et autres
Publié: (2025)
par: Kouwenhoven, Tom, et autres
Publié: (2025)
Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning
par: Xu, Xiaohao, et autres
Publié: (2024)
par: Xu, Xiaohao, et autres
Publié: (2024)
Large AI Model-Enabled Generative Semantic Communications for Image Transmission
par: Ma, Qiyu, et autres
Publié: (2025)
par: Ma, Qiyu, et autres
Publié: (2025)
SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval
par: Wu, Siwei, et autres
Publié: (2024)
par: Wu, Siwei, et autres
Publié: (2024)
Scale What Counts, Mask What Matters: Evaluating Foundation Models for Zero-Shot Cross-Domain Wi-Fi Sensing
par: Jiang, Cheng, et autres
Publié: (2025)
par: Jiang, Cheng, et autres
Publié: (2025)
E5-V: Universal Embeddings with Multimodal Large Language Models
par: Jiang, Ting, et autres
Publié: (2024)
par: Jiang, Ting, et autres
Publié: (2024)
MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory
par: Guo, Minghao, et autres
Publié: (2026)
par: Guo, Minghao, et autres
Publié: (2026)
Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models
par: Shen, Ruiqi, et autres
Publié: (2025)
par: Shen, Ruiqi, et autres
Publié: (2025)
Documents similaires
-
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
par: Jiang, Feibo, et autres
Publié: (2026) -
M4SC: An MLLM-based Multi-modal, Multi-task and Multi-user Semantic Communication System
par: Jiang, Feibo, et autres
Publié: (2025) -
Lightweight Vision Model-based Multi-user Semantic Communication Systems
par: Jiang, Feibo, et autres
Publié: (2025) -
Personalized Federated Learning for Generative AI-Assisted Semantic Communications
par: Peng, Yubo, et autres
Publié: (2024) -
Large Generative Model Assisted 3D Semantic Communication
par: Jiang, Feibo, et autres
Publié: (2024)