OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xue, Yida, Zhang, Ningyu, Wu, Tingwei, Ma, Zhe, Ji, Daxiong, Wang, Zhao, Zheng, Guozhou, Chen, Huajun |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OceanGPT: A Large Language Model for Ocean Science Tasks
par: Bi, Zhen, et autres
Publié: (2023)
par: Bi, Zhen, et autres
Publié: (2023)
Spatial Knowledge Graph-Guided Multimodal Synthesis
par: Xue, Yida, et autres
Publié: (2025)
par: Xue, Yida, et autres
Publié: (2025)
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023)
par: Cheng, Siyuan, et autres
Publié: (2023)
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
par: Liang, Zhengyang, et autres
Publié: (2024)
par: Liang, Zhengyang, et autres
Publié: (2024)
Unified Hallucination Detection for Multimodal Large Language Models
par: Chen, Xiang, et autres
Publié: (2024)
par: Chen, Xiang, et autres
Publié: (2024)
ADS-Edit: A Multimodal Knowledge Editing Dataset for Autonomous Driving Systems
par: Wang, Chenxi, et autres
Publié: (2025)
par: Wang, Chenxi, et autres
Publié: (2025)
GalleryGPT: Analyzing Paintings with Large Multimodal Models
par: Bin, Yi, et autres
Publié: (2024)
par: Bin, Yi, et autres
Publié: (2024)
Aligning Agentic World Models via Knowledgeable Experience Learning
par: Ren, Baochang, et autres
Publié: (2026)
par: Ren, Baochang, et autres
Publié: (2026)
To Forget or Not? Towards Practical Knowledge Unlearning for Large Language Models
par: Tian, Bozhong, et autres
Publié: (2024)
par: Tian, Bozhong, et autres
Publié: (2024)
MaVEn: An Effective Multi-granularity Hybrid Visual Encoding Framework for Multimodal Large Language Model
par: Jiang, Chaoya, et autres
Publié: (2024)
par: Jiang, Chaoya, et autres
Publié: (2024)
ZJUKLAB at SemEval-2025 Task 4: Unlearning via Model Merging
par: Xu, Haoming, et autres
Publié: (2025)
par: Xu, Haoming, et autres
Publié: (2025)
Empowering Multimodal LLMs with External Tools: A Comprehensive Survey
par: An, Wenbin, et autres
Publié: (2025)
par: An, Wenbin, et autres
Publié: (2025)
MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation
par: Wang, Chenxi, et autres
Publié: (2024)
par: Wang, Chenxi, et autres
Publié: (2024)
Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
par: Wu, Qiong, et autres
Publié: (2024)
par: Wu, Qiong, et autres
Publié: (2024)
Continual Multimodal Knowledge Graph Construction
par: Chen, Xiang, et autres
Publié: (2023)
par: Chen, Xiang, et autres
Publié: (2023)
How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model
par: Song, Shezheng, et autres
Publié: (2023)
par: Song, Shezheng, et autres
Publié: (2023)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
VideoAutoArena: An Automated Arena for Evaluating Large Multimodal Models in Video Analysis through User Simulation
par: Luo, Ziyang, et autres
Publié: (2024)
par: Luo, Ziyang, et autres
Publié: (2024)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
par: Zhao, Zhixian, et autres
Publié: (2026)
par: Zhao, Zhixian, et autres
Publié: (2026)
ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs
par: Cui, Shiyao, et autres
Publié: (2025)
par: Cui, Shiyao, et autres
Publié: (2025)
Seeing Through Deception: Uncovering Misleading Creator Intent in Multimodal News with Vision-Language Models
par: Wu, Jiaying, et autres
Publié: (2025)
par: Wu, Jiaying, et autres
Publié: (2025)
Enhancing Multimodal Misinformation Detection by Replaying the Whole Story from Image Modality Perspective
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
How Far Are We from Generating Missing Modalities with Foundation Models?
par: Ke, Guanzhou, et autres
Publié: (2025)
par: Ke, Guanzhou, et autres
Publié: (2025)
Multi-task Prompt Words Learning for Social Media Content Generation
par: Xue, Haochen, et autres
Publié: (2024)
par: Xue, Haochen, et autres
Publié: (2024)
RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing
par: Zhang, Zilun, et autres
Publié: (2023)
par: Zhang, Zilun, et autres
Publié: (2023)
MIPS at SemEval-2024 Task 3: Multimodal Emotion-Cause Pair Extraction in Conversations with Multimodal Language Models
par: Cheng, Zebang, et autres
Publié: (2024)
par: Cheng, Zebang, et autres
Publié: (2024)
The Revolution of Multimodal Large Language Models: A Survey
par: Caffagni, Davide, et autres
Publié: (2024)
par: Caffagni, Davide, et autres
Publié: (2024)
Harmfully Manipulated Images Matter in Multimodal Misinformation Detection
par: Wang, Bing, et autres
Publié: (2024)
par: Wang, Bing, et autres
Publié: (2024)
Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models
par: Ye, Weihao, et autres
Publié: (2024)
par: Ye, Weihao, et autres
Publié: (2024)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025)
par: Chen, Yijing, et autres
Publié: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
par: Zhang, Bo, et autres
Publié: (2024)
par: Zhang, Bo, et autres
Publié: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
par: Hu, Anwen, et autres
Publié: (2023)
par: Hu, Anwen, et autres
Publié: (2023)
Learning Compact Vision Tokens for Efficient Large Multimodal Models
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding
par: Luo, Chuwei, et autres
Publié: (2022)
par: Luo, Chuwei, et autres
Publié: (2022)
Graph-Driven Multimodal Feature Learning Framework for Apparent Personality Assessment
par: Wang, Kangsheng, et autres
Publié: (2025)
par: Wang, Kangsheng, et autres
Publié: (2025)
M-MRE: Extending the Mutual Reinforcement Effect to Multimodal Information Extraction
par: Gan, Chengguang, et autres
Publié: (2025)
par: Gan, Chengguang, et autres
Publié: (2025)
Joint Modeling of Big Five and HEXACO for Multimodal Apparent Personality-trait Recognition
par: Masumura, Ryo, et autres
Publié: (2025)
par: Masumura, Ryo, et autres
Publié: (2025)
Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis
par: Bucciarelli, Davide, et autres
Publié: (2024)
par: Bucciarelli, Davide, et autres
Publié: (2024)
Documents similaires
-
OceanGPT: A Large Language Model for Ocean Science Tasks
par: Bi, Zhen, et autres
Publié: (2023) -
Spatial Knowledge Graph-Guided Multimodal Synthesis
par: Xue, Yida, et autres
Publié: (2025) -
Can We Edit Multimodal Large Language Models?
par: Cheng, Siyuan, et autres
Publié: (2023) -
Dynamic Self-adaptive Multiscale Distillation from Pre-trained Multimodal Large Model for Efficient Cross-modal Representation Learning
par: Liang, Zhengyang, et autres
Publié: (2024) -
Unified Hallucination Detection for Multimodal Large Language Models
par: Chen, Xiang, et autres
Publié: (2024)