LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhu, Bin, Lin, Bin, Ning, Munan, Yan, Yang, Cui, Jiaxi, Wang, HongFa, Pang, Yatian, Jiang, Wenhao, Zhang, Junwu, Li, Zongwei, Zhang, Wancai, Li, Zhifeng, Liu, Wei, Yuan, Li |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2023
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024)
von: Lin, Bin, et al.
Veröffentlicht: (2024)
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
von: Lin, Bin, et al.
Veröffentlicht: (2023)
von: Lin, Bin, et al.
Veröffentlicht: (2023)
Chatlaw: A Multi-Agent Collaborative Legal Assistant with Knowledge Graph Enhanced Mixture-of-Experts Large Language Model
von: Cui, Jiaxi, et al.
Veröffentlicht: (2023)
von: Cui, Jiaxi, et al.
Veröffentlicht: (2023)
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
von: Jin, Peng, et al.
Veröffentlicht: (2023)
von: Jin, Peng, et al.
Veröffentlicht: (2023)
Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle
von: Tang, Zhenyu, et al.
Veröffentlicht: (2024)
von: Tang, Zhenyu, et al.
Veröffentlicht: (2024)
Temporal Entailment Pretraining for Clinical Language Models over EHR Data
von: Tanaka, Tatsunori, et al.
Veröffentlicht: (2025)
von: Tanaka, Tatsunori, et al.
Veröffentlicht: (2025)
LLMBind: A Unified Modality-Task Integration Framework
von: Zhu, Bin, et al.
Veröffentlicht: (2024)
von: Zhu, Bin, et al.
Veröffentlicht: (2024)
Simulation of Language Evolution under Regulated Social Media Platforms: A Synergistic Approach of Large Language Models and Genetic Algorithms
von: Cai, Jinyu, et al.
Veröffentlicht: (2025)
von: Cai, Jinyu, et al.
Veröffentlicht: (2025)
SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video
von: Zhao, Chengshu, et al.
Veröffentlicht: (2025)
von: Zhao, Chengshu, et al.
Veröffentlicht: (2025)
Moral Reasoning Across Languages: The Critical Role of Low-Resource Languages in LLMs
von: Zhou, Huichi, et al.
Veröffentlicht: (2025)
von: Zhou, Huichi, et al.
Veröffentlicht: (2025)
MolBind: Multimodal Alignment of Language, Molecules, and Proteins
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
von: Xiao, Teng, et al.
Veröffentlicht: (2024)
AlignGPT: Multi-modal Large Language Models with Adaptive Alignment Capability
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
von: Zhao, Fei, et al.
Veröffentlicht: (2024)
Unleashing Vision-Language Semantics for Deepfake Video Detection
von: Zhu, Jiawen, et al.
Veröffentlicht: (2026)
von: Zhu, Jiawen, et al.
Veröffentlicht: (2026)
A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models
von: Chen, Huiyao, et al.
Veröffentlicht: (2025)
von: Chen, Huiyao, et al.
Veröffentlicht: (2025)
WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation
von: Niu, Yuwei, et al.
Veröffentlicht: (2025)
von: Niu, Yuwei, et al.
Veröffentlicht: (2025)
Object-centric Binding in Contrastive Language-Image Pretraining
von: Assouel, Rim, et al.
Veröffentlicht: (2025)
von: Assouel, Rim, et al.
Veröffentlicht: (2025)
Language Evolution for Evading Social Media Regulation via LLM-based Multi-agent Simulation
von: Cai, Jinyu, et al.
Veröffentlicht: (2024)
von: Cai, Jinyu, et al.
Veröffentlicht: (2024)
Do Multimodal Language Models Really Understand Direction? A Benchmark for Compass Direction Reasoning
von: Yin, Hang, et al.
Veröffentlicht: (2024)
von: Yin, Hang, et al.
Veröffentlicht: (2024)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Unveiling Deep Semantic Uncertainty Perception for Language-Anchored Multi-modal Vision-Brain Alignment
von: Feng, Zehui, et al.
Veröffentlicht: (2025)
von: Feng, Zehui, et al.
Veröffentlicht: (2025)
MdaIF: Robust One-Stop Multi-Degradation-Aware Image Fusion with Language-Driven Semantics
von: Li, Jing, et al.
Veröffentlicht: (2025)
von: Li, Jing, et al.
Veröffentlicht: (2025)
LLMER: Crafting Interactive Extended Reality Worlds with JSON Data Generated by Large Language Models
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
von: Wen, Zichen, et al.
Veröffentlicht: (2025)
Enhancing Coreference Resolution with Pretrained Language Models: Bridging the Gap Between Syntax and Semantics
von: Liu, Xingzu, et al.
Veröffentlicht: (2025)
von: Liu, Xingzu, et al.
Veröffentlicht: (2025)
InfoCLIP: Bridging Vision-Language Pretraining and Open-Vocabulary Semantic Segmentation via Information-Theoretic Alignment Transfer
von: Yuan, Muyao, et al.
Veröffentlicht: (2025)
von: Yuan, Muyao, et al.
Veröffentlicht: (2025)
SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment
von: Lu, Wenbo
Veröffentlicht: (2025)
von: Lu, Wenbo
Veröffentlicht: (2025)
Enhance Vision-Language Alignment with Noise
von: Huang, Sida, et al.
Veröffentlicht: (2024)
von: Huang, Sida, et al.
Veröffentlicht: (2024)
MASS: Mathematical Data Selection via Skill Graphs for Pretraining Large Language Models
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
von: Li, Jiazheng, et al.
Veröffentlicht: (2025)
SpikeCLIP: A Contrastive Language-Image Pretrained Spiking Neural Network
von: Lv, Changze, et al.
Veröffentlicht: (2023)
von: Lv, Changze, et al.
Veröffentlicht: (2023)
LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety
von: Yang, Junxiao, et al.
Veröffentlicht: (2026)
von: Yang, Junxiao, et al.
Veröffentlicht: (2026)
Semantics-enhanced Cross-modal Masked Image Modeling for Vision-Language Pre-training
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
von: Liu, Haowei, et al.
Veröffentlicht: (2024)
Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection
von: Fan, Yuanting, et al.
Veröffentlicht: (2025)
von: Fan, Yuanting, et al.
Veröffentlicht: (2025)
Semantic Alignment for Multimodal Large Language Models
von: Wu, Tao, et al.
Veröffentlicht: (2024)
von: Wu, Tao, et al.
Veröffentlicht: (2024)
Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models
von: Li, Shengzhi, et al.
Veröffentlicht: (2024)
von: Li, Shengzhi, et al.
Veröffentlicht: (2024)
UPME: An Unsupervised Peer Review Framework for Multimodal Large Language Model Evaluation
von: Zhang, Qihui, et al.
Veröffentlicht: (2025)
von: Zhang, Qihui, et al.
Veröffentlicht: (2025)
Visual Language Model based Cross-modal Semantic Communication Systems
von: Jiang, Feibo, et al.
Veröffentlicht: (2024)
von: Jiang, Feibo, et al.
Veröffentlicht: (2024)
KELPS: A Framework for Verified Multi-Language Autoformalization via Semantic-Syntactic Alignment
von: Zhang, Jiyao, et al.
Veröffentlicht: (2025)
von: Zhang, Jiyao, et al.
Veröffentlicht: (2025)
DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation
von: Li, Zijun, et al.
Veröffentlicht: (2026)
von: Li, Zijun, et al.
Veröffentlicht: (2026)
CPCLDETECTOR: Knowledge Enhancement and Alignment Selection for Chinese Patronizing and Condescending Language Detection
von: Yang, Jiaxun, et al.
Veröffentlicht: (2025)
von: Yang, Jiaxun, et al.
Veröffentlicht: (2025)
Set the Clock: Temporal Alignment of Pretrained Language Models
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
von: Zhao, Bowen, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
von: Lin, Bin, et al.
Veröffentlicht: (2024) -
Video-LLaVA: Learning United Visual Representation by Alignment Before Projection
von: Lin, Bin, et al.
Veröffentlicht: (2023) -
Chatlaw: A Multi-Agent Collaborative Legal Assistant with Knowledge Graph Enhanced Mixture-of-Experts Large Language Model
von: Cui, Jiaxi, et al.
Veröffentlicht: (2023) -
Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding
von: Jin, Peng, et al.
Veröffentlicht: (2023) -
Cycle3D: High-quality and Consistent Image-to-3D Generation via Generation-Reconstruction Cycle
von: Tang, Zhenyu, et al.
Veröffentlicht: (2024)