Multi-Modal Generative Embedding Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Feipeng, Xue, Hongwei, Wang, Guangting, Zhou, Yizhou, Rao, Fengyun, Yan, Shilin, Zhang, Yueyi, Wu, Siying, Shou, Mike Zheng, Sun, Xiaoyan |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visual Perception by Large Language Model's Weights
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
di: Ma, Feipeng, et al.
Pubblicazione: (2024)
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
di: Yang, Jian, et al.
Pubblicazione: (2024)
di: Yang, Jian, et al.
Pubblicazione: (2024)
Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects
di: Li, Wei, et al.
Pubblicazione: (2025)
di: Li, Wei, et al.
Pubblicazione: (2025)
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
di: Wu, Peixi, et al.
Pubblicazione: (2026)
di: Wu, Peixi, et al.
Pubblicazione: (2026)
WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning
di: Yang, Jie, et al.
Pubblicazione: (2025)
di: Yang, Jie, et al.
Pubblicazione: (2025)
HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
di: Wei, Zhixiang, et al.
Pubblicazione: (2025)
Automated Movie Generation via Multi-Agent CoT Planning
di: Wu, Weijia, et al.
Pubblicazione: (2025)
di: Wu, Weijia, et al.
Pubblicazione: (2025)
MMhops-R1: Multimodal Multi-hop Reasoning
di: Zhang, Tao, et al.
Pubblicazione: (2025)
di: Zhang, Tao, et al.
Pubblicazione: (2025)
ObjEmbed: Towards Universal Multimodal Object Embeddings
di: Fu, Shenghao, et al.
Pubblicazione: (2026)
di: Fu, Shenghao, et al.
Pubblicazione: (2026)
Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction
di: Yan, Shannan, et al.
Pubblicazione: (2026)
di: Yan, Shannan, et al.
Pubblicazione: (2026)
Multi-human Interactive Talking Dataset
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
di: Zhu, Zeyu, et al.
Pubblicazione: (2025)
Instruction-Oriented Preference Alignment for Enhancing Multi-Modal Comprehension Capability of MLLMs
di: Wang, Zitian, et al.
Pubblicazione: (2025)
di: Wang, Zitian, et al.
Pubblicazione: (2025)
MakeAnything: Harnessing Diffusion Transformers for Multi-Domain Procedural Sequence Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
Number it: Temporal Grounding Videos like Flipping Manga
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
di: Wu, Yongliang, et al.
Pubblicazione: (2024)
P-Flow: Prompting Visual Effects Generation
di: Zhao, Rui, et al.
Pubblicazione: (2026)
di: Zhao, Rui, et al.
Pubblicazione: (2026)
Anatomical Consistency Distillation and Inconsistency Synthesis for Brain Tumor Segmentation with Missing Modalities
di: Zhang, Zheyu, et al.
Pubblicazione: (2024)
di: Zhang, Zheyu, et al.
Pubblicazione: (2024)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
di: Lin, Yiqi, et al.
Pubblicazione: (2025)
Scene Adaptive Sparse Transformer for Event-based Object Detection
di: Peng, Yansong, et al.
Pubblicazione: (2024)
di: Peng, Yansong, et al.
Pubblicazione: (2024)
SSCM: A Spatial-Semantic Consistent Model for Multi-Contrast MRI Super-Resolution
di: Wu, Xiaoman, et al.
Pubblicazione: (2025)
di: Wu, Xiaoman, et al.
Pubblicazione: (2025)
Deep Multi-Threshold Spiking-UNet for Image Processing
di: Li, Hebei, et al.
Pubblicazione: (2023)
di: Li, Hebei, et al.
Pubblicazione: (2023)
Leveraging Visual Tokens for Extended Text Contexts in Multi-Modal Learning
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
di: Wang, Alex Jinpeng, et al.
Pubblicazione: (2024)
VLog: Video-Language Models by Generative Retrieval of Narration Vocabulary
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
di: Lin, Kevin Qinghong, et al.
Pubblicazione: (2025)
Spatial-Semantic Collaborative Cropping for User Generated Content
di: Su, Yukun, et al.
Pubblicazione: (2024)
di: Su, Yukun, et al.
Pubblicazione: (2024)
D-FINE: Redefine Regression Task in DETRs as Fine-grained Distribution Refinement
di: Peng, Yansong, et al.
Pubblicazione: (2024)
di: Peng, Yansong, et al.
Pubblicazione: (2024)
EvTexture: Event-driven Texture Enhancement for Video Super-Resolution
di: Kai, Dachun, et al.
Pubblicazione: (2024)
di: Kai, Dachun, et al.
Pubblicazione: (2024)
DoraCycle: Domain-Oriented Adaptation of Unified Generative Model in Multimodal Cycles
di: Zhao, Rui, et al.
Pubblicazione: (2025)
di: Zhao, Rui, et al.
Pubblicazione: (2025)
Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
di: Zhao, Henry Hengyuan, et al.
Pubblicazione: (2023)
ReGenNet: Towards Human Action-Reaction Synthesis
di: Xu, Liang, et al.
Pubblicazione: (2024)
di: Xu, Liang, et al.
Pubblicazione: (2024)
Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes
di: Li, Pengxiang, et al.
Pubblicazione: (2026)
di: Li, Pengxiang, et al.
Pubblicazione: (2026)
TPDiff: Temporal Pyramid Video Diffusion Model
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
di: Ran, Lingmin, et al.
Pubblicazione: (2025)
D-AR: Diffusion via Autoregressive Models
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
di: Gao, Ziteng, et al.
Pubblicazione: (2025)
Ego-centric Predictive Model Conditioned on Hand Trajectories
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
di: Zhang, Binjie, et al.
Pubblicazione: (2025)
ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights
di: Lei, Weixian, et al.
Pubblicazione: (2023)
di: Lei, Weixian, et al.
Pubblicazione: (2023)
WAVE: Learning Unified & Versatile Audio-Visual Embeddings with Multimodal LLM
di: Tang, Changli, et al.
Pubblicazione: (2025)
di: Tang, Changli, et al.
Pubblicazione: (2025)
R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization
di: Yang, Yi, et al.
Pubblicazione: (2025)
di: Yang, Yi, et al.
Pubblicazione: (2025)
RingID: Rethinking Tree-Ring Watermarking for Enhanced Multi-Key Identification
di: Ci, Hai, et al.
Pubblicazione: (2024)
di: Ci, Hai, et al.
Pubblicazione: (2024)
Mitty: Diffusion-based Human-to-Robot Video Generation
di: Song, Yiren, et al.
Pubblicazione: (2025)
di: Song, Yiren, et al.
Pubblicazione: (2025)
OmniPSD: Layered PSD Generation with Diffusion Transformer
di: Liu, Cheng, et al.
Pubblicazione: (2025)
di: Liu, Cheng, et al.
Pubblicazione: (2025)
StreamingEffect: Real-Time Human-Centric Video Effect Generation
di: Song, Yiren, et al.
Pubblicazione: (2026)
di: Song, Yiren, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Visual Perception by Large Language Model's Weights
di: Ma, Feipeng, et al.
Pubblicazione: (2024) -
EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model
di: Ma, Feipeng, et al.
Pubblicazione: (2024) -
MMAR: Towards Lossless Multi-Modal Auto-Regressive Probabilistic Modeling
di: Yang, Jian, et al.
Pubblicazione: (2024) -
Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects
di: Li, Wei, et al.
Pubblicazione: (2025) -
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
di: Wu, Peixi, et al.
Pubblicazione: (2026)