Omni-Embed-Nemotron: A Unified Multimodal Retrieval Model for Text, Image, Audio, and Video
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xu, Mengyao, Zhou, Wenfei, Babakhin, Yauhen, Moreira, Gabriel, Ak, Ronay, Osmulski, Radek, Liu, Bo, Oldridge, Even, Schifferer, Benedikt |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks
par: Babakhin, Yauhen, et autres
Publié: (2025)
par: Babakhin, Yauhen, et autres
Publié: (2025)
Llama Nemoretriever Colembed: Top-Performing Text-Image Retrieval Model
par: Xu, Mengyao, et autres
Publié: (2025)
par: Xu, Mengyao, et autres
Publié: (2025)
Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval
par: Moreira, Gabriel de Souza P., et autres
Publié: (2026)
par: Moreira, Gabriel de Souza P., et autres
Publié: (2026)
Enhancing Q&A Text Retrieval with Ranking Models: Benchmarking, fine-tuning and deploying Rerankers for RAG
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
NV-Retriever: Improving text embedding models with effective hard-negative mining
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)
MIRACL-VISION: A Large, multilingual, visual document retrieval benchmark
par: Osmulski, Radek, et autres
Publié: (2025)
par: Osmulski, Radek, et autres
Publié: (2025)
Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval
par: Yoo, HaeJun, et autres
Publié: (2026)
par: Yoo, HaeJun, et autres
Publié: (2026)
Nemotron 3 Nano Omni: Efficient and Open Multimodal Intelligence
par: NVIDIA, et autres
Publié: (2026)
par: NVIDIA, et autres
Publié: (2026)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
par: Liu, Yunze, et autres
Publié: (2026)
par: Liu, Yunze, et autres
Publié: (2026)
AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation
par: Wang, Le, et autres
Publié: (2025)
par: Wang, Le, et autres
Publié: (2025)
H2O-Danube3 Technical Report
par: Pfeiffer, Pascal, et autres
Publié: (2024)
par: Pfeiffer, Pascal, et autres
Publié: (2024)
OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
par: Wang, Zhongjian, et autres
Publié: (2025)
par: Wang, Zhongjian, et autres
Publié: (2025)
Vezetők, testületek, felelősség a felsőoktatási intézményekben, különös tekintettel az állami egyetemekre
par: Rónay, Zoltán
Publié: (2025)
par: Rónay, Zoltán
Publié: (2025)
De la evagación a la evolución?
par: Alicia Ronay
Publié: (2004)
par: Alicia Ronay
Publié: (2004)
OmniCorpus: A Unified Multimodal Corpus of 10 Billion-Level Images Interleaved with Text
par: Li, Qingyun, et autres
Publié: (2024)
par: Li, Qingyun, et autres
Publié: (2024)
H2O-Danube-1.8B Technical Report
par: Singer, Philipp, et autres
Publié: (2024)
par: Singer, Philipp, et autres
Publié: (2024)
GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio
par: Zhu, Zhenhao, et autres
Publié: (2026)
par: Zhu, Zhenhao, et autres
Publié: (2026)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
par: Liang, Susan, et autres
Publié: (2026)
par: Liang, Susan, et autres
Publié: (2026)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
par: Guo, Xu, et autres
Publié: (2026)
par: Guo, Xu, et autres
Publié: (2026)
Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing
par: Liu, Jialun, et autres
Publié: (2026)
par: Liu, Jialun, et autres
Publié: (2026)
OmniCam: Unified Multimodal Video Generation via Camera Control
par: Yang, Xiaoda, et autres
Publié: (2025)
par: Yang, Xiaoda, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed
par: Zhan, Jiaqi Samantha, et autres
Publié: (2025)
par: Zhan, Jiaqi Samantha, et autres
Publié: (2025)
Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video
par: Kyaw, Alexander Htet, et autres
Publié: (2025)
par: Kyaw, Alexander Htet, et autres
Publié: (2025)
Context-Aware Search and Retrieval Over Erasure Channels
par: Ghasvarianjahromi, Sara, et autres
Publié: (2025)
par: Ghasvarianjahromi, Sara, et autres
Publié: (2025)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
par: Zhou, Donghao, et autres
Publié: (2026)
par: Zhou, Donghao, et autres
Publié: (2026)
OmniBridge: Unified Multimodal Understanding, Generation, and Retrieval via Latent Space Alignment
par: Xiao, Teng, et autres
Publié: (2025)
par: Xiao, Teng, et autres
Publié: (2025)
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
par: Li, Caorui, et autres
Publié: (2025)
par: Li, Caorui, et autres
Publié: (2025)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
OmniRetrieval: Unified Retrieval across Heterogeneous Knowledge Sources
par: Baek, Jinheon, et autres
Publié: (2026)
par: Baek, Jinheon, et autres
Publié: (2026)
OmniAudio: Generating Spatial Audio from 360-Degree Video
par: Liu, Huadai, et autres
Publié: (2025)
par: Liu, Huadai, et autres
Publié: (2025)
Unifying Multimodal Retrieval via Document Screenshot Embedding
par: Ma, Xueguang, et autres
Publié: (2024)
par: Ma, Xueguang, et autres
Publié: (2024)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
par: Dai, Yifan, et autres
Publié: (2026)
par: Dai, Yifan, et autres
Publié: (2026)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
par: Tong, Wenwen, et autres
Publié: (2025)
par: Tong, Wenwen, et autres
Publié: (2025)
TIGeR: Unifying Text-to-Image Generation and Retrieval with Large Multimodal Models
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
Text Is MASS: Modeling as Stochastic Embedding for Text-Video Retrieval
par: Wang, Jiamian, et autres
Publié: (2024)
par: Wang, Jiamian, et autres
Publié: (2024)
Omni-Video: Democratizing Unified Video Understanding and Generation
par: Tan, Zhiyu, et autres
Publié: (2025)
par: Tan, Zhiyu, et autres
Publié: (2025)
Documents similaires
-
Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks
par: Babakhin, Yauhen, et autres
Publié: (2025) -
Llama Nemoretriever Colembed: Top-Performing Text-Image Retrieval Model
par: Xu, Mengyao, et autres
Publié: (2025) -
Nemotron ColEmbed V2: Top-Performing Late Interaction Embedding Models for Visual Document Retrieval
par: Moreira, Gabriel de Souza P., et autres
Publié: (2026) -
Enhancing Q&A Text Retrieval with Ranking Models: Benchmarking, fine-tuning and deploying Rerankers for RAG
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024) -
NV-Retriever: Improving text embedding models with effective hard-negative mining
par: Moreira, Gabriel de Souza P., et autres
Publié: (2024)