Nomic Embed: Training a Reproducible Long Context Text Embedder
Fuente:
arXiv
Guardado en:
| Autores principales: | Nussbaum, Zach, Morris, John X., Duderstadt, Brandon, Mulyar, Andriy |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Nomic Embed Vision: Expanding the Latent Space
por: Nussbaum, Zach, et al.
Publicado: (2024)
por: Nussbaum, Zach, et al.
Publicado: (2024)
Training Sparse Mixture Of Experts Text Embedding Models
por: Nussbaum, Zach, et al.
Publicado: (2025)
por: Nussbaum, Zach, et al.
Publicado: (2025)
CoRNStack: High-Quality Contrastive Data for Better Code Retrieval and Reranking
por: Suresh, Tarun, et al.
Publicado: (2024)
por: Suresh, Tarun, et al.
Publicado: (2024)
PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting
por: Tsai, Yu-Che, et al.
Publicado: (2026)
por: Tsai, Yu-Che, et al.
Publicado: (2026)
Contextual Document Embeddings
por: Morris, John X., et al.
Publicado: (2024)
por: Morris, John X., et al.
Publicado: (2024)
LuxEmbedder: A Cross-Lingual Approach to Enhanced Luxembourgish Sentence Embeddings
por: Philippy, Fred, et al.
Publicado: (2024)
por: Philippy, Fred, et al.
Publicado: (2024)
Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks
por: Chung, Isaac, et al.
Publicado: (2025)
por: Chung, Isaac, et al.
Publicado: (2025)
Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings
por: Li, Shiyu, et al.
Publicado: (2025)
por: Li, Shiyu, et al.
Publicado: (2025)
NExtLong: Toward Effective Long-Context Training without Long Documents
por: Gao, Chaochen, et al.
Publicado: (2025)
por: Gao, Chaochen, et al.
Publicado: (2025)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
por: Jia, Junlong, et al.
Publicado: (2025)
por: Jia, Junlong, et al.
Publicado: (2025)
Training Text-to-Molecule Models with Context-Aware Tokenization
por: Kim, Seojin, et al.
Publicado: (2025)
por: Kim, Seojin, et al.
Publicado: (2025)
ACC: Compiling Agent Trajectories for Long-Context Training
por: Su, Qisheng, et al.
Publicado: (2026)
por: Su, Qisheng, et al.
Publicado: (2026)
Toward a digital twin of U.S. Congress
por: Helm, Hayden, et al.
Publicado: (2025)
por: Helm, Hayden, et al.
Publicado: (2025)
LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams
por: Wu, Yongxuan, et al.
Publicado: (2025)
por: Wu, Yongxuan, et al.
Publicado: (2025)
Retrieval Meets Reasoning: Dynamic In-Context Editing for Long-Text Understanding
por: Fei, Weizhi, et al.
Publicado: (2024)
por: Fei, Weizhi, et al.
Publicado: (2024)
Piccolo2: General Text Embedding with Multi-task Hybrid Loss Training
por: Huang, Junqin, et al.
Publicado: (2024)
por: Huang, Junqin, et al.
Publicado: (2024)
With Greater Text Comes Greater Necessity: Inference-Time Training Helps Long Text Generation
por: Wang, Y., et al.
Publicado: (2024)
por: Wang, Y., et al.
Publicado: (2024)
LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement
por: Ye, Zhifan, et al.
Publicado: (2025)
por: Ye, Zhifan, et al.
Publicado: (2025)
Learning to Detect Language Model Training Data via Active Reconstruction
por: Yin, Junjie Oscar, et al.
Publicado: (2026)
por: Yin, Junjie Oscar, et al.
Publicado: (2026)
Large Language Models Reproduce Racial Stereotypes When Used for Text Annotation
por: Törnberg, Petter
Publicado: (2026)
por: Törnberg, Petter
Publicado: (2026)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
por: Jang, Young Kyun, et al.
Publicado: (2024)
por: Jang, Young Kyun, et al.
Publicado: (2024)
AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction
por: Mankodiya, Harsh, et al.
Publicado: (2026)
por: Mankodiya, Harsh, et al.
Publicado: (2026)
Modular Techniques for Synthetic Long-Context Data Generation in Language Model Training and Evaluation
por: Subramanian, Seganrasan, et al.
Publicado: (2025)
por: Subramanian, Seganrasan, et al.
Publicado: (2025)
Towards Long Context Hallucination Detection
por: Liu, Siyi, et al.
Publicado: (2025)
por: Liu, Siyi, et al.
Publicado: (2025)
Bias in Text Embedding Models
por: Rakivnenko, Vasyl, et al.
Publicado: (2024)
por: Rakivnenko, Vasyl, et al.
Publicado: (2024)
Context-level Language Modeling by Learning Predictive Context Embeddings
por: Dai, Beiya, et al.
Publicado: (2025)
por: Dai, Beiya, et al.
Publicado: (2025)
Training With "Paraphrasing the Original Text" Teaches LLM to Better Retrieve in Long-context Tasks
por: Yu, Yijiong, et al.
Publicado: (2023)
por: Yu, Yijiong, et al.
Publicado: (2023)
One Size Does Not Fit All: Exploring Variable Thresholds for Distance-Based Multi-Label Text Classification
por: Van Nooten, Jens, et al.
Publicado: (2025)
por: Van Nooten, Jens, et al.
Publicado: (2025)
EmbeddingGemma: Powerful and Lightweight Text Representations
por: Vera, Henrique Schechter, et al.
Publicado: (2025)
por: Vera, Henrique Schechter, et al.
Publicado: (2025)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
por: Zhao, Liang, et al.
Publicado: (2024)
por: Zhao, Liang, et al.
Publicado: (2024)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
por: Tian, Junfeng, et al.
Publicado: (2024)
por: Tian, Junfeng, et al.
Publicado: (2024)
Never Lost in the Middle: Mastering Long-Context Question Answering with Position-Agnostic Decompositional Training
por: He, Junqing, et al.
Publicado: (2023)
por: He, Junqing, et al.
Publicado: (2023)
LooGLE: Can Long-Context Language Models Understand Long Contexts?
por: Li, Jiaqi, et al.
Publicado: (2023)
por: Li, Jiaqi, et al.
Publicado: (2023)
Context Memorization for Efficient Long Context Generation
por: Okoshi, Yasuyuki, et al.
Publicado: (2026)
por: Okoshi, Yasuyuki, et al.
Publicado: (2026)
German Text Embedding Clustering Benchmark
por: Wehrli, Silvan, et al.
Publicado: (2024)
por: Wehrli, Silvan, et al.
Publicado: (2024)
InfLLM: Training-Free Long-Context Extrapolation for LLMs with an Efficient Context Memory
por: Xiao, Chaojun, et al.
Publicado: (2024)
por: Xiao, Chaojun, et al.
Publicado: (2024)
The Scandinavian Embedding Benchmarks: Comprehensive Assessment of Multilingual and Monolingual Text Embedding
por: Enevoldsen, Kenneth, et al.
Publicado: (2024)
por: Enevoldsen, Kenneth, et al.
Publicado: (2024)
Are Long-LLMs A Necessity For Long-Context Tasks?
por: Qian, Hongjin, et al.
Publicado: (2024)
por: Qian, Hongjin, et al.
Publicado: (2024)
APCE: Adaptive Progressive Context Expansion for Long Context Processing
por: Lee, Baisub, et al.
Publicado: (2025)
por: Lee, Baisub, et al.
Publicado: (2025)
LongHeads: Multi-Head Attention is Secretly a Long Context Processor
por: Lu, Yi, et al.
Publicado: (2024)
por: Lu, Yi, et al.
Publicado: (2024)
Ejemplares similares
-
Nomic Embed Vision: Expanding the Latent Space
por: Nussbaum, Zach, et al.
Publicado: (2024) -
Training Sparse Mixture Of Experts Text Embedding Models
por: Nussbaum, Zach, et al.
Publicado: (2025) -
CoRNStack: High-Quality Contrastive Data for Better Code Retrieval and Reranking
por: Suresh, Tarun, et al.
Publicado: (2024) -
PromptEmbedder:: Efficient and Transferable Text Embedding via Dual-LLM Soft Prompting
por: Tsai, Yu-Che, et al.
Publicado: (2026) -
Contextual Document Embeddings
por: Morris, John X., et al.
Publicado: (2024)