Text Embeddings by Weakly-Supervised Contrastive Pre-training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Liang, Yang, Nan, Huang, Xiaolong, Jiao, Binxing, Yang, Linjun, Jiang, Daxin, Majumder, Rangan, Wei, Furu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2022
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Improving Text Embeddings with Large Language Models
von: Wang, Liang, et al.
Veröffentlicht: (2023)
von: Wang, Liang, et al.
Veröffentlicht: (2023)
Multilingual E5 Text Embeddings: A Technical Report
von: Wang, Liang, et al.
Veröffentlicht: (2024)
von: Wang, Liang, et al.
Veröffentlicht: (2024)
Large Search Model: Redefining Search Stack in the Era of LLMs
von: Wang, Liang, et al.
Veröffentlicht: (2023)
von: Wang, Liang, et al.
Veröffentlicht: (2023)
Bootstrap Your Own Context Length
von: Wang, Liang, et al.
Veröffentlicht: (2024)
von: Wang, Liang, et al.
Veröffentlicht: (2024)
Chain-of-Retrieval Augmented Generation
von: Wang, Liang, et al.
Veröffentlicht: (2025)
von: Wang, Liang, et al.
Veröffentlicht: (2025)
Learning to Retrieve In-Context Examples for Large Language Models
von: Wang, Liang, et al.
Veröffentlicht: (2023)
von: Wang, Liang, et al.
Veröffentlicht: (2023)
Little Giants: Synthesizing High-Quality Embedding Data at Scale
von: Chen, Haonan, et al.
Veröffentlicht: (2024)
von: Chen, Haonan, et al.
Veröffentlicht: (2024)
Modeling Sequential Sentence Relation to Improve Cross-lingual Dense Retrieval
von: Zhang, Shunyu, et al.
Veröffentlicht: (2023)
von: Zhang, Shunyu, et al.
Veröffentlicht: (2023)
Pre-training Cross-lingual Open Domain Question Answering with Large-scale Synthetic Supervision
von: Jiang, Fan, et al.
Veröffentlicht: (2024)
von: Jiang, Fan, et al.
Veröffentlicht: (2024)
RecGPT: Generative Pre-training for Text-based Recommendation
von: Ngo, Hoang, et al.
Veröffentlicht: (2024)
von: Ngo, Hoang, et al.
Veröffentlicht: (2024)
FinMTEB: Finance Massive Text Embedding Benchmark
von: Tang, Yixuan, et al.
Veröffentlicht: (2025)
von: Tang, Yixuan, et al.
Veröffentlicht: (2025)
ColBERT-Zero: To Pre-train Or Not To Pre-train ColBERT models
von: Chaffin, Antoine, et al.
Veröffentlicht: (2026)
von: Chaffin, Antoine, et al.
Veröffentlicht: (2026)
Are ID Embeddings Necessary? Whitening Pre-trained Text Embeddings for Effective Sequential Recommendation
von: Zhang, Lingzi, et al.
Veröffentlicht: (2024)
von: Zhang, Lingzi, et al.
Veröffentlicht: (2024)
Rethinking the Privacy of Text Embeddings: A Reproducibility Study of "Text Embeddings Reveal (Almost) As Much As Text"
von: Seputis, Dominykas, et al.
Veröffentlicht: (2025)
von: Seputis, Dominykas, et al.
Veröffentlicht: (2025)
Contrastive Multi-graph Learning with Neighbor Hierarchical Sifting for Semi-supervised Text Classification
von: Ai, Wei, et al.
Veröffentlicht: (2024)
von: Ai, Wei, et al.
Veröffentlicht: (2024)
ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
von: Chen, Jianlyu, et al.
Veröffentlicht: (2025)
von: Chen, Jianlyu, et al.
Veröffentlicht: (2025)
Adapting General-Purpose Embedding Models to Private Datasets Using Keyword-based Retrieval
von: Wei, Yubai, et al.
Veröffentlicht: (2025)
von: Wei, Yubai, et al.
Veröffentlicht: (2025)
Retrieving Contextual Information for Long-Form Question Answering using Weak Supervision
von: Christmann, Philipp, et al.
Veröffentlicht: (2024)
von: Christmann, Philipp, et al.
Veröffentlicht: (2024)
ChEmbed: Enhancing Chemical Literature Search Through Domain-Specific Text Embeddings
von: Kasmaee, Ali Shiraee, et al.
Veröffentlicht: (2025)
von: Kasmaee, Ali Shiraee, et al.
Veröffentlicht: (2025)
JFinTEB: Japanese Financial Text Embedding Benchmark
von: Suzuki, Masahiro, et al.
Veröffentlicht: (2026)
von: Suzuki, Masahiro, et al.
Veröffentlicht: (2026)
Multi-Granularity Sequence Denoising with Weakly Supervised Signal for Sequential Recommendation
von: Li, Liang, et al.
Veröffentlicht: (2025)
von: Li, Liang, et al.
Veröffentlicht: (2025)
Leveraging Large Language Models for Knowledge-free Weak Supervision in Clinical Natural Language Processing
von: Hsu, Enshuo, et al.
Veröffentlicht: (2024)
von: Hsu, Enshuo, et al.
Veröffentlicht: (2024)
Enhancing Lexicon-Based Text Embeddings with Large Language Models
von: Lei, Yibin, et al.
Veröffentlicht: (2025)
von: Lei, Yibin, et al.
Veröffentlicht: (2025)
ListConRanker: A Contrastive Text Reranker with Listwise Encoding
von: Liu, Junlong, et al.
Veröffentlicht: (2025)
von: Liu, Junlong, et al.
Veröffentlicht: (2025)
Drop your Decoder: Pre-training with Bag-of-Word Prediction for Dense Passage Retrieval
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
von: Ma, Guangyuan, et al.
Veröffentlicht: (2024)
EmbeddingRWKV: State-Centric Retrieval with Reusable States
von: Hou, Haowen, et al.
Veröffentlicht: (2026)
von: Hou, Haowen, et al.
Veröffentlicht: (2026)
Contrastive Learning Using Graph Embeddings for Domain Adaptation of Language Models in the Process Industry
von: Zhukova, Anastasia, et al.
Veröffentlicht: (2025)
von: Zhukova, Anastasia, et al.
Veröffentlicht: (2025)
Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks
von: Babakhin, Yauhen, et al.
Veröffentlicht: (2025)
von: Babakhin, Yauhen, et al.
Veröffentlicht: (2025)
Leveraging Passage Embeddings for Efficient Listwise Reranking with Large Language Models
von: Liu, Qi, et al.
Veröffentlicht: (2024)
von: Liu, Qi, et al.
Veröffentlicht: (2024)
Hound: Hunting Supervision Signals for Few and Zero Shot Node Classification on Text-attributed Graph
von: Wang, Yuxiang, et al.
Veröffentlicht: (2024)
von: Wang, Yuxiang, et al.
Veröffentlicht: (2024)
Bagging-Based Model Merging for Robust General Text Embeddings
von: Zhang, Hengran, et al.
Veröffentlicht: (2026)
von: Zhang, Hengran, et al.
Veröffentlicht: (2026)
Pre-training vs. Fine-tuning: A Reproducibility Study on Dense Retrieval Knowledge Acquisition
von: Yao, Zheng, et al.
Veröffentlicht: (2025)
von: Yao, Zheng, et al.
Veröffentlicht: (2025)
Applying Text Embedding Models for Efficient Analysis in Labeled Property Graphs
von: Podstawski, Michal
Veröffentlicht: (2025)
von: Podstawski, Michal
Veröffentlicht: (2025)
Pooling and Semantic Shift: The Fundamental Challenges in Long Text Embedding and Retrieval
von: Gao, Hang, et al.
Veröffentlicht: (2026)
von: Gao, Hang, et al.
Veröffentlicht: (2026)
A Text is Worth Several Tokens: Text Embedding from LLMs Secretly Aligns Well with The Key Tokens
von: Nie, Zhijie, et al.
Veröffentlicht: (2024)
von: Nie, Zhijie, et al.
Veröffentlicht: (2024)
Contrastive Pre-training for Deep Session Data Understanding
von: Li, Zixuan, et al.
Veröffentlicht: (2024)
von: Li, Zixuan, et al.
Veröffentlicht: (2024)
Pooling And Attention: What Are Effective Designs For LLM-Based Embedding Models?
von: Tang, Yixuan, et al.
Veröffentlicht: (2024)
von: Tang, Yixuan, et al.
Veröffentlicht: (2024)
Do We Need Domain-Specific Embedding Models? An Empirical Investigation
von: Tang, Yixuan, et al.
Veröffentlicht: (2024)
von: Tang, Yixuan, et al.
Veröffentlicht: (2024)
Zero-Shot Contextual Embeddings via Offline Synthetic Corpus Generation
von: Lippmann, Philip, et al.
Veröffentlicht: (2025)
von: Lippmann, Philip, et al.
Veröffentlicht: (2025)
QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation
von: Min, Dehai, et al.
Veröffentlicht: (2025)
von: Min, Dehai, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Improving Text Embeddings with Large Language Models
von: Wang, Liang, et al.
Veröffentlicht: (2023) -
Multilingual E5 Text Embeddings: A Technical Report
von: Wang, Liang, et al.
Veröffentlicht: (2024) -
Large Search Model: Redefining Search Stack in the Era of LLMs
von: Wang, Liang, et al.
Veröffentlicht: (2023) -
Bootstrap Your Own Context Length
von: Wang, Liang, et al.
Veröffentlicht: (2024) -
Chain-of-Retrieval Augmented Generation
von: Wang, Liang, et al.
Veröffentlicht: (2025)