Conan-embedding: General Text Embedding with More and Better Negative Samples
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Shiyu, Tang, Yang, Chen, Shizhe, Chen, Xi |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings
por: Li, Shiyu, et al.
Publicado: (2025)
por: Li, Shiyu, et al.
Publicado: (2025)
HiNS: Hierarchical Negative Sampling for More Comprehensive Memory Retrieval Embedding Model
por: Tian, Motong, et al.
Publicado: (2026)
por: Tian, Motong, et al.
Publicado: (2026)
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
por: Li, Shiyu, et al.
Publicado: (2025)
por: Li, Shiyu, et al.
Publicado: (2025)
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
por: Tang, Yang, et al.
Publicado: (2025)
por: Tang, Yang, et al.
Publicado: (2025)
Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text Embeddings
por: Pan, Tengyu, et al.
Publicado: (2025)
por: Pan, Tengyu, et al.
Publicado: (2025)
FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents
por: Pham, Quang Hieu, et al.
Publicado: (2026)
por: Pham, Quang Hieu, et al.
Publicado: (2026)
Language Models that Think, Chat Better
por: Bhaskar, Adithya, et al.
Publicado: (2025)
por: Bhaskar, Adithya, et al.
Publicado: (2025)
Interleaving Reasoning for Better Text-to-Image Generation
por: Huang, Wenxuan, et al.
Publicado: (2025)
por: Huang, Wenxuan, et al.
Publicado: (2025)
KV-Embedding: Training-free Text Embedding via Internal KV Re-routing in Decoder-only LLMs
por: Tang, Yixuan, et al.
Publicado: (2026)
por: Tang, Yixuan, et al.
Publicado: (2026)
A Better LLM Evaluator for Text Generation: The Impact of Prompt Output Sequencing and Optimization
por: Chu, KuanChao, et al.
Publicado: (2024)
por: Chu, KuanChao, et al.
Publicado: (2024)
More Samples or More Prompts? Exploring Effective In-Context Sampling for LLM Few-Shot Prompt Engineering
por: Yao, Bingsheng, et al.
Publicado: (2023)
por: Yao, Bingsheng, et al.
Publicado: (2023)
Optimal Embedding Guided Negative Sample Generation for Knowledge Graph Link Prediction
por: Takamoto, Makoto, et al.
Publicado: (2025)
por: Takamoto, Makoto, et al.
Publicado: (2025)
Let LLMs Speak Embedding Languages: Generative Text Embeddings via Iterative Contrastive Refinement
por: Tsai, Yu-Che, et al.
Publicado: (2025)
por: Tsai, Yu-Che, et al.
Publicado: (2025)
FinMTEB: Finance Massive Text Embedding Benchmark
por: Tang, Yixuan, et al.
Publicado: (2025)
por: Tang, Yixuan, et al.
Publicado: (2025)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
por: Wu, Yihang, et al.
Publicado: (2024)
por: Wu, Yihang, et al.
Publicado: (2024)
No More Distractions: an Adaptive Up-Sampling Algorithm to Reduce Data Artifacts
por: Chen, Han
Publicado: (2024)
por: Chen, Han
Publicado: (2024)
Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning
por: Du, Yexing, et al.
Publicado: (2024)
por: Du, Yexing, et al.
Publicado: (2024)
A Character-based Diffusion Embedding Algorithm for Enhancing the Generation Quality of Generative Linguistic Steganographic Texts
por: Chen, Yingquan, et al.
Publicado: (2025)
por: Chen, Yingquan, et al.
Publicado: (2025)
Ruri: Japanese General Text Embeddings
por: Tsukagoshi, Hayato, et al.
Publicado: (2024)
por: Tsukagoshi, Hayato, et al.
Publicado: (2024)
Hierarchical Attention Generates Better Proofs
por: Chen, Jianlong, et al.
Publicado: (2025)
por: Chen, Jianlong, et al.
Publicado: (2025)
GISTEmbed: Guided In-sample Selection of Training Negatives for Text Embedding Fine-tuning
por: Solatorio, Aivin V.
Publicado: (2024)
por: Solatorio, Aivin V.
Publicado: (2024)
Embedding-Driven Diversity Sampling to Improve Few-Shot Synthetic Data Generation
por: Lopez, Ivan, et al.
Publicado: (2025)
por: Lopez, Ivan, et al.
Publicado: (2025)
Are Clinical T5 Models Better for Clinical Text?
por: Li, Yahan, et al.
Publicado: (2024)
por: Li, Yahan, et al.
Publicado: (2024)
Safe Text-to-Image Generation: Simply Sanitize the Prompt Embedding
por: Qiu, Huming, et al.
Publicado: (2024)
por: Qiu, Huming, et al.
Publicado: (2024)
ReasonEmbed: Enhanced Text Embeddings for Reasoning-Intensive Document Retrieval
por: Chen, Jianlyu, et al.
Publicado: (2025)
por: Chen, Jianlyu, et al.
Publicado: (2025)
Learning from Negative Samples in Biomedical Generative Entity Linking
por: Kim, Chanhwi, et al.
Publicado: (2024)
por: Kim, Chanhwi, et al.
Publicado: (2024)
Evolutionary Negative Module Pruning for Better LoRA Merging
por: Cao, Anda, et al.
Publicado: (2026)
por: Cao, Anda, et al.
Publicado: (2026)
Graph Contrastive Learning via Cluster-refined Negative Sampling for Semi-supervised Text Classification
por: Ai, Wei, et al.
Publicado: (2024)
por: Ai, Wei, et al.
Publicado: (2024)
Predicting Through Generation: Why Generation Is Better for Prediction
por: Kowsher, Md, et al.
Publicado: (2025)
por: Kowsher, Md, et al.
Publicado: (2025)
Self-Correction Makes LLMs Better Parsers
por: Zhang, Ziyan, et al.
Publicado: (2025)
por: Zhang, Ziyan, et al.
Publicado: (2025)
Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization
por: Tian, Xueyun, et al.
Publicado: (2026)
por: Tian, Xueyun, et al.
Publicado: (2026)
Semantic Adapter for Universal Text Embeddings: Diagnosing and Mitigating Negation Blindness to Enhance Universality
por: Cao, Hongliu
Publicado: (2025)
por: Cao, Hongliu
Publicado: (2025)
Unified Interpretation of Smoothing Methods for Negative Sampling Loss Functions in Knowledge Graph Embedding
por: Feng, Xincan, et al.
Publicado: (2024)
por: Feng, Xincan, et al.
Publicado: (2024)
Unveiling Large Language Models Generated Texts: A Multi-Level Fine-Grained Detection Framework
por: Tao, Zhen, et al.
Publicado: (2024)
por: Tao, Zhen, et al.
Publicado: (2024)
More Expressive Attention with Negative Weights
por: Lv, Ang, et al.
Publicado: (2024)
por: Lv, Ang, et al.
Publicado: (2024)
Revealing the Numeracy Gap: An Empirical Investigation of Text Embedding Models
por: Deng, Ningyuan, et al.
Publicado: (2025)
por: Deng, Ningyuan, et al.
Publicado: (2025)
Are Large Language Models More Honest in Their Probabilistic or Verbalized Confidence?
por: Ni, Shiyu, et al.
Publicado: (2024)
por: Ni, Shiyu, et al.
Publicado: (2024)
Learning to Adapt SFT Data for Better Reasoning Generalization
por: Sun, Lisong, et al.
Publicado: (2026)
por: Sun, Lisong, et al.
Publicado: (2026)
Progressive Residual Warmup for Language Model Pretraining
por: Chen, Tianhao, et al.
Publicado: (2026)
por: Chen, Tianhao, et al.
Publicado: (2026)
TAD-Bench: A Comprehensive Benchmark for Embedding-Based Text Anomaly Detection
por: Cao, Yang, et al.
Publicado: (2025)
por: Cao, Yang, et al.
Publicado: (2025)
Ejemplares similares
-
Conan-Embedding-v2: Training an LLM from Scratch for Text Embeddings
por: Li, Shiyu, et al.
Publicado: (2025) -
HiNS: Hierarchical Negative Sampling for More Comprehensive Memory Retrieval Embedding Model
por: Tian, Motong, et al.
Publicado: (2026) -
ReSeek: A Self-Correcting Framework for Search Agents with Instructive Rewards
por: Li, Shiyu, et al.
Publicado: (2025) -
Finetune Once: Decoupling General & Domain Learning with Dynamic Boosted Annealing
por: Tang, Yang, et al.
Publicado: (2025) -
Negative Matters: Multi-Granularity Hard-Negative Synthesis and Anchor-Token-Aware Pooling for Enhanced Text Embeddings
por: Pan, Tengyu, et al.
Publicado: (2025)