On The Role of Pretrained Language Models in General-Purpose Text Embeddings: A Survey
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Meishan, Zhang, Xin, Zhao, Xinping, Huang, Shouzheng, Hu, Baotian, Zhang, Min |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
por: Huang, Shouzheng, et al.
Publicado: (2026)
por: Huang, Shouzheng, et al.
Publicado: (2026)
Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation
por: Zhao, Xinping, et al.
Publicado: (2025)
por: Zhao, Xinping, et al.
Publicado: (2025)
KaLM-Embedding-V2: Superior Training Techniques and Data Inspire A Versatile Embedding Model
por: Zhao, Xinping, et al.
Publicado: (2025)
por: Zhao, Xinping, et al.
Publicado: (2025)
A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models
por: Chen, Huiyao, et al.
Publicado: (2025)
por: Chen, Huiyao, et al.
Publicado: (2025)
LMEB: Long-horizon Memory Embedding Benchmark
por: Zhao, Xinping, et al.
Publicado: (2026)
por: Zhao, Xinping, et al.
Publicado: (2026)
Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning
por: Chen, Zhuoen, et al.
Publicado: (2026)
por: Chen, Zhuoen, et al.
Publicado: (2026)
SEER: Self-Aligned Evidence Extraction for Retrieval-Augmented Generation
por: Zhao, Xinping, et al.
Publicado: (2024)
por: Zhao, Xinping, et al.
Publicado: (2024)
Improving Attributed Text Generation of Large Language Models via Preference Learning
por: Li, Dongfang, et al.
Publicado: (2024)
por: Li, Dongfang, et al.
Publicado: (2024)
Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering
por: Chen, Huiyao, et al.
Publicado: (2025)
por: Chen, Huiyao, et al.
Publicado: (2025)
KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model
por: Hu, Xinshuo, et al.
Publicado: (2025)
por: Hu, Xinshuo, et al.
Publicado: (2025)
Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework
por: Zhang, Chenyuan, et al.
Publicado: (2026)
por: Zhang, Chenyuan, et al.
Publicado: (2026)
Take Off the Training Wheels Progressive In-Context Learning for Effective Alignment
por: Liu, Zhenyu, et al.
Publicado: (2025)
por: Liu, Zhenyu, et al.
Publicado: (2025)
Language Models are Universal Embedders
por: Zhang, Xin, et al.
Publicado: (2023)
por: Zhang, Xin, et al.
Publicado: (2023)
Generative Multimodal Entity Linking
por: Shi, Senbao, et al.
Publicado: (2023)
por: Shi, Senbao, et al.
Publicado: (2023)
CMT: A Memory Compression Method for Continual Knowledge Learning of Large Language Models
por: Li, Dongfang, et al.
Publicado: (2024)
por: Li, Dongfang, et al.
Publicado: (2024)
Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
From Pre-trained Models to Large Language Models: A Comprehensive Survey of AI-Driven Psychological Computing
por: Chen, Huiyao, et al.
Publicado: (2026)
por: Chen, Huiyao, et al.
Publicado: (2026)
FunnelRAG: A Coarse-to-Fine Progressive Retrieval Paradigm for RAG
por: Zhao, Xinping, et al.
Publicado: (2024)
por: Zhao, Xinping, et al.
Publicado: (2024)
LLMs Can Also Do Well! Breaking Barriers in Semantic Role Labeling via Large Language Models
por: Li, Xinxin, et al.
Publicado: (2025)
por: Li, Xinxin, et al.
Publicado: (2025)
mGTE: Generalized Long-Context Text Representation and Reranking Models for Multilingual Text Retrieval
por: Zhang, Xin, et al.
Publicado: (2024)
por: Zhang, Xin, et al.
Publicado: (2024)
Chinese Sequence Labeling with Semi-Supervised Boundary-Aware Language Model Pre-training
por: Zhang, Longhui, et al.
Publicado: (2024)
por: Zhang, Longhui, et al.
Publicado: (2024)
AutoSurvey: Large Language Models Can Automatically Write Surveys
por: Wang, Yidong, et al.
Publicado: (2024)
por: Wang, Yidong, et al.
Publicado: (2024)
Contrastive Learning on LLM Back Generation Treebank for Cross-domain Constituency Parsing
por: Guo, Peiming, et al.
Publicado: (2025)
por: Guo, Peiming, et al.
Publicado: (2025)
Retrieval-style In-Context Learning for Few-shot Hierarchical Text Classification
por: Chen, Huiyao, et al.
Publicado: (2024)
por: Chen, Huiyao, et al.
Publicado: (2024)
Grammar Induction from Visual, Speech and Text
por: Zhao, Yu, et al.
Publicado: (2024)
por: Zhao, Yu, et al.
Publicado: (2024)
Medico: Towards Hallucination Detection and Correction with Multi-source Evidence Fusion
por: Zhao, Xinping, et al.
Publicado: (2024)
por: Zhao, Xinping, et al.
Publicado: (2024)
Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data
por: Li, Yunxin, et al.
Publicado: (2025)
por: Li, Yunxin, et al.
Publicado: (2025)
When Text Embedding Meets Large Language Model: A Comprehensive Survey
por: Nie, Zhijie, et al.
Publicado: (2024)
por: Nie, Zhijie, et al.
Publicado: (2024)
GPT-4o as the Gold Standard: A Scalable and General Purpose Approach to Filter Language Model Pretraining Data
por: Zhang, Jifan, et al.
Publicado: (2024)
por: Zhang, Jifan, et al.
Publicado: (2024)
PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models
por: An, Jiyuan, et al.
Publicado: (2026)
por: An, Jiyuan, et al.
Publicado: (2026)
An End-to-End Model for Photo-Sharing Multi-modal Dialogue Generation
por: Guo, Peiming, et al.
Publicado: (2024)
por: Guo, Peiming, et al.
Publicado: (2024)
Cognitive Visual-Language Mapper: Advancing Multimodal Comprehension with Enhanced Visual Knowledge Alignment
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
Rethinking the Role of Text Complexity in Language Model Pretraining
por: Velasco, Dan John, et al.
Publicado: (2025)
por: Velasco, Dan John, et al.
Publicado: (2025)
In-Context Learning for Few-Shot Nested Named Entity Recognition
por: Zhang, Meishan, et al.
Publicado: (2024)
por: Zhang, Meishan, et al.
Publicado: (2024)
Diffusion vs. Autoregressive Language Models: A Text Embedding Perspective
por: Zhang, Siyue, et al.
Publicado: (2025)
por: Zhang, Siyue, et al.
Publicado: (2025)
Separate the Wheat from the Chaff: Model Deficiency Unlearning via Parameter-Efficient Module Operation
por: Hu, Xinshuo, et al.
Publicado: (2023)
por: Hu, Xinshuo, et al.
Publicado: (2023)
Improving Value-based Process Verifier via Low-Cost Variance Reduction
por: Sun, Zetian, et al.
Publicado: (2025)
por: Sun, Zetian, et al.
Publicado: (2025)
The Role of Mixed-Language Documents for Multilingual Large Language Model Pretraining
por: Shao, Jiandong, et al.
Publicado: (2026)
por: Shao, Jiandong, et al.
Publicado: (2026)
A Multimodal In-Context Tuning Approach for E-Commerce Product Description Generation
por: Li, Yunxin, et al.
Publicado: (2024)
por: Li, Yunxin, et al.
Publicado: (2024)
XNLP: An Interactive Demonstration System for Universal Structured NLP
por: Fei, Hao, et al.
Publicado: (2023)
por: Fei, Hao, et al.
Publicado: (2023)
Ejemplares similares
-
ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution
por: Huang, Shouzheng, et al.
Publicado: (2026) -
Learning to Extract Rational Evidence via Reinforcement Learning for Retrieval-Augmented Generation
por: Zhao, Xinping, et al.
Publicado: (2025) -
KaLM-Embedding-V2: Superior Training Techniques and Data Inspire A Versatile Embedding Model
por: Zhao, Xinping, et al.
Publicado: (2025) -
A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models
por: Chen, Huiyao, et al.
Publicado: (2025) -
LMEB: Long-horizon Memory Embedding Benchmark
por: Zhao, Xinping, et al.
Publicado: (2026)