An Integrated Data Processing Framework for Pretraining Foundation Models
Fuente:
arXiv
Saved in:
| Main Authors: | Sun, Yiding, Wang, Feng, Zhu, Yutao, Zhao, Wayne Xin, Mao, Jiaxin |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
How do Large Language Models Understand Relevance? A Mechanistic Interpretability Perspective
by: Liu, Qi, et al.
Published: (2025)
by: Liu, Qi, et al.
Published: (2025)
Diffusion-Pretrained Dense and Contextual Embeddings
by: Eslami, Sedigheh, et al.
Published: (2026)
by: Eslami, Sedigheh, et al.
Published: (2026)
Federated Learning for ICD Classification with Lightweight Models and Pretrained Embeddings
by: Xu, Binbin, et al.
Published: (2025)
by: Xu, Binbin, et al.
Published: (2025)
Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval
by: Ji, Luo, et al.
Published: (2024)
by: Ji, Luo, et al.
Published: (2024)
Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe
by: You, Chong, et al.
Published: (2025)
by: You, Chong, et al.
Published: (2025)
Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
by: Xia, Tianle, et al.
Published: (2026)
by: Xia, Tianle, et al.
Published: (2026)
Segmentation and Processing of German Court Decisions from Open Legal Data
by: Darji, Harshil, et al.
Published: (2026)
by: Darji, Harshil, et al.
Published: (2026)
S2 Chunking: A Hybrid Framework for Document Segmentation Through Integrated Spatial and Semantic Analysis
by: Verma, Prashant
Published: (2025)
by: Verma, Prashant
Published: (2025)
Integrating Large Language Models with Graphical Session-Based Recommendation
by: Guo, Naicheng, et al.
Published: (2024)
by: Guo, Naicheng, et al.
Published: (2024)
ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability
by: Liu, Wenhan, et al.
Published: (2025)
by: Liu, Wenhan, et al.
Published: (2025)
AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress
by: Xi, Zhiheng, et al.
Published: (2025)
by: Xi, Zhiheng, et al.
Published: (2025)
Urdu News Article Recommendation Model using Natural Language Processing Techniques
by: Abbas, Syed Zain, et al.
Published: (2022)
by: Abbas, Syed Zain, et al.
Published: (2022)
ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging
by: Verma, Neha, et al.
Published: (2026)
by: Verma, Neha, et al.
Published: (2026)
A Dynamic Framework for Semantic Grouping of Common Data Elements (CDE) Using Embeddings and Clustering
by: Krishnamurthy, Madan, et al.
Published: (2025)
by: Krishnamurthy, Madan, et al.
Published: (2025)
AgentMove: A Large Language Model based Agentic Framework for Zero-shot Next Location Prediction
by: Feng, Jie, et al.
Published: (2024)
by: Feng, Jie, et al.
Published: (2024)
RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendation
by: Zhou, Sashuai, et al.
Published: (2025)
by: Zhou, Sashuai, et al.
Published: (2025)
A Breadth-First Catalog of Text Processing, Speech Processing and Multimodal Research in South Asian Languages
by: Gupta, Pranav
Published: (2024)
by: Gupta, Pranav
Published: (2024)
Optimize Incompatible Parameters through Compatibility-aware Knowledge Integration
by: Lv, Zheqi, et al.
Published: (2025)
by: Lv, Zheqi, et al.
Published: (2025)
KGLink: A column type annotation method that combines knowledge graph and pre-trained language model
by: Wang, Yubo, et al.
Published: (2024)
by: Wang, Yubo, et al.
Published: (2024)
InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining
by: Wang, Boxin, et al.
Published: (2023)
by: Wang, Boxin, et al.
Published: (2023)
Agentic Entropy-Balanced Policy Optimization
by: Dong, Guanting, et al.
Published: (2025)
by: Dong, Guanting, et al.
Published: (2025)
LANE: Logic Alignment of Non-tuning Large Language Models and Online Recommendation Systems for Explainable Reason Generation
by: Zhao, Hongke, et al.
Published: (2024)
by: Zhao, Hongke, et al.
Published: (2024)
Key Information Retrieval to Classify the Unstructured Data Content of Preferential Trade Agreements
by: Zhao, Jiahui, et al.
Published: (2024)
by: Zhao, Jiahui, et al.
Published: (2024)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
Make Large Language Model a Better Ranker
by: Chao, Wen-Shuo, et al.
Published: (2024)
by: Chao, Wen-Shuo, et al.
Published: (2024)
SciHorizon: Benchmarking AI-for-Science Readiness from Scientific Data to Large Language Models
by: Qin, Chuan, et al.
Published: (2025)
by: Qin, Chuan, et al.
Published: (2025)
Identifying Reasons for Contraceptive Switching from Real-World Data Using Large Language Models
by: Miao, Brenda Y., et al.
Published: (2024)
by: Miao, Brenda Y., et al.
Published: (2024)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
by: Hu, Lingxiang, et al.
Published: (2026)
by: Hu, Lingxiang, et al.
Published: (2026)
Utilizing Large Language Models for Information Extraction from Real Estate Transactions
by: Zhao, Yu, et al.
Published: (2024)
by: Zhao, Yu, et al.
Published: (2024)
LemmaHead: RAG Assisted Proof Generation Using Large Language Models
by: Yang, Tianbo, et al.
Published: (2025)
by: Yang, Tianbo, et al.
Published: (2025)
Atomic Information Flow: A Network Flow Model for Tool Attributions in RAG Systems
by: Gao, James, et al.
Published: (2026)
by: Gao, James, et al.
Published: (2026)
Cross-Model Comparative Loss for Enhancing Neuronal Utility in Language Understanding
by: Zhu, Yunchang, et al.
Published: (2023)
by: Zhu, Yunchang, et al.
Published: (2023)
Accelerating Retrieval-Augmented Language Model Serving with Speculation
by: Zhang, Zhihao, et al.
Published: (2024)
by: Zhang, Zhihao, et al.
Published: (2024)
Transforming User Defined Criteria into Explainable Indicators with an Integrated LLM AHP System
by: Bang, Geonwoo, et al.
Published: (2025)
by: Bang, Geonwoo, et al.
Published: (2025)
M3: A Multi-Task Mixed-Objective Learning Framework for Open-Domain Multi-Hop Dense Sentence Retrieval
by: Bai, Yang, et al.
Published: (2024)
by: Bai, Yang, et al.
Published: (2024)
LawLLM: Law Large Language Model for the US Legal System
by: Shu, Dong, et al.
Published: (2024)
by: Shu, Dong, et al.
Published: (2024)
Language Models As Semantic Indexers
by: Jin, Bowen, et al.
Published: (2023)
by: Jin, Bowen, et al.
Published: (2023)
Question-Answer Extraction from Scientific Articles Using Knowledge Graphs and Large Language Models
by: Azarbonyad, Hosein, et al.
Published: (2025)
by: Azarbonyad, Hosein, et al.
Published: (2025)
LLM4Ranking: An Easy-to-use Framework of Utilizing Large Language Models for Document Reranking
by: Liu, Qi, et al.
Published: (2025)
by: Liu, Qi, et al.
Published: (2025)
UP5: Unbiased Foundation Model for Fairness-aware Recommendation
by: Hua, Wenyue, et al.
Published: (2023)
by: Hua, Wenyue, et al.
Published: (2023)
Similar Items
-
How do Large Language Models Understand Relevance? A Mechanistic Interpretability Perspective
by: Liu, Qi, et al.
Published: (2025) -
Diffusion-Pretrained Dense and Contextual Embeddings
by: Eslami, Sedigheh, et al.
Published: (2026) -
Federated Learning for ICD Classification with Lightweight Models and Pretrained Embeddings
by: Xu, Binbin, et al.
Published: (2025) -
Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval
by: Ji, Luo, et al.
Published: (2024) -
Hierarchical Retrieval: The Geometry and a Pretrain-Finetune Recipe
by: You, Chong, et al.
Published: (2025)