Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Shengjie, Jiang, Xuhui, Xu, Chengjin, Yang, Cehao, Zhang, Liyu, Guo, Jian |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
by: Ma, Shengjie, et al.
Published: (2024)
by: Ma, Shengjie, et al.
Published: (2024)
LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
Financial Knowledge Large Language Model
by: Yang, Cehao, et al.
Published: (2024)
by: Yang, Cehao, et al.
Published: (2024)
Retrieval, Reasoning, Re-ranking: A Context-Enriched Framework for Knowledge Graph Completion
by: Li, Muzhi, et al.
Published: (2024)
by: Li, Muzhi, et al.
Published: (2024)
Context-aware Inductive Knowledge Graph Completion with Latent Type Constraints and Subgraph Reasoning
by: Li, Muzhi, et al.
Published: (2024)
by: Li, Muzhi, et al.
Published: (2024)
Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
Context Graph
by: Xu, Chengjin, et al.
Published: (2024)
by: Xu, Chengjin, et al.
Published: (2024)
GraphSearch: An Agentic Deep Searching Workflow for Graph Retrieval-Augmented Generation
by: Yang, Cehao, et al.
Published: (2025)
by: Yang, Cehao, et al.
Published: (2025)
Conflicts Make Large Reasoning Models Vulnerable to Attacks
by: Liu, Honghao, et al.
Published: (2026)
by: Liu, Honghao, et al.
Published: (2026)
RuleRAG: Rule-Guided Retrieval-Augmented Generation with Language Models for Question Answering
by: Chen, Zhongwu, et al.
Published: (2024)
by: Chen, Zhongwu, et al.
Published: (2024)
Unlocking the Power of Large Language Models for Entity Alignment
by: Jiang, Xuhui, et al.
Published: (2024)
by: Jiang, Xuhui, et al.
Published: (2024)
Think-on-Graph 3.0: Efficient and Adaptive LLM Reasoning on Heterogeneous Graphs via Multi-Agent Dual-Evolving Context Retrieval
by: Wu, Xiaojun, et al.
Published: (2025)
by: Wu, Xiaojun, et al.
Published: (2025)
JudgeAgent: Beyond Static Benchmarks for Knowledge-Driven and Dynamic LLM Evaluation
by: Shi, Zhichao, et al.
Published: (2025)
by: Shi, Zhichao, et al.
Published: (2025)
DataMan: Data Manager for Pre-training Large Language Models
by: Peng, Ru, et al.
Published: (2025)
by: Peng, Ru, et al.
Published: (2025)
MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected Training
by: Chen, Zhanpeng, et al.
Published: (2024)
by: Chen, Zhanpeng, et al.
Published: (2024)
RETuning: Upgrading Inference-Time Scaling for Stock Movement Prediction with Large Language Models
by: Lin, Xueyuan, et al.
Published: (2025)
by: Lin, Xueyuan, et al.
Published: (2025)
Pre-trained Language Model with Prompts for Temporal Knowledge Graph Completion
by: Xu, Wenjie, et al.
Published: (2023)
by: Xu, Wenjie, et al.
Published: (2023)
A Survey on Large Language Model Hallucination via a Creativity Perspective
by: Jiang, Xuhui, et al.
Published: (2024)
by: Jiang, Xuhui, et al.
Published: (2024)
Unveiling the Potential of Sentiment: Can Large Language Models Predict Chinese Stock Price Movements?
by: Zhang, Haohan, et al.
Published: (2023)
by: Zhang, Haohan, et al.
Published: (2023)
Understanding Data Temporality Impact on Large Language Models Pre-training
by: Pilchen, Hippolyte, et al.
Published: (2026)
by: Pilchen, Hippolyte, et al.
Published: (2026)
Simple and Scalable Strategies to Continually Pre-train Large Language Models
by: Ibrahim, Adam, et al.
Published: (2024)
by: Ibrahim, Adam, et al.
Published: (2024)
Fine-grainedly Synthesize Streaming Data Based On Large Language Models With Graph Structure Understanding For Data Sparsity
by: Zhang, Xin, et al.
Published: (2024)
by: Zhang, Xin, et al.
Published: (2024)
ReasoningLM: Enabling Structural Subgraph Reasoning in Pre-trained Language Models for Question Answering over Knowledge Graph
by: Jiang, Jinhao, et al.
Published: (2023)
by: Jiang, Jinhao, et al.
Published: (2023)
Making Pre-trained Language Models Better Continual Few-Shot Relation Extractors
by: Ma, Shengkun, et al.
Published: (2024)
by: Ma, Shengkun, et al.
Published: (2024)
Think-on-Graph: Deep and Responsible Reasoning of Large Language Model on Knowledge Graph
by: Sun, Jiashuo, et al.
Published: (2023)
by: Sun, Jiashuo, et al.
Published: (2023)
Knowledge-Instruct: Effective Continual Pre-training from Limited Data using Instructions
by: Ovadia, Oded, et al.
Published: (2025)
by: Ovadia, Oded, et al.
Published: (2025)
Investigating Data Contamination for Pre-training Language Models
by: Jiang, Minhao, et al.
Published: (2024)
by: Jiang, Minhao, et al.
Published: (2024)
GenTKG: Generative Forecasting on Temporal Knowledge Graph with Large Language Models
by: Liao, Ruotong, et al.
Published: (2023)
by: Liao, Ruotong, et al.
Published: (2023)
RegMix: Data Mixture as Regression for Language Model Pre-training
by: Liu, Qian, et al.
Published: (2024)
by: Liu, Qian, et al.
Published: (2024)
Probing Language Models for Pre-training Data Detection
by: Liu, Zhenhua, et al.
Published: (2024)
by: Liu, Zhenhua, et al.
Published: (2024)
How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models
by: Lv, Kangtao, et al.
Published: (2025)
by: Lv, Kangtao, et al.
Published: (2025)
Does Pre-trained Language Model Actually Infer Unseen Links in Knowledge Graph Completion?
by: Sakai, Yusuke, et al.
Published: (2023)
by: Sakai, Yusuke, et al.
Published: (2023)
Knowledge Graphs and Pre-trained Language Models enhanced Representation Learning for Conversational Recommender Systems
by: Qiu, Zhangchi, et al.
Published: (2023)
by: Qiu, Zhangchi, et al.
Published: (2023)
Construction of Hyper-Relational Knowledge Graphs Using Pre-Trained Large Language Models
by: Datta, Preetha, et al.
Published: (2024)
by: Datta, Preetha, et al.
Published: (2024)
Pre-trained Large Language Models for Financial Sentiment Analysis
by: Luo, Wei, et al.
Published: (2024)
by: Luo, Wei, et al.
Published: (2024)
Spike No More: Stabilizing the Pre-training of Large Language Models
by: Takase, Sho, et al.
Published: (2023)
by: Takase, Sho, et al.
Published: (2023)
Finetuning Generative Large Language Models with Discrimination Instructions for Knowledge Graph Completion
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
On the Evolution of Knowledge Graphs: A Survey and Perspective
by: Jiang, Xuhui, et al.
Published: (2023)
by: Jiang, Xuhui, et al.
Published: (2023)
Tokenization, Fusion and Decoupling: Bridging the Granularity Mismatch Between Large Language Models and Knowledge Graphs
by: Su, Siyue, et al.
Published: (2026)
by: Su, Siyue, et al.
Published: (2026)
Similar Items
-
Think-on-Graph 2.0: Deep and Faithful Large Language Model Reasoning with Knowledge-guided Retrieval Augmented Generation
by: Ma, Shengjie, et al.
Published: (2024) -
LongFaith: Enhancing Long-Context Reasoning in LLMs with Faithful Synthetic Data
by: Yang, Cehao, et al.
Published: (2025) -
Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs
by: Liu, Honghao, et al.
Published: (2026) -
Financial Knowledge Large Language Model
by: Yang, Cehao, et al.
Published: (2024) -
Retrieval, Reasoning, Re-ranking: A Context-Enriched Framework for Knowledge Graph Completion
by: Li, Muzhi, et al.
Published: (2024)