LongMagpie: A Self-synthesis Method for Generating Large-scale Long-context Instructions
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Gao, Chaochen, Wu, Xing, Lin, Zijia, Zhang, Debing, Hu, Songlin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
NExtLong: Toward Effective Long-Context Training without Long Documents
par: Gao, Chaochen, et autres
Publié: (2025)
par: Gao, Chaochen, et autres
Publié: (2025)
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
par: Gao, Chaochen, et autres
Publié: (2024)
par: Gao, Chaochen, et autres
Publié: (2024)
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
par: Chen, Ziyang, et autres
Publié: (2026)
par: Chen, Ziyang, et autres
Publié: (2026)
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
par: Jia, Junlong, et autres
Publié: (2025)
par: Jia, Junlong, et autres
Publié: (2025)
CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning
par: Yu, Huimu, et autres
Publié: (2024)
par: Yu, Huimu, et autres
Publié: (2024)
LongGenBench: Long-context Generation Benchmark
par: Liu, Xiang, et autres
Publié: (2024)
par: Liu, Xiang, et autres
Publié: (2024)
Long-context LLMs Struggle with Long In-context Learning
par: Li, Tianle, et autres
Publié: (2024)
par: Li, Tianle, et autres
Publié: (2024)
Large Language Models Can Self-Improve in Long-context Reasoning
par: Li, Siheng, et autres
Publié: (2024)
par: Li, Siheng, et autres
Publié: (2024)
LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs
par: Jiang, Ziyan, et autres
Publié: (2024)
par: Jiang, Ziyan, et autres
Publié: (2024)
Generalizing From Short to Long: Effective Data Synthesis for Long-Context Instruction Tuning
par: Zhu, Wenhao, et autres
Publié: (2025)
par: Zhu, Wenhao, et autres
Publié: (2025)
Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing
par: Xu, Zhangchen, et autres
Publié: (2024)
par: Xu, Zhangchen, et autres
Publié: (2024)
Untie the Knots: An Efficient Data Augmentation Strategy for Long-Context Pre-Training in Language Models
par: Tian, Junfeng, et autres
Publié: (2024)
par: Tian, Junfeng, et autres
Publié: (2024)
PolicyLong: Towards On-Policy Context Extension
par: Jia, Junlong, et autres
Publié: (2026)
par: Jia, Junlong, et autres
Publié: (2026)
Revisiting Long-context Modeling from Context Denoising Perspective
par: Tang, Zecheng, et autres
Publié: (2025)
par: Tang, Zecheng, et autres
Publié: (2025)
Mem2ActBench: A Benchmark for Evaluating Long-Term Memory Utilization in Task-Oriented Autonomous Agents
par: Shen, Yiting, et autres
Publié: (2026)
par: Shen, Yiting, et autres
Publié: (2026)
RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?
par: Xu, Haotian, et autres
Publié: (2025)
par: Xu, Haotian, et autres
Publié: (2025)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
par: Bai, Yushi, et autres
Publié: (2024)
par: Bai, Yushi, et autres
Publié: (2024)
Eliciting In-context Retrieval and Reasoning for Long-context Large Language Models
par: Qiu, Yifu, et autres
Publié: (2025)
par: Qiu, Yifu, et autres
Publié: (2025)
Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models
par: Hu, Xiang, et autres
Publié: (2025)
par: Hu, Xiang, et autres
Publié: (2025)
Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning
par: Yang, Cehao, et autres
Publié: (2025)
par: Yang, Cehao, et autres
Publié: (2025)
Graph of Records: Boosting Retrieval Augmented Generation for Long-context Summarization with Graphs
par: Zhang, Haozhen, et autres
Publié: (2024)
par: Zhang, Haozhen, et autres
Publié: (2024)
Dial-MAE: ConTextual Masked Auto-Encoder for Retrieval-based Dialogue Systems
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
HC3 Plus: A Semantic-Invariant Human ChatGPT Comparison Corpus
par: Su, Zhenpeng, et autres
Publié: (2023)
par: Su, Zhenpeng, et autres
Publié: (2023)
AnaloBench: Benchmarking the Identification of Abstract and Long-context Analogies
par: Ye, Xiao, et autres
Publié: (2024)
par: Ye, Xiao, et autres
Publié: (2024)
Extract, Match, and Score: An Evaluation Paradigm for Long Question-context-answer Triplets in Financial Analysis
par: Hu, Bo, et autres
Publié: (2025)
par: Hu, Bo, et autres
Publié: (2025)
LongWeave: A Long-Form Generation Benchmark Bridging Real-World Relevance and Verifiability
par: Xiao, Zikai, et autres
Publié: (2025)
par: Xiao, Zikai, et autres
Publié: (2025)
LongSafety: Evaluating Long-Context Safety of Large Language Models
par: Lu, Yida, et autres
Publié: (2025)
par: Lu, Yida, et autres
Publié: (2025)
From General to Targeted Rewards: Surpassing GPT-4 in Open-Ended Long-Context Generation
par: Guo, Zhihan, et autres
Publié: (2025)
par: Guo, Zhihan, et autres
Publié: (2025)
A Decomposition Perspective to Long-context Reasoning for LLMs
par: Xiao, Yanling, et autres
Publié: (2026)
par: Xiao, Yanling, et autres
Publié: (2026)
Self-Taught Agentic Long Context Understanding
par: Zhuang, Yufan, et autres
Publié: (2025)
par: Zhuang, Yufan, et autres
Publié: (2025)
EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning
par: Hu, Chuanrui, et autres
Publié: (2026)
par: Hu, Chuanrui, et autres
Publié: (2026)
LongForm: Effective Instruction Tuning with Reverse Instructions
par: Köksal, Abdullatif, et autres
Publié: (2023)
par: Köksal, Abdullatif, et autres
Publié: (2023)
Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation
par: Yang, Zixuan, et autres
Publié: (2026)
par: Yang, Zixuan, et autres
Publié: (2026)
SememeLM: A Sememe Knowledge Enhanced Method for Long-tail Relation Representation
par: Li, Shuyi, et autres
Publié: (2024)
par: Li, Shuyi, et autres
Publié: (2024)
LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning
par: Wu, Yuhao, et autres
Publié: (2025)
par: Wu, Yuhao, et autres
Publié: (2025)
AllMem: A Memory-centric Recipe for Efficient Long-context Modeling
par: Wang, Ziming, et autres
Publié: (2026)
par: Wang, Ziming, et autres
Publié: (2026)
Scalable Oversight for Superhuman AI via Recursive Self-Critiquing
par: Wen, Xueru, et autres
Publié: (2025)
par: Wen, Xueru, et autres
Publié: (2025)
ClaimGen-CN: A Large-scale Chinese Dataset for Legal Claim Generation
par: Zhou, Siying, et autres
Publié: (2025)
par: Zhou, Siying, et autres
Publié: (2025)
MemRouter: Memory-as-Embedding Routing for Long-Term Conversational Agents
par: Hu, Tianyu, et autres
Publié: (2026)
par: Hu, Tianyu, et autres
Publié: (2026)
Documents similaires
-
NExtLong: Toward Effective Long-Context Training without Long Documents
par: Gao, Chaochen, et autres
Publié: (2025) -
EntropyLong: Effective Long-Context Training via Predictive Uncertainty
par: Jia, Junlong, et autres
Publié: (2025) -
Quest: Query-centric Data Synthesis Approach for Long-context Scaling of Large Language Model
par: Gao, Chaochen, et autres
Publié: (2024) -
LongBench Pro: A More Realistic and Comprehensive Bilingual Long-Context Evaluation Benchmark
par: Chen, Ziyang, et autres
Publié: (2026) -
LiteLong: Resource-Efficient Long-Context Data Synthesis for LLMs
par: Jia, Junlong, et autres
Publié: (2025)