A Survey on Data Synthesis and Augmentation for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Wang, Ke, Zhu, Jiahui, Ren, Minjie, Liu, Zeming, Li, Shiwei, Zhang, Zongye, Zhang, Chenkai, Wu, Xiaoyu, Zhan, Qiqi, Liu, Qingjie, Wang, Yunhong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
di: Lei, Yiming, et al.
Pubblicazione: (2025)
di: Lei, Yiming, et al.
Pubblicazione: (2025)
SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation
di: Zhang, Zongye, et al.
Pubblicazione: (2025)
di: Zhang, Zongye, et al.
Pubblicazione: (2025)
AttriPrompt: Dynamic Prompt Composition Learning for CLIP
di: Zhan, Qiqi, et al.
Pubblicazione: (2025)
di: Zhan, Qiqi, et al.
Pubblicazione: (2025)
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
di: Zhang, Chenkai, et al.
Pubblicazione: (2025)
di: Zhang, Chenkai, et al.
Pubblicazione: (2025)
Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion
di: Zhang, Zongye, et al.
Pubblicazione: (2025)
di: Zhang, Zongye, et al.
Pubblicazione: (2025)
KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus
di: Shi, Xiaoming, et al.
Pubblicazione: (2025)
di: Shi, Xiaoming, et al.
Pubblicazione: (2025)
A Survey on Remote Sensing Foundation Models: From Vision to Multimodality
di: Huang, Ziyue, et al.
Pubblicazione: (2025)
di: Huang, Ziyue, et al.
Pubblicazione: (2025)
Learn More, Forget Less: A Gradient-Aware Data Selection Approach for LLM
di: Liu, Yibai, et al.
Pubblicazione: (2025)
di: Liu, Yibai, et al.
Pubblicazione: (2025)
ContextQFormer: A New Context Modeling Method for Multi-Turn Multi-Modal Conversations
di: Lei, Yiming, et al.
Pubblicazione: (2025)
di: Lei, Yiming, et al.
Pubblicazione: (2025)
ToolSpectrum : Towards Personalized Tool Utilization for Large Language Models
di: Cheng, Zihao, et al.
Pubblicazione: (2025)
di: Cheng, Zihao, et al.
Pubblicazione: (2025)
Retrieval Augmented Generation Evaluation in the Era of Large Language Models: A Comprehensive Survey
di: Gan, Aoran, et al.
Pubblicazione: (2025)
di: Gan, Aoran, et al.
Pubblicazione: (2025)
ONER: Online Experience Replay for Incremental Anomaly Detection
di: Jin, Yizhou, et al.
Pubblicazione: (2024)
di: Jin, Yizhou, et al.
Pubblicazione: (2024)
Evaluation of Retrieval-Augmented Generation: A Survey
di: Yu, Hao, et al.
Pubblicazione: (2024)
di: Yu, Hao, et al.
Pubblicazione: (2024)
Diversity-oriented Data Augmentation with Large Language Models
di: Wang, Zaitian, et al.
Pubblicazione: (2025)
di: Wang, Zaitian, et al.
Pubblicazione: (2025)
From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models
di: Tong, Junlong, et al.
Pubblicazione: (2026)
di: Tong, Junlong, et al.
Pubblicazione: (2026)
Deterministic Reversible Data Augmentation for Neural Machine Translation
di: Yao, Jiashu, et al.
Pubblicazione: (2024)
di: Yao, Jiashu, et al.
Pubblicazione: (2024)
Large Language Models for Data Annotation and Synthesis: A Survey
di: Tan, Zhen, et al.
Pubblicazione: (2024)
di: Tan, Zhen, et al.
Pubblicazione: (2024)
CtxMIM: Context-Enhanced Masked Image Modeling for Remote Sensing Image Understanding
di: Zhang, Mingming, et al.
Pubblicazione: (2023)
di: Zhang, Mingming, et al.
Pubblicazione: (2023)
HiT: Building Mapping with Hierarchical Transformers
di: Zhang, Mingming, et al.
Pubblicazione: (2023)
di: Zhang, Mingming, et al.
Pubblicazione: (2023)
PACF: Prototype Augmented Compact Features for Improving Domain Adaptive Object Detection
di: Liu, Chenguang, et al.
Pubblicazione: (2025)
di: Liu, Chenguang, et al.
Pubblicazione: (2025)
EntroCut: Entropy-Guided Adaptive Truncation for Efficient Chain-of-Thought Reasoning in Small-scale Large Reasoning Models
di: Yan, Hongxi, et al.
Pubblicazione: (2026)
di: Yan, Hongxi, et al.
Pubblicazione: (2026)
Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
di: Luo, Weiqing, et al.
Pubblicazione: (2026)
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
di: Cheng, Xianfu, et al.
Pubblicazione: (2025)
Data Management For Training Large Language Models: A Survey
di: Wang, Zige, et al.
Pubblicazione: (2023)
di: Wang, Zige, et al.
Pubblicazione: (2023)
CrossTrafficLLM: A Human-Centric Framework for Interpretable Traffic Intelligence via Large Language Model
di: Du, Zeming, et al.
Pubblicazione: (2025)
di: Du, Zeming, et al.
Pubblicazione: (2025)
Are Large Language Models Chronically Online Surfers? A Dataset for Chinese Internet Meme Explanation
di: Xie, Yubo, et al.
Pubblicazione: (2025)
di: Xie, Yubo, et al.
Pubblicazione: (2025)
Understanding the Dilemma of Unlearning for Large Language Models
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
On Data Synthesis and Post-training for Visual Abstract Reasoning
di: Zhu, Ke, et al.
Pubblicazione: (2025)
di: Zhu, Ke, et al.
Pubblicazione: (2025)
A Survey on Data Augmentation in Large Model Era
di: Zhou, Yue, et al.
Pubblicazione: (2024)
di: Zhou, Yue, et al.
Pubblicazione: (2024)
Efficient Large Language Models: A Survey
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
di: Wan, Zhongwei, et al.
Pubblicazione: (2023)
Lightweight Spatial Embedding for Vision-based 3D Occupancy Prediction
di: Zhang, Jinqing, et al.
Pubblicazione: (2024)
di: Zhang, Jinqing, et al.
Pubblicazione: (2024)
Terminal-World: Scaling Terminal-Agent Environments via Agent Skills
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
di: Cheng, Zihao, et al.
Pubblicazione: (2026)
Re-Initialization Token Learning for Tool-Augmented Large Language Models
di: Li, Chenghao, et al.
Pubblicazione: (2025)
di: Li, Chenghao, et al.
Pubblicazione: (2025)
Reformulation for Pretraining Data Augmentation
di: Hao, Xintong, et al.
Pubblicazione: (2025)
di: Hao, Xintong, et al.
Pubblicazione: (2025)
A Survey of Table Reasoning with Large Language Models
di: Zhang, Xuanliang, et al.
Pubblicazione: (2024)
di: Zhang, Xuanliang, et al.
Pubblicazione: (2024)
A Survey on Multi-Turn Interaction Capabilities of Large Language Models
di: Zhang, Chen, et al.
Pubblicazione: (2025)
di: Zhang, Chen, et al.
Pubblicazione: (2025)
2M-NER: Contrastive Learning for Multilingual and Multimodal NER with Language and Modal Fusion
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
di: Wang, Dongsheng, et al.
Pubblicazione: (2024)
Speculating LLMs' Chinese Training Data Pollution from Their Tokens
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
MMRAG: Multi-Mode Retrieval-Augmented Generation with Large Language Models for Biomedical In-Context Learning
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
di: Zhan, Zaifu, et al.
Pubblicazione: (2025)
Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
di: Zhang, Qingjie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
GODBench: A Benchmark for Multimodal Large Language Models in Video Comment Art
di: Lei, Yiming, et al.
Pubblicazione: (2025) -
SkeletonX: Data-Efficient Skeleton-based Action Recognition via Cross-sample Feature Aggregation
di: Zhang, Zongye, et al.
Pubblicazione: (2025) -
AttriPrompt: Dynamic Prompt Composition Learning for CLIP
di: Zhan, Qiqi, et al.
Pubblicazione: (2025) -
SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding
di: Zhang, Chenkai, et al.
Pubblicazione: (2025) -
Towards Robust and Controllable Text-to-Motion via Masked Autoregressive Diffusion
di: Zhang, Zongye, et al.
Pubblicazione: (2025)