ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
Fuente:
arXiv
Saved in:
| Main Authors: | Zhu, Xiaoxuan, Gu, Zhouhong, Wu, Baiqian, Zheng, Suhang, Wang, Tao, Li, Tianyu, Feng, Hongwei, Xiao, Yanghua |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LITE: LLM-Impelled efficient Taxonomy Evaluation
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
LLM-GAN: Construct Generative Adversarial Network Through Large Language Models For Explainable Fake News Detection
by: Wang, Yifeng, et al.
Published: (2024)
by: Wang, Yifeng, et al.
Published: (2024)
GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization
by: Gu, Zhouhong, et al.
Published: (2025)
by: Gu, Zhouhong, et al.
Published: (2025)
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
by: Zhu, Xiaoxuan, et al.
Published: (2024)
by: Zhu, Xiaoxuan, et al.
Published: (2024)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
by: Zhang, Lin, et al.
Published: (2025)
by: Zhang, Lin, et al.
Published: (2025)
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
by: Wang, Jianchen, et al.
Published: (2024)
by: Wang, Jianchen, et al.
Published: (2024)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
by: Wang, Xintao, et al.
Published: (2024)
by: Wang, Xintao, et al.
Published: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
Piecing Together Clues: A Benchmark for Evaluating the Detective Skills of Large Language Models
by: Gu, Zhouhong, et al.
Published: (2023)
by: Gu, Zhouhong, et al.
Published: (2023)
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
by: Li, Jialing, et al.
Published: (2026)
by: Li, Jialing, et al.
Published: (2026)
TADS: Task-Aware Data Selection for Multi-Task Multimodal Pre-Training
by: Cheng, Guanjie, et al.
Published: (2026)
by: Cheng, Guanjie, et al.
Published: (2026)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
by: Gu, Zhouhong, et al.
Published: (2024)
by: Gu, Zhouhong, et al.
Published: (2024)
Topology-Aware Dynamic Reweighting for Distribution Shifts on Graph
by: Zheng, Weihuang, et al.
Published: (2024)
by: Zheng, Weihuang, et al.
Published: (2024)
AgentGroupChat-V2: Divide-and-Conquer Is What LLM-Based Multi-Agent System Need
by: Gu, Zhouhong, et al.
Published: (2025)
by: Gu, Zhouhong, et al.
Published: (2025)
Logit Reweighting for Topic-Focused Summarization
by: Braun, Joschka, et al.
Published: (2025)
by: Braun, Joschka, et al.
Published: (2025)
Pruning then Reweighting: Towards Data-Efficient Training of Diffusion Models
by: Li, Yize, et al.
Published: (2024)
by: Li, Yize, et al.
Published: (2024)
The Power of Few: Accelerating and Enhancing Data Reweighting with Coreset Selection
by: Jafari, Mohammad, et al.
Published: (2024)
by: Jafari, Mohammad, et al.
Published: (2024)
SoftDedup: an Efficient Data Reweighting Method for Speeding Up Language Model Pre-training
by: He, Nan, et al.
Published: (2024)
by: He, Nan, et al.
Published: (2024)
Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
by: Gu, Zhouhong, et al.
Published: (2023)
by: Gu, Zhouhong, et al.
Published: (2023)
PII-Bench: Evaluating Query-Aware Privacy Protection Systems
by: Shen, Hao, et al.
Published: (2025)
by: Shen, Hao, et al.
Published: (2025)
Filter-then-Weight: Online Data Selection and Reweighting for LLM Fine-Tuning
by: Wang, Fangxin, et al.
Published: (2026)
by: Wang, Fangxin, et al.
Published: (2026)
Reinforcement Learning on Pre-Training Data
by: Li, Siheng, et al.
Published: (2025)
by: Li, Siheng, et al.
Published: (2025)
AutoScraper: A Progressive Understanding Web Agent for Web Scraper Generation
by: Huang, Wenhao, et al.
Published: (2024)
by: Huang, Wenhao, et al.
Published: (2024)
DFEPT: Data Flow Embedding for Enhancing Pre-Trained Model Based Vulnerability Detection
by: Jiang, Zhonghao, et al.
Published: (2024)
by: Jiang, Zhonghao, et al.
Published: (2024)
Velocitune: A Velocity-based Dynamic Domain Reweighting Method for Continual Pre-training
by: Luo, Zheheng, et al.
Published: (2024)
by: Luo, Zheheng, et al.
Published: (2024)
A Critical Review of the Synthesis and Applications of Spinel‐Derived Catalysts to Bio‐Oil Upgrading
by: Sasha Yang, et al.
Published: (2024)
by: Sasha Yang, et al.
Published: (2024)
Combatting Dimensional Collapse in LLM Pre-Training Data via Diversified File Selection
by: Fan, Ziqing, et al.
Published: (2025)
by: Fan, Ziqing, et al.
Published: (2025)
Synthesizing Efficient Data with Diffusion Models for Person Re-Identification Pre-Training
by: Niu, Ke, et al.
Published: (2024)
by: Niu, Ke, et al.
Published: (2024)
Predictive Performance of Deep Quantum Data Re-uploading Models
by: Wang, Xin, et al.
Published: (2025)
by: Wang, Xin, et al.
Published: (2025)
CODA: Difficulty-Aware Compute Allocation for Adaptive Reasoning
by: Wu, Siye, et al.
Published: (2026)
by: Wu, Siye, et al.
Published: (2026)
Topic Over Source: The Key to Effective Data Mixing for Language Models Pre-training
by: Peng, Jiahui, et al.
Published: (2025)
by: Peng, Jiahui, et al.
Published: (2025)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
by: Kang, Feiyang, et al.
Published: (2024)
by: Kang, Feiyang, et al.
Published: (2024)
Dual-level Progressive Hardness-Aware Reweighting for Cross-View Geo-Localization
by: Zheng, Guozheng, et al.
Published: (2025)
by: Zheng, Guozheng, et al.
Published: (2025)
A Two-Stage Data Selection Framework for Data-Efficient Model Training on Edge Devices
by: Gong, Chen, et al.
Published: (2025)
by: Gong, Chen, et al.
Published: (2025)
HAR-DoReMi: Optimizing Data Mixture for Self-Supervised Human Activity Recognition Across Heterogeneous IMU Datasets
by: Ban, Lulu, et al.
Published: (2025)
by: Ban, Lulu, et al.
Published: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
by: Yang, Kailai, et al.
Published: (2025)
by: Yang, Kailai, et al.
Published: (2025)
Skeletons Matter: Dynamic Data Augmentation for Text-to-Query
by: Ji, Yuchen, et al.
Published: (2025)
by: Ji, Yuchen, et al.
Published: (2025)
ReMiT: RL-Guided Mid-Training for Iterative LLM Evolution
by: Huang, Junjie, et al.
Published: (2026)
by: Huang, Junjie, et al.
Published: (2026)
RTMC: Step-Level Credit Assignment via Rollout Trees
by: Wang, Tao, et al.
Published: (2026)
by: Wang, Tao, et al.
Published: (2026)
Similar Items
-
LITE: LLM-Impelled efficient Taxonomy Evaluation
by: Zhang, Lin, et al.
Published: (2025) -
LLM-GAN: Construct Generative Adversarial Network Through Large Language Models For Explainable Fake News Detection
by: Wang, Yifeng, et al.
Published: (2024) -
GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization
by: Gu, Zhouhong, et al.
Published: (2025) -
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
by: Zhu, Xiaoxuan, et al.
Published: (2024) -
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
by: Zhang, Lin, et al.
Published: (2025)