Saved in:
| Main Authors: | Gupta, Devaansh, Li, Boyang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2407.09985 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
UniDEC : Unified Dual Encoder and Classifier Training for Extreme Multi-Label Classification
by: Kharbanda, Siddhant, et al.
Published: (2024)
by: Kharbanda, Siddhant, et al.
Published: (2024)
InceptionXML: A Lightweight Framework with Synchronized Negative Sampling for Short Text Extreme Classification
by: Kharbanda, Siddhant, et al.
Published: (2021)
by: Kharbanda, Siddhant, et al.
Published: (2021)
HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval
by: Gupta, Vipul, et al.
Published: (2026)
by: Gupta, Vipul, et al.
Published: (2026)
Quamba: A Post-Training Quantization Recipe for Selective State Space Models
by: Chiang, Hung-Yueh, et al.
Published: (2024)
by: Chiang, Hung-Yueh, et al.
Published: (2024)
CAT Merging: A Training-Free Approach for Resolving Conflicts in Model Merging
by: Sun, Wenju, et al.
Published: (2025)
by: Sun, Wenju, et al.
Published: (2025)
Task Arithmetic in Trust Region: A Training-Free Model Merging Approach to Navigate Knowledge Conflicts
by: Sun, Wenju, et al.
Published: (2025)
by: Sun, Wenju, et al.
Published: (2025)
Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation
by: Maddukuri, Abhiram, et al.
Published: (2025)
by: Maddukuri, Abhiram, et al.
Published: (2025)
On the Difficulty of Learning a Meta-network for Training Data Selection
by: Du, Zilin, et al.
Published: (2026)
by: Du, Zilin, et al.
Published: (2026)
Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging
by: Zimmer, Max, et al.
Published: (2023)
by: Zimmer, Max, et al.
Published: (2023)
Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe
by: Li, Yaxuan, et al.
Published: (2026)
by: Li, Yaxuan, et al.
Published: (2026)
MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models
by: Ye, Xin, et al.
Published: (2026)
by: Ye, Xin, et al.
Published: (2026)
SFTMix: Elevating Language Model Instruction Tuning with Mixup Recipe
by: Xiao, Yuxin, et al.
Published: (2024)
by: Xiao, Yuxin, et al.
Published: (2024)
Paint Outside the Box: Synthesizing and Selecting Training Data for Visual Grounding
by: Du, Zilin, et al.
Published: (2024)
by: Du, Zilin, et al.
Published: (2024)
VALUE: Value-Aware Large Language Model for Query Rewriting via Weighted Trie in Sponsored Search
by: Zhang, Xiao, et al.
Published: (2025)
by: Zhang, Xiao, et al.
Published: (2025)
Efficient Training of Large-Scale AI Models Through Federated Mixture-of-Experts: A System-Level Approach
by: Chen, Xiaobing, et al.
Published: (2025)
by: Chen, Xiaobing, et al.
Published: (2025)
Native Reasoning Models: Training Language Models to Reason on Unverifiable Data
by: Wang, Yuanfu, et al.
Published: (2026)
by: Wang, Yuanfu, et al.
Published: (2026)
Understanding and Accelerating the Training of Masked Diffusion Language Models
by: Hong, Chunsan, et al.
Published: (2026)
by: Hong, Chunsan, et al.
Published: (2026)
A Novel Approach to Balance Convenience and Nutrition in Meals With Long-Term Group Recommendations and Reasoning on Multimodal Recipes and its Implementation in BEACON
by: Nagpal, Vansh, et al.
Published: (2024)
by: Nagpal, Vansh, et al.
Published: (2024)
A Cross Modal Knowledge Distillation & Data Augmentation Recipe for Improving Transcriptomics Representations through Morphological Features
by: Bendidi, Ihab, et al.
Published: (2025)
by: Bendidi, Ihab, et al.
Published: (2025)
Data Efficacy for Language Model Training
by: Dai, Yalun, et al.
Published: (2025)
by: Dai, Yalun, et al.
Published: (2025)
Exploiting Block Coordinate Descent for Cost-Effective LLM Model Training
by: Liu, Zeyu, et al.
Published: (2025)
by: Liu, Zeyu, et al.
Published: (2025)
Provable Training Data Identification for Large Language Models
by: Liu, Zhenlong, et al.
Published: (2025)
by: Liu, Zhenlong, et al.
Published: (2025)
PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms
by: Wang, Wei, et al.
Published: (2026)
by: Wang, Wei, et al.
Published: (2026)
Generating Realistic Tabular Data with Large Language Models
by: Nguyen, Dang, et al.
Published: (2024)
by: Nguyen, Dang, et al.
Published: (2024)
EvoLM: In Search of Lost Language Model Training Dynamics
by: Qi, Zhenting, et al.
Published: (2025)
by: Qi, Zhenting, et al.
Published: (2025)
A Recipe for Causal Graph Regression: Confounding Effects Revisited
by: Yin, Yujia, et al.
Published: (2025)
by: Yin, Yujia, et al.
Published: (2025)
A Recipe for Stable Offline Multi-agent Reinforcement Learning
by: Lee, Dongsu, et al.
Published: (2026)
by: Lee, Dongsu, et al.
Published: (2026)
Reset & Distill: A Recipe for Overcoming Negative Transfer in Continual Reinforcement Learning
by: Ahn, Hongjoon, et al.
Published: (2024)
by: Ahn, Hongjoon, et al.
Published: (2024)
The Sharpness Disparity Principle in Transformers for Accelerating Language Model Pre-Training
by: Wang, Jinbo, et al.
Published: (2025)
by: Wang, Jinbo, et al.
Published: (2025)
Over-Searching in Search-Augmented Large Language Models
by: Xie, Roy, et al.
Published: (2026)
by: Xie, Roy, et al.
Published: (2026)
NASH: Neural Architecture and Accelerator Search for Multiplication-Reduced Hybrid Models
by: Xu, Yang, et al.
Published: (2024)
by: Xu, Yang, et al.
Published: (2024)
When Data Is Scarce: Scaling Sparse Language Models with Repeated Training
by: Wu, Boqian, et al.
Published: (2026)
by: Wu, Boqian, et al.
Published: (2026)
Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order
by: Gupta, Prakhar, et al.
Published: (2025)
by: Gupta, Prakhar, et al.
Published: (2025)
Can Large Language Models Learn Formal Logic? A Data-Driven Training and Evaluation Framework
by: Xia, Yuan, et al.
Published: (2025)
by: Xia, Yuan, et al.
Published: (2025)
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning
by: Zhao, Siyan, et al.
Published: (2025)
by: Zhao, Siyan, et al.
Published: (2025)
Optimizing the Training Diet: Data Mixture Search for Robust Time Series Forecasting
by: Pennino, Federico, et al.
Published: (2025)
by: Pennino, Federico, et al.
Published: (2025)
Regurgitative Training: The Value of Real Data in Training Large Language Models
by: Zhang, Jinghui, et al.
Published: (2024)
by: Zhang, Jinghui, et al.
Published: (2024)
Fast-DataShapley: Neural Modeling for Training Data Valuation
by: Sun, Haifeng, et al.
Published: (2025)
by: Sun, Haifeng, et al.
Published: (2025)
ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization
by: Chen, Shengzhuang, et al.
Published: (2025)
by: Chen, Shengzhuang, et al.
Published: (2025)
Actor-Critic based Online Data Mixing For Language Model Pre-Training
by: Ma, Jing, et al.
Published: (2025)
by: Ma, Jing, et al.
Published: (2025)
Similar Items
-
UniDEC : Unified Dual Encoder and Classifier Training for Extreme Multi-Label Classification
by: Kharbanda, Siddhant, et al.
Published: (2024) -
InceptionXML: A Lightweight Framework with Synchronized Negative Sampling for Short Text Extreme Classification
by: Kharbanda, Siddhant, et al.
Published: (2021) -
HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval
by: Gupta, Vipul, et al.
Published: (2026) -
Quamba: A Post-Training Quantization Recipe for Selective State Space Models
by: Chiang, Hung-Yueh, et al.
Published: (2024) -
CAT Merging: A Training-Free Approach for Resolving Conflicts in Model Merging
by: Sun, Wenju, et al.
Published: (2025)