LLM Data Selection and Utilization via Dynamic Bi-level Optimization
Fuente:
arXiv
Salvato in:
| Autori principali: | Yu, Yang, Han, Kai, Zhou, Hang, Tang, Yehui, Huang, Kaiqi, Wang, Yunhe, Tao, Dacheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
di: Zhou, Hang, et al.
Pubblicazione: (2024)
di: Zhou, Hang, et al.
Pubblicazione: (2024)
Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
di: Bi, Zhenni, et al.
Pubblicazione: (2024)
di: Bi, Zhenni, et al.
Pubblicazione: (2024)
Offline Behavioral Data Selection
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
ROOT: Robust Orthogonalized Optimizer for Neural Network Training
di: He, Wei, et al.
Pubblicazione: (2025)
di: He, Wei, et al.
Pubblicazione: (2025)
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
di: Tang, Yehui, et al.
Pubblicazione: (2024)
di: Tang, Yehui, et al.
Pubblicazione: (2024)
Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs
di: Han, Kai, et al.
Pubblicazione: (2024)
di: Han, Kai, et al.
Pubblicazione: (2024)
Saliency-driven Dynamic Token Pruning for Large Language Models
di: Tao, Yao, et al.
Pubblicazione: (2025)
di: Tao, Yao, et al.
Pubblicazione: (2025)
When Do LLMs Reason? A Dynamical Systems View via Entropy Phase Transitions
di: Xia, Wei, et al.
Pubblicazione: (2026)
di: Xia, Wei, et al.
Pubblicazione: (2026)
A Step Back: Prefix Importance Ratio Stabilizes Policy Optimization
di: Lei, Shiye, et al.
Pubblicazione: (2026)
di: Lei, Shiye, et al.
Pubblicazione: (2026)
Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science
di: Han, Jing, et al.
Pubblicazione: (2025)
di: Han, Jing, et al.
Pubblicazione: (2025)
Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning
di: Li, Xuan, et al.
Pubblicazione: (2026)
di: Li, Xuan, et al.
Pubblicazione: (2026)
Distillation Traps and Guards: A Calibration Knob for LLM Distillability
di: Zhan, Weixiao, et al.
Pubblicazione: (2026)
di: Zhan, Weixiao, et al.
Pubblicazione: (2026)
Diffusion In Diffusion: Reclaiming Global Coherence in Semi-Autoregressive Diffusion
di: Ma, Linrui, et al.
Pubblicazione: (2026)
di: Ma, Linrui, et al.
Pubblicazione: (2026)
Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning
di: Zhang, Ling, et al.
Pubblicazione: (2025)
di: Zhang, Ling, et al.
Pubblicazione: (2025)
Revisiting LLM Reasoning via Information Bottleneck
di: Lei, Shiye, et al.
Pubblicazione: (2025)
di: Lei, Shiye, et al.
Pubblicazione: (2025)
EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
di: Pan, Chengjun, et al.
Pubblicazione: (2026)
Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
di: Hu, Zixuan, et al.
Pubblicazione: (2025)
di: Hu, Zixuan, et al.
Pubblicazione: (2025)
MCTS-EP: Empowering Embodied Planning with Online Preference Optimization
di: Xu, Hang, et al.
Pubblicazione: (2025)
di: Xu, Hang, et al.
Pubblicazione: (2025)
SEAL: Safety-enhanced Aligned LLM Fine-tuning via Bilevel Data Selection
di: Shen, Han, et al.
Pubblicazione: (2024)
di: Shen, Han, et al.
Pubblicazione: (2024)
Efficient Data Selection for Multimodal Models via Incremental Optimization Utility
di: Jing, Jinhao, et al.
Pubblicazione: (2026)
di: Jing, Jinhao, et al.
Pubblicazione: (2026)
Automatic Demonstration Selection for LLM-based Tabular Data Classification
di: Han, Shuchu, et al.
Pubblicazione: (2025)
di: Han, Shuchu, et al.
Pubblicazione: (2025)
Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
di: Li, Songze, et al.
Pubblicazione: (2025)
di: Li, Songze, et al.
Pubblicazione: (2025)
ROAD: Adaptive Data Mixing for Offline-to-Online Reinforcement Learning via Bi-Level Optimization
di: Yang, Letian, et al.
Pubblicazione: (2026)
di: Yang, Letian, et al.
Pubblicazione: (2026)
TimeAPN: Adaptive Amplitude-Phase Non-Stationarity Normalization for Time Series Forecasting
di: Hu, Yue, et al.
Pubblicazione: (2026)
di: Hu, Yue, et al.
Pubblicazione: (2026)
BiSHop: Bi-Directional Cellular Learning for Tabular Data with Generalized Sparse Modern Hopfield Model
di: Xu, Chenwei, et al.
Pubblicazione: (2024)
di: Xu, Chenwei, et al.
Pubblicazione: (2024)
Memory-Efficient Gradient Unrolling for Large-Scale Bi-level Optimization
di: Shen, Qianli, et al.
Pubblicazione: (2024)
di: Shen, Qianli, et al.
Pubblicazione: (2024)
From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization
di: Chen, Xinjie, et al.
Pubblicazione: (2025)
di: Chen, Xinjie, et al.
Pubblicazione: (2025)
Graph Structure Learning with Bi-level Optimization
di: Yin, Nan
Pubblicazione: (2024)
di: Yin, Nan
Pubblicazione: (2024)
Learning Dynamic Representations via An Optimally-Weighted Maximum Mean Discrepancy Optimization Framework for Continual Learning
di: Huang, KaiHui, et al.
Pubblicazione: (2025)
di: Huang, KaiHui, et al.
Pubblicazione: (2025)
ScaleNet: Scaling up Pretrained Neural Networks with Incremental Parameters
di: Hao, Zhiwei, et al.
Pubblicazione: (2025)
di: Hao, Zhiwei, et al.
Pubblicazione: (2025)
Efficient Differentiable Causal Discovery via Reliable Super-Structure Learning
di: Ma, Pingchuan, et al.
Pubblicazione: (2026)
di: Ma, Pingchuan, et al.
Pubblicazione: (2026)
DeepSelective: Interpretable Prognosis Prediction via Feature Selection and Compression in EHR Data
di: Zhang, Ruochi, et al.
Pubblicazione: (2025)
di: Zhang, Ruochi, et al.
Pubblicazione: (2025)
Optimizing In-Context Demonstrations for LLM-based Automated Grading
di: Chu, Yucheng, et al.
Pubblicazione: (2026)
di: Chu, Yucheng, et al.
Pubblicazione: (2026)
LENSLLM: Unveiling Fine-Tuning Dynamics for LLM Selection
di: Zeng, Xinyue, et al.
Pubblicazione: (2025)
di: Zeng, Xinyue, et al.
Pubblicazione: (2025)
A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
di: Hu, Xiaolin, et al.
Pubblicazione: (2026)
KnapSpec: Self-Speculative Decoding via Adaptive Layer Selection as a Knapsack Problem
di: Cha, Seongjin, et al.
Pubblicazione: (2026)
di: Cha, Seongjin, et al.
Pubblicazione: (2026)
Less is More: Improving LLM Alignment via Preference Data Selection
di: Deng, Xun, et al.
Pubblicazione: (2025)
di: Deng, Xun, et al.
Pubblicazione: (2025)
Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
di: Hu, Jifeng, et al.
Pubblicazione: (2025)
Influential Language Data Selection via Gradient Trajectory Pursuit
di: Deng, Zhiwei, et al.
Pubblicazione: (2024)
di: Deng, Zhiwei, et al.
Pubblicazione: (2024)
Confusion-Aware Rubric Optimization for LLM-based Automated Grading
di: Chu, Yucheng, et al.
Pubblicazione: (2026)
di: Chu, Yucheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Star-Agents: Automatic Data Optimization with LLM Agents for Instruction Tuning
di: Zhou, Hang, et al.
Pubblicazione: (2024) -
Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
di: Bi, Zhenni, et al.
Pubblicazione: (2024) -
Offline Behavioral Data Selection
di: Lei, Shiye, et al.
Pubblicazione: (2025) -
ROOT: Robust Orthogonalized Optimizer for Neural Network Training
di: He, Wei, et al.
Pubblicazione: (2025) -
PanGu-$π$ Pro:Rethinking Optimization and Architecture for Tiny Language Models
di: Tang, Yehui, et al.
Pubblicazione: (2024)