Entropy-Based Adaptive Weighting for Self-Training
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Xiaoxuan, Deng, Yihe, Ma, Mingyu Derek, Wang, Wei |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MIRAI: Evaluating LLM Agents for Event Forecasting
von: Ye, Chenchen, et al.
Veröffentlicht: (2024)
von: Ye, Chenchen, et al.
Veröffentlicht: (2024)
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2023)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2023)
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2024)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2024)
BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation
von: Yang, Fuyi, et al.
Veröffentlicht: (2025)
von: Yang, Fuyi, et al.
Veröffentlicht: (2025)
Flow-DPO: Improving LLM Mathematical Reasoning through Online Multi-Agent Learning
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
von: Deng, Yihe, et al.
Veröffentlicht: (2024)
AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models
von: Yu, Mingyu, et al.
Veröffentlicht: (2025)
von: Yu, Mingyu, et al.
Veröffentlicht: (2025)
Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs
von: Li, Wu, et al.
Veröffentlicht: (2026)
von: Li, Wu, et al.
Veröffentlicht: (2026)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
von: Zhang, Yubo, et al.
Veröffentlicht: (2024)
von: Zhang, Yubo, et al.
Veröffentlicht: (2024)
OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
von: Deng, Yihe, et al.
Veröffentlicht: (2025)
Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning
von: Wei, Shuyu, et al.
Veröffentlicht: (2026)
von: Wei, Shuyu, et al.
Veröffentlicht: (2026)
GIVE: Structured Reasoning of Large Language Models with Knowledge Graph Inspired Veracity Extrapolation
von: He, Jiashu, et al.
Veröffentlicht: (2024)
von: He, Jiashu, et al.
Veröffentlicht: (2024)
Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
von: Chen, Zixiang, et al.
Veröffentlicht: (2024)
Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning
von: Wang, Tianduo, et al.
Veröffentlicht: (2024)
von: Wang, Tianduo, et al.
Veröffentlicht: (2024)
Inferring from Logits: Exploring Best Practices for Decoding-Free Generative Candidate Selection
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025)
Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models
von: Wang, Shuo, et al.
Veröffentlicht: (2024)
von: Wang, Shuo, et al.
Veröffentlicht: (2024)
Entropy-Guided Token Dropout: Training Autoregressive Language Models with Limited Domain Data
von: Wang, Jiapeng, et al.
Veröffentlicht: (2025)
von: Wang, Jiapeng, et al.
Veröffentlicht: (2025)
Training LLM-Based Agents with Synthetic Self-Reflected Trajectories and Partial Masking
von: Chen, Yihan, et al.
Veröffentlicht: (2025)
von: Chen, Yihan, et al.
Veröffentlicht: (2025)
Entropy-Tree: Tree-Based Decoding with Entropy-Guided Exploration
von: Wei, Longxuan, et al.
Veröffentlicht: (2026)
von: Wei, Longxuan, et al.
Veröffentlicht: (2026)
Knowledge Bases in Support of Large Language Models for Processing Web News
von: Zhang, Yihe, et al.
Veröffentlicht: (2024)
von: Zhang, Yihe, et al.
Veröffentlicht: (2024)
Decoding Susceptibility: Modeling Misbelief to Misinformation Through a Computational Approach
von: Liu, Yanchen, et al.
Veröffentlicht: (2023)
von: Liu, Yanchen, et al.
Veröffentlicht: (2023)
SSL-SSAW: Self-Supervised Learning with Sigmoid Self-Attention Weighting for Question-Based Sign Language Translation
von: Liu, Zekang, et al.
Veröffentlicht: (2025)
von: Liu, Zekang, et al.
Veröffentlicht: (2025)
KV Shifting Attention Enhances Language Modeling
von: Xu, Mingyu, et al.
Veröffentlicht: (2024)
von: Xu, Mingyu, et al.
Veröffentlicht: (2024)
Improving Event Definition Following For Zero-Shot Event Detection
von: Cai, Zefan, et al.
Veröffentlicht: (2024)
von: Cai, Zefan, et al.
Veröffentlicht: (2024)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
von: Zhu, Xiaoxuan, et al.
Veröffentlicht: (2025)
von: Zhu, Xiaoxuan, et al.
Veröffentlicht: (2025)
Self-Enhanced Reasoning Training: Activating Latent Reasoning in Small Models for Enhanced Reasoning Distillation
von: Zhang, Yong, et al.
Veröffentlicht: (2025)
von: Zhang, Yong, et al.
Veröffentlicht: (2025)
Instructions as Backdoors: Backdoor Vulnerabilities of Instruction Tuning for Large Language Models
von: Xu, Jiashu, et al.
Veröffentlicht: (2023)
von: Xu, Jiashu, et al.
Veröffentlicht: (2023)
DAST: Difficulty-Aware Self-Training on Large Language Models
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
von: Xue, Boyang, et al.
Veröffentlicht: (2025)
Rephrase and Respond: Let Large Language Models Ask Better Questions for Themselves
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
von: Deng, Yihe, et al.
Veröffentlicht: (2023)
Swordsman: Entropy-Driven Adaptive Block Partition for Efficient Diffusion Language Models
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
von: Zhang, Yu, et al.
Veröffentlicht: (2026)
Instructional Fingerprinting of Large Language Models
von: Xu, Jiashu, et al.
Veröffentlicht: (2024)
von: Xu, Jiashu, et al.
Veröffentlicht: (2024)
Multilingual Zero Resource Speech Recognition Base on Self-Supervise Pre-Trained Acoustic Models
von: Wang, Haoyu, et al.
Veröffentlicht: (2022)
von: Wang, Haoyu, et al.
Veröffentlicht: (2022)
Retrieval as a Decision: Training-Free Adaptive Gating for Efficient RAG
von: Wang, Yufeng, et al.
Veröffentlicht: (2025)
von: Wang, Yufeng, et al.
Veröffentlicht: (2025)
Learning While Staying Curious: Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models
von: Wang, Hao, et al.
Veröffentlicht: (2026)
von: Wang, Hao, et al.
Veröffentlicht: (2026)
FecTek: Enhancing Term Weight in Lexicon-Based Retrieval with Feature Context and Term-level Knowledge
von: Wang, Zunran, et al.
Veröffentlicht: (2024)
von: Wang, Zunran, et al.
Veröffentlicht: (2024)
Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
von: Zhao, Zhengyang, et al.
Veröffentlicht: (2026)
von: Zhao, Zhengyang, et al.
Veröffentlicht: (2026)
Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
von: Zhao, Linxi, et al.
Veröffentlicht: (2024)
Weights-Rotated Preference Optimization for Large Language Models
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
von: Yang, Chenxu, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MIRAI: Evaluating LLM Agents for Event Forecasting
von: Ye, Chenchen, et al.
Veröffentlicht: (2024) -
STAR: Boosting Low-Resource Information Extraction by Structure-to-Text Data Generation with Large Language Models
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2023) -
Enhancing Large Vision Language Models with Self-Training on Image Comprehension
von: Deng, Yihe, et al.
Veröffentlicht: (2024) -
Memorize and Rank: Elevating Large Language Models for Clinical Diagnosis Prediction
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2025) -
CliBench: A Multifaceted and Multigranular Evaluation of Large Language Models for Clinical Decision Making
von: Ma, Mingyu Derek, et al.
Veröffentlicht: (2024)