VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Liu, Chonghan, Du, Yimin, An, Qi, He, Xin, Zhai, Cunqi, Tan, Fei, Lin, Weijia, Gong, Xiaochun, Deng, Yongchao, Jia, Shousheng, Zhang, Xiangzheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
por: Zou, Haosheng, et al.
Publicado: (2025)
por: Zou, Haosheng, et al.
Publicado: (2025)
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
por: Wen, Liang, et al.
Publicado: (2025)
por: Wen, Liang, et al.
Publicado: (2025)
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
por: Wang, Chenyang, et al.
Publicado: (2025)
por: Wang, Chenyang, et al.
Publicado: (2025)
The role of lipoylation in mitochondrial adaptation to methionine restriction
por: Jingyuan Xue, et al.
Publicado: (2024)
por: Jingyuan Xue, et al.
Publicado: (2024)
Phospholipid Biosynthesis: An Unforeseen Modulator of Nuclear Metabolism
por: Hong Qiu, et al.
Publicado: (2025)
por: Hong Qiu, et al.
Publicado: (2025)
Machine Learning Enhanced Multi-Factor Quantitative Trading: A Cross-Sectional Portfolio Optimization Approach with Bias Correction
por: Du, Yimin
Publicado: (2025)
por: Du, Yimin
Publicado: (2025)
Foundation Models for Low-Resource Language Education (Vision Paper)
por: Ding, Zhaojun, et al.
Publicado: (2024)
por: Ding, Zhaojun, et al.
Publicado: (2024)
Teola: Towards End-to-End Optimization of LLM-based Applications
por: Tan, Xin, et al.
Publicado: (2024)
por: Tan, Xin, et al.
Publicado: (2024)
Water‐Energy‐Carbon Nexus Within the Urban Eco‐Transformation of the Beijing‐Tianjin‐Hebei Region
por: Yifei Wang, et al.
Publicado: (2025)
por: Yifei Wang, et al.
Publicado: (2025)
SRAP-Agent: Simulating and Optimizing Scarce Resource Allocation Policy with LLM-based Agent
por: Ji, Jiarui, et al.
Publicado: (2024)
por: Ji, Jiarui, et al.
Publicado: (2024)
Augmenting Document-level Relation Extraction with Efficient Multi-Supervision
por: Lin, Xiangyu, et al.
Publicado: (2024)
por: Lin, Xiangyu, et al.
Publicado: (2024)
DCPO: Dynamic Clipping Policy Optimization
por: Yang, Shihui, et al.
Publicado: (2025)
por: Yang, Shihui, et al.
Publicado: (2025)
Intuitionistic Fuzzy Sets for Large Language Model Data Annotation: A Novel Approach to Side-by-Side Preference Labeling
por: Du, Yimin
Publicado: (2025)
por: Du, Yimin
Publicado: (2025)
Deep Learning Enhanced Multi-Day Turnover Quantitative Trading Algorithm for Chinese A-Share Market
por: Du, Yimin
Publicado: (2025)
por: Du, Yimin
Publicado: (2025)
Memory-Efficient FastText: A Comprehensive Approach Using Double-Array Trie Structures and Mark-Compact Memory Management
por: Du, Yimin
Publicado: (2025)
por: Du, Yimin
Publicado: (2025)
ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents
por: Yao, Yilun, et al.
Publicado: (2026)
por: Yao, Yilun, et al.
Publicado: (2026)
Uncertainty Under the Curve: A Sequence-Level Entropy Area Metric for Reasoning LLM
por: Zhu, Yongfu, et al.
Publicado: (2025)
por: Zhu, Yongfu, et al.
Publicado: (2025)
Entropy-Regularized Token-Level Policy Optimization for Language Agent Reinforcement
por: Wen, Muning, et al.
Publicado: (2024)
por: Wen, Muning, et al.
Publicado: (2024)
Beyond Static Alignment: Hierarchical Policy Control for LLM Safety via Risk-Aware Chain-of-Thought
por: Si, Jianfeng, et al.
Publicado: (2026)
por: Si, Jianfeng, et al.
Publicado: (2026)
Agentic Entropy-Balanced Policy Optimization
por: Dong, Guanting, et al.
Publicado: (2025)
por: Dong, Guanting, et al.
Publicado: (2025)
Relative Entropy Pathwise Policy Optimization
por: Voelcker, Claas, et al.
Publicado: (2025)
por: Voelcker, Claas, et al.
Publicado: (2025)
Efficient Switchable Safety Control in LLMs via Magic-Token-Guided Co-Training
por: Si, Jianfeng, et al.
Publicado: (2025)
por: Si, Jianfeng, et al.
Publicado: (2025)
Joint Optimization of Prompt Security and System Performance in Edge-Cloud LLM Systems
por: Huang, Haiyang, et al.
Publicado: (2025)
por: Huang, Haiyang, et al.
Publicado: (2025)
Low-Resource Vision Challenges for Foundation Models
por: Zhang, Yunhua, et al.
Publicado: (2024)
por: Zhang, Yunhua, et al.
Publicado: (2024)
Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization
por: Xu, Huimin, et al.
Publicado: (2026)
por: Xu, Huimin, et al.
Publicado: (2026)
Cognitive Edge Computing: A Comprehensive Survey on Optimizing Large Models and AI Agents for Pervasive Deployment
por: Wang, Xubin, et al.
Publicado: (2025)
por: Wang, Xubin, et al.
Publicado: (2025)
One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies
por: Li, Shaolong, et al.
Publicado: (2026)
por: Li, Shaolong, et al.
Publicado: (2026)
Low-rank Orthogonalization for Large-scale Matrix Optimization with Applications to Foundation Model Training
por: He, Chuan, et al.
Publicado: (2025)
por: He, Chuan, et al.
Publicado: (2025)
When Maximum Entropy Misleads Policy Optimization
por: Zhang, Ruipeng, et al.
Publicado: (2025)
por: Zhang, Ruipeng, et al.
Publicado: (2025)
ESPO: Entropy Importance Sampling Policy Optimization
por: Sheng, Yuepeng, et al.
Publicado: (2025)
por: Sheng, Yuepeng, et al.
Publicado: (2025)
VSPO: Vector-Steered Policy Optimization for Behavioral Control
por: Zhang, Xuechen, et al.
Publicado: (2026)
por: Zhang, Xuechen, et al.
Publicado: (2026)
Animating the Past: Reconstruct Trilobite via Video Generation
por: Wu, Xiaoran, et al.
Publicado: (2024)
por: Wu, Xiaoran, et al.
Publicado: (2024)
Diffusion Posterior Sampler for Hyperspectral Unmixing with Spectral Variability Modeling
por: Zhu, Yimin, et al.
Publicado: (2025)
por: Zhu, Yimin, et al.
Publicado: (2025)
OmniArch: Building Foundation Model For Scientific Computing
por: Chen, Tianyu, et al.
Publicado: (2024)
por: Chen, Tianyu, et al.
Publicado: (2024)
Optimistic Model Rollouts for Pessimistic Offline Policy Optimization
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
por: Zhai, Yuanzhao, et al.
Publicado: (2024)
Frontier: Towards Comprehensive and Accurate LLM Inference Simulation
por: Feng, Yicheng, et al.
Publicado: (2026)
por: Feng, Yicheng, et al.
Publicado: (2026)
Architecting Gradient Hierarchically Porous Catalyst via Negative Mixing Enthalpy High‐Entropy Alloy for Durable Water Splitting at Ampere‐Level Current Density
por: Qiqin Zhang, et al.
Publicado: (2024)
por: Qiqin Zhang, et al.
Publicado: (2024)
Lifting Data-Tracing Machine Unlearning to Knowledge-Tracing for Foundation Models
por: Tan, Yuwen, et al.
Publicado: (2025)
por: Tan, Yuwen, et al.
Publicado: (2025)
CAPF: Guiding Search-Agent Rollouts with Credit-Attenuated Privileged Feedback
por: Chen, Bin, et al.
Publicado: (2026)
por: Chen, Bin, et al.
Publicado: (2026)
Context-Enriched Contrastive Loss: Enhancing Presentation of Inherent Sample Connections in Contrastive Learning Framework
por: Deng, Haojin, et al.
Publicado: (2025)
por: Deng, Haojin, et al.
Publicado: (2025)
Ejemplares similares
-
360-LLaMA-Factory: Plug & Play Sequence Parallelism for Long Post-Training
por: Zou, Haosheng, et al.
Publicado: (2025) -
Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond
por: Wen, Liang, et al.
Publicado: (2025) -
Light-IF: Endowing LLMs with Generalizable Reasoning via Preview and Self-Checking for Complex Instruction Following
por: Wang, Chenyang, et al.
Publicado: (2025) -
The role of lipoylation in mitochondrial adaptation to methionine restriction
por: Jingyuan Xue, et al.
Publicado: (2024) -
Phospholipid Biosynthesis: An Unforeseen Modulator of Nuclear Metabolism
por: Hong Qiu, et al.
Publicado: (2025)