Guardado en:
| Autores principales: | Song, Zihui, Ji, Shihao, Li, Hongxi, Cheng, Shuaizhi, Huang, Chunlin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2605.20196 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
L-MoE: End-to-End Training of a Lightweight Mixture of Low-Rank Adaptation Experts
por: Ji, Shihao, et al.
Publicado: (2025)
por: Ji, Shihao, et al.
Publicado: (2025)
MyGO: Memory Yielding Generative Offline-consolidation for Lifelong Learning Systems
por: Ji, Shihao, et al.
Publicado: (2025)
por: Ji, Shihao, et al.
Publicado: (2025)
Credal Transformer: A Principled Approach for Quantifying and Mitigating Hallucinations in Large Language Models
por: Ji, Shihao, et al.
Publicado: (2025)
por: Ji, Shihao, et al.
Publicado: (2025)
Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features
por: Ji, Shihao, et al.
Publicado: (2025)
por: Ji, Shihao, et al.
Publicado: (2025)
Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context
por: Ji, Shihao, et al.
Publicado: (2026)
por: Ji, Shihao, et al.
Publicado: (2026)
The Importance of Online Data: Understanding Preference Fine-tuning via Coverage
por: Song, Yuda, et al.
Publicado: (2024)
por: Song, Yuda, et al.
Publicado: (2024)
Formalising the Logit Shift Induced by LoRA: A Technical Note
por: Shi, Xiang, et al.
Publicado: (2026)
por: Shi, Xiang, et al.
Publicado: (2026)
Scaling Laws for Predicting Downstream Performance in LLMs
por: Chen, Yangyi, et al.
Publicado: (2024)
por: Chen, Yangyi, et al.
Publicado: (2024)
ProgressGym: Alignment with a Millennium of Moral Progress
por: Qiu, Tianyi, et al.
Publicado: (2024)
por: Qiu, Tianyi, et al.
Publicado: (2024)
HyperMLP: An Integrated Perspective for Sequence Modeling
por: Lu, Jiecheng, et al.
Publicado: (2026)
por: Lu, Jiecheng, et al.
Publicado: (2026)
Free Energy Mixer
por: Lu, Jiecheng, et al.
Publicado: (2026)
por: Lu, Jiecheng, et al.
Publicado: (2026)
The Override Gap: A Magnitude Account of Knowledge Conflict Failure in Hypernetwork-Based Instant LLM Adaptation
por: Cheng, Shuaizhi, et al.
Publicado: (2026)
por: Cheng, Shuaizhi, et al.
Publicado: (2026)
AutoScale: Scale-Aware Data Mixing for Pre-Training LLMs
por: Kang, Feiyang, et al.
Publicado: (2024)
por: Kang, Feiyang, et al.
Publicado: (2024)
Predicting Task Performance with Context-aware Scaling Laws
por: Montgomery, Kyle, et al.
Publicado: (2025)
por: Montgomery, Kyle, et al.
Publicado: (2025)
Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions
por: Li, Yongqi, et al.
Publicado: (2026)
por: Li, Yongqi, et al.
Publicado: (2026)
IPAD: Inverse Prompt for AI Detection - A Robust and Interpretable LLM-Generated Text Detector
por: Chen, Zheng, et al.
Publicado: (2025)
por: Chen, Zheng, et al.
Publicado: (2025)
Incremental Summarization for Customer Support via Progressive Note-Taking and Agent Feedback
por: Wu, Yisha, et al.
Publicado: (2025)
por: Wu, Yisha, et al.
Publicado: (2025)
ConU: Conformal Uncertainty in Large Language Models with Correctness Coverage Guarantees
por: Wang, Zhiyuan, et al.
Publicado: (2024)
por: Wang, Zhiyuan, et al.
Publicado: (2024)
In-context Time Series Predictor
por: Lu, Jiecheng, et al.
Publicado: (2024)
por: Lu, Jiecheng, et al.
Publicado: (2024)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
por: Song, Xiaoshuai, et al.
Publicado: (2026)
por: Song, Xiaoshuai, et al.
Publicado: (2026)
Developing an End-to-End Framework for Predicting the Social Communication Severity Scores of Children with Autism Spectrum Disorder
por: Mun, Jihyun, et al.
Publicado: (2024)
por: Mun, Jihyun, et al.
Publicado: (2024)
ReAct Meets ActRe: When Language Agents Enjoy Training Data Autonomy
por: Yang, Zonghan, et al.
Publicado: (2024)
por: Yang, Zonghan, et al.
Publicado: (2024)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
por: Zeng, Liang, et al.
Publicado: (2024)
por: Zeng, Liang, et al.
Publicado: (2024)
RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?
por: Xu, Haotian, et al.
Publicado: (2025)
por: Xu, Haotian, et al.
Publicado: (2025)
DISCO Balances the Scales: Adaptive Domain- and Difficulty-Aware Reinforcement Learning on Imbalanced Data
por: Zhou, Yuhang, et al.
Publicado: (2025)
por: Zhou, Yuhang, et al.
Publicado: (2025)
Health Insurance Coverage Rule Interpretation Corpus: Law, Policy, and Medical Guidance for Health Insurance Coverage Understanding
por: Gartner, Mike
Publicado: (2025)
por: Gartner, Mike
Publicado: (2025)
Can Interpretation Predict Behavior on Unseen Data?
por: Li, Victoria R., et al.
Publicado: (2025)
por: Li, Victoria R., et al.
Publicado: (2025)
Progressive Knowledge Graph Completion
por: Li, Jiayi, et al.
Publicado: (2024)
por: Li, Jiayi, et al.
Publicado: (2024)
TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
por: Dzikanyanga, Gradwell, et al.
Publicado: (2026)
Balancing Coverage and Draft Latency in Vocabulary Trimming for Faster Speculative Decoding
por: Shoham, Ofir Ben
Publicado: (2026)
por: Shoham, Ofir Ben
Publicado: (2026)
Scaling DPPs for RAG: Density Meets Diversity
por: Sun, Xun, et al.
Publicado: (2026)
por: Sun, Xun, et al.
Publicado: (2026)
Scaling Data-Constrained Language Models
por: Muennighoff, Niklas, et al.
Publicado: (2023)
por: Muennighoff, Niklas, et al.
Publicado: (2023)
Scaling Inference-Efficient Language Models
por: Bian, Song, et al.
Publicado: (2025)
por: Bian, Song, et al.
Publicado: (2025)
Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training
por: Yang, Kailai, et al.
Publicado: (2025)
por: Yang, Kailai, et al.
Publicado: (2025)
Loss-to-Loss Prediction: Scaling Laws for All Datasets
por: Brandfonbrener, David, et al.
Publicado: (2024)
por: Brandfonbrener, David, et al.
Publicado: (2024)
Scaling with Collapse: Efficient and Predictable Training of LLM Families
por: Bergsma, Shane, et al.
Publicado: (2025)
por: Bergsma, Shane, et al.
Publicado: (2025)
Observational Scaling Laws and the Predictability of Language Model Performance
por: Ruan, Yangjun, et al.
Publicado: (2024)
por: Ruan, Yangjun, et al.
Publicado: (2024)
An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning
por: Chen, Zui, et al.
Publicado: (2024)
por: Chen, Zui, et al.
Publicado: (2024)
Theoretical Foundations of Scaling Law in Familial Models
por: Song, Huan, et al.
Publicado: (2025)
por: Song, Huan, et al.
Publicado: (2025)
Generating Pretraining Tokens from Organic Data for Data-Bound Scaling
por: Yu, Zichun, et al.
Publicado: (2026)
por: Yu, Zichun, et al.
Publicado: (2026)
Ejemplares similares
-
L-MoE: End-to-End Training of a Lightweight Mixture of Low-Rank Adaptation Experts
por: Ji, Shihao, et al.
Publicado: (2025) -
MyGO: Memory Yielding Generative Offline-consolidation for Lifelong Learning Systems
por: Ji, Shihao, et al.
Publicado: (2025) -
Credal Transformer: A Principled Approach for Quantifying and Mitigating Hallucinations in Large Language Models
por: Ji, Shihao, et al.
Publicado: (2025) -
Xiaoice: Training-Free Video Understanding via Self-Supervised Spatio-Temporal Clustering of Semantic Features
por: Ji, Shihao, et al.
Publicado: (2025) -
Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context
por: Ji, Shihao, et al.
Publicado: (2026)