Can Language Models Discover Scaling Laws?
Fuente:
arXiv
Salvato in:
| Autori principali: | Lin, Haowei, Ye, Haotian, Feng, Wenzheng, Huang, Quzhe, Li, Yujun, Lim, Hubert, Li, Zhengrui, Wang, Xiangyu, Ma, Jianzhu, Liang, Yitao, Zou, James |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
di: Lin, Haowei, et al.
Pubblicazione: (2024)
di: Lin, Haowei, et al.
Pubblicazione: (2024)
Inference-time Scaling of Diffusion Models through Classical Search
di: Zhang, Xiangcheng, et al.
Pubblicazione: (2025)
di: Zhang, Xiangcheng, et al.
Pubblicazione: (2025)
Generative Evaluation of Complex Reasoning in Large Language Models
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
TFG-Flow: Training-free Guidance in Multimodal Generative Flow
di: Lin, Haowei, et al.
Pubblicazione: (2025)
di: Lin, Haowei, et al.
Pubblicazione: (2025)
TFG: Unified Training-Free Guidance for Diffusion Models
di: Ye, Haotian, et al.
Pubblicazione: (2024)
di: Ye, Haotian, et al.
Pubblicazione: (2024)
Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
RAT: Retrieval Augmented Thoughts Elicit Context-Aware Reasoning in Long-Horizon Generation
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
Only One Relation Possible? Modeling the Ambiguity in Event Temporal Relation Extraction
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
What Kinds of Tokens Benefit from Distant Text? An Analysis on Long Context Language Modeling
di: Hu, Yutong, et al.
Pubblicazione: (2024)
di: Hu, Yutong, et al.
Pubblicazione: (2024)
Efficient and Asymptotically Unbiased Constrained Decoding for Large Language Models
di: Ye, Haotian, et al.
Pubblicazione: (2025)
di: Ye, Haotian, et al.
Pubblicazione: (2025)
A Neural Symbolic Model for Space Physics
di: Ying, Jie, et al.
Pubblicazione: (2025)
di: Ying, Jie, et al.
Pubblicazione: (2025)
MC$^2$: Towards Transparent and Culturally-Aware NLP for Minority Languages in China
di: Zhang, Chen, et al.
Pubblicazione: (2023)
di: Zhang, Chen, et al.
Pubblicazione: (2023)
Discovering Latent Knowledge in Language Models Without Supervision
di: Burns, Collin, et al.
Pubblicazione: (2022)
di: Burns, Collin, et al.
Pubblicazione: (2022)
CLoG: Benchmarking Continual Learning of Image Generation Models
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
di: Zhang, Haotian, et al.
Pubblicazione: (2024)
Unlocking the Potential of Model Merging for Low-Resource Languages
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
Peptide2Mol: A Diffusion Model for Generating Small Molecules as Peptide Mimics for Targeted Protein Binding
di: He, Xinheng, et al.
Pubblicazione: (2025)
di: He, Xinheng, et al.
Pubblicazione: (2025)
JARVIS-VLA: Post-Training Large-Scale Vision Language Models to Play Visual Games with Keyboards and Mouse
di: Li, Muyao, et al.
Pubblicazione: (2025)
di: Li, Muyao, et al.
Pubblicazione: (2025)
Automating Legal Interpretation with LLMs: Retrieval, Generation, and Evaluation
di: Luo, Kangcheng, et al.
Pubblicazione: (2025)
di: Luo, Kangcheng, et al.
Pubblicazione: (2025)
Large Language Models Are Read/Write Policy-Makers for Simultaneous Generation
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
di: Guo, Shoutao, et al.
Pubblicazione: (2025)
Can We Achieve High-quality Direct Speech-to-Speech Translation without Parallel Speech Data?
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
di: Fang, Qingkai, et al.
Pubblicazione: (2024)
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
di: Li, Sijie, et al.
Pubblicazione: (2026)
di: Li, Sijie, et al.
Pubblicazione: (2026)
Overcoming Non-monotonicity in Transducer-based Streaming Generation
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
di: Ma, Zhengrui, et al.
Pubblicazione: (2024)
Probing Multimodal Large Language Models for Global and Local Semantic Representations
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
di: Tao, Mingxu, et al.
Pubblicazione: (2024)
Unified Cross-Scale 3D Generation and Understanding via Autoregressive Modeling
di: Lu, Shuqi, et al.
Pubblicazione: (2025)
di: Lu, Shuqi, et al.
Pubblicazione: (2025)
OmniJARVIS: Unified Vision-Language-Action Tokenization Enables Open-World Instruction Following Agents
di: Wang, Zihao, et al.
Pubblicazione: (2024)
di: Wang, Zihao, et al.
Pubblicazione: (2024)
GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
di: Cai, Shaofei, et al.
Pubblicazione: (2024)
Reducing Hallucinations in Vision-Language Models via Latent Space Steering
di: Liu, Sheng, et al.
Pubblicazione: (2024)
di: Liu, Sheng, et al.
Pubblicazione: (2024)
Integrating Protein Dynamics into Structure-Based Drug Design via Full-Atom Stochastic Flows
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
di: Zhou, Xiangxin, et al.
Pubblicazione: (2025)
Evaluation-driven Scaling for Scientific Discovery
di: Ye, Haotian, et al.
Pubblicazione: (2026)
di: Ye, Haotian, et al.
Pubblicazione: (2026)
MCU: An Evaluation Framework for Open-Ended Game Agents
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
di: Zheng, Xinyue, et al.
Pubblicazione: (2023)
UniCode: Augmenting Evaluation for Code Reasoning
di: Zheng, Xinyue, et al.
Pubblicazione: (2025)
di: Zheng, Xinyue, et al.
Pubblicazione: (2025)
SiLLM: Large Language Models for Simultaneous Machine Translation
di: Guo, Shoutao, et al.
Pubblicazione: (2024)
di: Guo, Shoutao, et al.
Pubblicazione: (2024)
Freeze then Train: Towards Provable Representation Learning under Spurious Correlations and Feature Noise
di: Ye, Haotian, et al.
Pubblicazione: (2022)
di: Ye, Haotian, et al.
Pubblicazione: (2022)
Agent-SiMT: Agent-assisted Simultaneous Machine Translation with Large Language Models
di: Guo, Shoutao, et al.
Pubblicazione: (2024)
di: Guo, Shoutao, et al.
Pubblicazione: (2024)
InterPLM: Discovering Interpretable Features in Protein Language Models via Sparse Autoencoders
di: Simon, Elana, et al.
Pubblicazione: (2024)
di: Simon, Elana, et al.
Pubblicazione: (2024)
Temporal Scaling Law for Large Language Models
di: Xiong, Yizhe, et al.
Pubblicazione: (2024)
di: Xiong, Yizhe, et al.
Pubblicazione: (2024)
How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs
di: Zhuang, Shuxin, et al.
Pubblicazione: (2026)
di: Zhuang, Shuxin, et al.
Pubblicazione: (2026)
IMU Propagation as Preintegration
di: Huai, Jianzhu
Pubblicazione: (2026)
di: Huai, Jianzhu
Pubblicazione: (2026)
Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining
di: Li, Houyi, et al.
Pubblicazione: (2025)
di: Li, Houyi, et al.
Pubblicazione: (2025)
Scaling Laws for State Dynamics in Large Language Models
di: Li, Jacob X, et al.
Pubblicazione: (2025)
di: Li, Jacob X, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Selecting Large Language Model to Fine-tune via Rectified Scaling Law
di: Lin, Haowei, et al.
Pubblicazione: (2024) -
Inference-time Scaling of Diffusion Models through Classical Search
di: Zhang, Xiangcheng, et al.
Pubblicazione: (2025) -
Generative Evaluation of Complex Reasoning in Large Language Models
di: Lin, Haowei, et al.
Pubblicazione: (2025) -
TFG-Flow: Training-free Guidance in Multimodal Generative Flow
di: Lin, Haowei, et al.
Pubblicazione: (2025) -
TFG: Unified Training-Free Guidance for Diffusion Models
di: Ye, Haotian, et al.
Pubblicazione: (2024)