Enregistré dans:
| Auteurs principaux: | Liu, Fengze, Zhou, Weidong, Liu, Binbin, Yu, Zhimiao, Zhang, Yifan, Lin, Haobin, Yu, Yifeng, Zhang, Bingni, Zhou, Xiaohuan, Wang, Taifeng, Cao, Yong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2504.16511 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
par: Liu, Fengze, et autres
Publié: (2026)
par: Liu, Fengze, et autres
Publié: (2026)
Target-Oriented Pretraining Data Selection via Neuron-Activated Graph
par: Wang, Zijun, et autres
Publié: (2026)
par: Wang, Zijun, et autres
Publié: (2026)
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
par: Guo, Ping, et autres
Publié: (2025)
par: Guo, Ping, et autres
Publié: (2025)
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
par: Chen, Zhixun, et autres
Publié: (2025)
par: Chen, Zhixun, et autres
Publié: (2025)
TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
MuBench: Assessment of Multilingual Capabilities of Large Language Models Across 61 Languages
par: Han, Wenhan, et autres
Publié: (2025)
par: Han, Wenhan, et autres
Publié: (2025)
MathMixup: Boosting LLM Mathematical Reasoning with Difficulty-Controllable Data Synthesis and Curriculum Learning
par: Li, Xuchen, et autres
Publié: (2026)
par: Li, Xuchen, et autres
Publié: (2026)
Mosaic TMEM173 gene mutation R284S leading to STING‐associated vasculopathy with onset in infancy (SAVI)
par: Zhou Yang, et autres
Publié: (2024)
par: Zhou Yang, et autres
Publié: (2024)
MoORE: SVD-based Model MoE-ization for Conflict- and Oblivion-Resistant Multi-Task Adaptation
par: Yuan, Shen, et autres
Publié: (2025)
par: Yuan, Shen, et autres
Publié: (2025)
You are what you watch: How movies and TV affect everything By WalterHickey, New York: Workman Publishing Company. 2023. pp. 240. $22.39 (hbk)
par: Zhimiao Yang
Publié: (2024)
par: Zhimiao Yang
Publié: (2024)
Evaluating AI Grading on Real-World Handwritten College Mathematics: A Large-Scale Study Toward a Benchmark
par: Yu, Zhiqi, et autres
Publié: (2026)
par: Yu, Zhiqi, et autres
Publié: (2026)
Quasi-Large Hole Polarons in BiVO4-Implications for Photocatalysis and Solar Energy Conversion
par: Hao, Zhimeng, et autres
Publié: (2025)
par: Hao, Zhimeng, et autres
Publié: (2025)
Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records
par: Shen, Shiyu, et autres
Publié: (2025)
par: Shen, Shiyu, et autres
Publié: (2025)
Stretch Tunable Active Frequency Selective Fabric for Dynamically Switchable Bandstop and Transparency
par: Hao Feng, et autres
Publié: (2026)
par: Hao Feng, et autres
Publié: (2026)
CodingTeachLLM: Empowering LLM's Coding Ability via AST Prior Knowledge
par: Chen, Zhangquan, et autres
Publié: (2024)
par: Chen, Zhangquan, et autres
Publié: (2024)
Edge-Based Multimodal Sensor Data Fusion with Vision Language Models (VLMs) for Real-time Autonomous Vehicle Accident Avoidance
par: Yang, Fengze, et autres
Publié: (2025)
par: Yang, Fengze, et autres
Publié: (2025)
Adanonymizer: Interactively Navigating and Balancing the Duality of Privacy and Output Performance in Human-LLM Interaction
par: Zhang, Shuning, et autres
Publié: (2024)
par: Zhang, Shuning, et autres
Publié: (2024)
Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering
par: Negoita, Vlad, et autres
Publié: (2025)
par: Negoita, Vlad, et autres
Publié: (2025)
Balancing Diversity and Risk in LLM Sampling: How to Select Your Method and Parameter for Open-Ended Text Generation
par: Zhou, Yuxuan, et autres
Publié: (2024)
par: Zhou, Yuxuan, et autres
Publié: (2024)
Craw4LLM: Efficient Web Crawling for LLM Pretraining
par: Yu, Shi, et autres
Publié: (2025)
par: Yu, Shi, et autres
Publié: (2025)
Harnessing Diversity for Important Data Selection in Pretraining Large Language Models
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
Uneventful: Event Semantics for “Qua”
par: Annina Loets
Publié: (2024)
par: Annina Loets
Publié: (2024)
H-Zero: Cross-Humanoid Locomotion Pretraining Enables Few-shot Novel Embodiment Transfer
par: Lin, Yunfeng, et autres
Publié: (2025)
par: Lin, Yunfeng, et autres
Publié: (2025)
Dual‐Anion Entropy Engineering of Se–P High‐Entropy Interfaces in HEAs for Optimized H * Binding and Accelerated Hydrogen Evolution
par: Asif Mahmood, et autres
Publié: (2026)
par: Asif Mahmood, et autres
Publié: (2026)
MASS: Mathematical Data Selection via Skill Graphs for Pretraining Large Language Models
par: Li, Jiazheng, et autres
Publié: (2025)
par: Li, Jiazheng, et autres
Publié: (2025)
Antibiotic exposure alters the honeybee gut microbiota and may interfere with the honeybee behavioral caste transition
par: Zijing Zhang, et autres
Publié: (2024)
par: Zijing Zhang, et autres
Publié: (2024)
QuaLLM: An LLM-based Framework to Extract Quantitative Insights from Online Forums
par: Rao, Varun Nagaraj, et autres
Publié: (2024)
par: Rao, Varun Nagaraj, et autres
Publié: (2024)
Synthesis and Characterization of α,ω‐Dihydroxy Telechelic and Star‐Shaped Poly(γ‐Butyrolactone)s by Organocatalytic Living/Controlled Ring‐Opening Polymerization: Depolymerization and Physical Properties
par: Yihang Liu, et autres
Publié: (2025)
par: Yihang Liu, et autres
Publié: (2025)
Agent Assurance in Regulated Financial Services
par: Zhong, Fengze
Publié: (2026)
par: Zhong, Fengze
Publié: (2026)
Agent Assurance in Regulated Financial Services
par: Zhong, Fengze
Publié: (2026)
par: Zhong, Fengze
Publié: (2026)
Research on an Autonomous UAV Search and Rescue System Based on the Improved
par: Chen, Haobin, et autres
Publié: (2024)
par: Chen, Haobin, et autres
Publié: (2024)
SenseRAG: Constructing Environmental Knowledge Bases with Proactive Querying for LLM-Based Autonomous Driving
par: Luo, Xuewen, et autres
Publié: (2025)
par: Luo, Xuewen, et autres
Publié: (2025)
Diffusion-Guided Pretraining for Brain Graph Foundation Models
par: Wei, Xinxu, et autres
Publié: (2026)
par: Wei, Xinxu, et autres
Publié: (2026)
Skip-SCAR: Hardware-Friendly High-Quality Embodied Visual Navigation
par: Liu, Yaotian, et autres
Publié: (2024)
par: Liu, Yaotian, et autres
Publié: (2024)
KnowDiffuser: A Knowledge-Guided Diffusion Planner with LLM Reasoning
par: Ding, Fan, et autres
Publié: (2026)
par: Ding, Fan, et autres
Publié: (2026)
Arrows of Math Reasoning Data Synthesis for Large Language Models: Diversity, Complexity and Correctness
par: Chen, Sirui, et autres
Publié: (2025)
par: Chen, Sirui, et autres
Publié: (2025)
SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation
par: Wang, Hui, et autres
Publié: (2025)
par: Wang, Hui, et autres
Publié: (2025)
ComSD: Balancing Behavioral Quality and Diversity in Unsupervised Skill Discovery
par: Liu, Xin, et autres
Publié: (2023)
par: Liu, Xin, et autres
Publié: (2023)
QuaLITi: Quantum Machine Learning Hardware Selection for Inferencing with Top-Tier Performance
par: Phalak, Koustubh, et autres
Publié: (2024)
par: Phalak, Koustubh, et autres
Publié: (2024)
In-situ aligned all-polarization-maintaining Er-doped fiber laser mode-locked by a nonlinear amplifying loop mirror
par: Zhang, Xiang, et autres
Publié: (2024)
par: Zhang, Xiang, et autres
Publié: (2024)
Documents similaires
-
InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition
par: Liu, Fengze, et autres
Publié: (2026) -
Target-Oriented Pretraining Data Selection via Neuron-Activated Graph
par: Wang, Zijun, et autres
Publié: (2026) -
Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining
par: Guo, Ping, et autres
Publié: (2025) -
MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
par: Chen, Zhixun, et autres
Publié: (2025) -
TiKMiX: Take Data Influence into Dynamic Mixture for Language Model Pre-training
par: Wang, Yifan, et autres
Publié: (2025)