Trillion 7B Technical Report
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Han, Sungjun, Suk, Juyoung, An, Suyeong, Kim, Hyungguk, Kim, Kyuseok, Yang, Wonsuk, Choi, Seungtaek, Shin, Jamin |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Predicting LLM Reasoning Performance with Small Proxy Model
par: Koh, Woosung, et autres
Publié: (2025)
par: Koh, Woosung, et autres
Publié: (2025)
Addressing Selection Bias in Computerized Adaptive Testing: A User-Wise Aggregate Influence Function Approach
par: Kwon, Soonwoo, et autres
Publié: (2023)
par: Kwon, Soonwoo, et autres
Publié: (2023)
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
par: Kim, Seungduk, et autres
Publié: (2024)
par: Kim, Seungduk, et autres
Publié: (2024)
EuroLLM-22B: Technical Report
par: Ramos, Miguel Moura, et autres
Publié: (2026)
par: Ramos, Miguel Moura, et autres
Publié: (2026)
Nemotron-4 15B Technical Report
par: Parmar, Jupinder, et autres
Publié: (2024)
par: Parmar, Jupinder, et autres
Publié: (2024)
Nemotron-4 340B Technical Report
par: Nvidia, et autres
Publié: (2024)
par: Nvidia, et autres
Publié: (2024)
EuroLLM-9B: Technical Report
par: Martins, Pedro Henrique, et autres
Publié: (2025)
par: Martins, Pedro Henrique, et autres
Publié: (2025)
Generative Visual Code Mobile World Models
par: Koh, Woosung, et autres
Publié: (2026)
par: Koh, Woosung, et autres
Publié: (2026)
Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM
par: ai, YuanLab., et autres
Publié: (2026)
par: ai, YuanLab., et autres
Publié: (2026)
PCMind-2.1-Kaiyuan-2B Technical Report
par: Luo, Kairong, et autres
Publié: (2025)
par: Luo, Kairong, et autres
Publié: (2025)
SOLAR 10.7B: Scaling Large Language Models with Simple yet Effective Depth Up-Scaling
par: Kim, Dahyun, et autres
Publié: (2023)
par: Kim, Dahyun, et autres
Publié: (2023)
Yi-Lightning Technical Report
par: Wake, Alan, et autres
Publié: (2024)
par: Wake, Alan, et autres
Publié: (2024)
Skywork Open Reasoner 1 Technical Report
par: He, Jujie, et autres
Publié: (2025)
par: He, Jujie, et autres
Publié: (2025)
Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment
par: Kim, Dongyoung, et autres
Publié: (2024)
par: Kim, Dongyoung, et autres
Publié: (2024)
PLaMo 2 Technical Report
par: Networks, Preferred, et autres
Publié: (2025)
par: Networks, Preferred, et autres
Publié: (2025)
The Zamba2 Suite: Technical Report
par: Glorioso, Paolo, et autres
Publié: (2024)
par: Glorioso, Paolo, et autres
Publié: (2024)
Scaling Retrieval-Based Language Models with a Trillion-Token Datastore
par: Shao, Rulin, et autres
Publié: (2024)
par: Shao, Rulin, et autres
Publié: (2024)
QUICK: Quantization-aware Interleaving and Conflict-free Kernel for efficient LLM inference
par: Kim, Taesu, et autres
Publié: (2024)
par: Kim, Taesu, et autres
Publié: (2024)
Entropy Meets Importance: A Unified Head Importance-Entropy Score for Stable and Efficient Transformer Pruning
par: Choi, Minsik, et autres
Publié: (2025)
par: Choi, Minsik, et autres
Publié: (2025)
Peri-LN: Revisiting Normalization Layer in the Transformer Architecture
par: Kim, Jeonghoon, et autres
Publié: (2025)
par: Kim, Jeonghoon, et autres
Publié: (2025)
Technical Report: Small Language Model for Japanese Clinical and Medicine
par: Watanabe, Shogo
Publié: (2024)
par: Watanabe, Shogo
Publié: (2024)
LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation
par: Kim, Eunsu, et autres
Publié: (2024)
par: Kim, Eunsu, et autres
Publié: (2024)
ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization
par: Yoon, Hee Suk, et autres
Publié: (2025)
par: Yoon, Hee Suk, et autres
Publié: (2025)
Enhancing LLM Agent Safety via Causal Influence Prompting
par: Hahm, Dongyoon, et autres
Publié: (2025)
par: Hahm, Dongyoon, et autres
Publié: (2025)
Learning to Correct for QA Reasoning with Black-box LLMs
par: Kim, Jaehyung, et autres
Publié: (2024)
par: Kim, Jaehyung, et autres
Publié: (2024)
Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs
par: Microsoft, et autres
Publié: (2025)
par: Microsoft, et autres
Publié: (2025)
Litespark Technical Report: High-Throughput, Energy-Efficient LLM Training Framework
par: Dade, Nii Osae Osae, et autres
Publié: (2025)
par: Dade, Nii Osae Osae, et autres
Publié: (2025)
Hala Technical Report: Building Arabic-Centric Instruction & Translation Models at Scale
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2025)
par: Hammoud, Hasan Abed Al Kader, et autres
Publié: (2025)
Kwai Summary Attention Technical Report
par: Chu, Chenglong, et autres
Publié: (2026)
par: Chu, Chenglong, et autres
Publié: (2026)
Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
par: Yang, An, et autres
Publié: (2024)
par: Yang, An, et autres
Publié: (2024)
Taxonomy and Analysis of Sensitive User Queries in Generative AI Search
par: Jo, Hwiyeol, et autres
Publié: (2024)
par: Jo, Hwiyeol, et autres
Publié: (2024)
Ovis2.5 Technical Report
par: Lu, Shiyin, et autres
Publié: (2025)
par: Lu, Shiyin, et autres
Publié: (2025)
Few-shot Personalization of LLMs with Mis-aligned Responses
par: Kim, Jaehyung, et autres
Publié: (2024)
par: Kim, Jaehyung, et autres
Publié: (2024)
Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs
par: Choi, Yumin, et autres
Publié: (2025)
par: Choi, Yumin, et autres
Publié: (2025)
LongCat-Flash Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
A Lightweight LLM Framework for Disaster Humanitarian Information Classification
par: Jinzhen, Han, et autres
Publié: (2026)
par: Jinzhen, Han, et autres
Publié: (2026)
LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, A Technical Report
par: Zhao, Justin, et autres
Publié: (2024)
par: Zhao, Justin, et autres
Publié: (2024)
Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study
par: Lim, Junghwan, et autres
Publié: (2025)
par: Lim, Junghwan, et autres
Publié: (2025)
Development of a Large Language Model-based Multi-Agent Clinical Decision Support System for Korean Triage and Acuity Scale (KTAS)-Based Triage and Treatment Planning in Emergency Departments
par: Han, Seungjun, et autres
Publié: (2024)
par: Han, Seungjun, et autres
Publié: (2024)
Surrogate modeling for interpreting black-box LLMs in medical predictions
par: Han, Changho, et autres
Publié: (2026)
par: Han, Changho, et autres
Publié: (2026)
Documents similaires
-
Predicting LLM Reasoning Performance with Small Proxy Model
par: Koh, Woosung, et autres
Publié: (2025) -
Addressing Selection Bias in Computerized Adaptive Testing: A User-Wise Aggregate Influence Function Approach
par: Kwon, Soonwoo, et autres
Publié: (2023) -
Efficient and Effective Vocabulary Expansion Towards Multilingual Large Language Models
par: Kim, Seungduk, et autres
Publié: (2024) -
EuroLLM-22B: Technical Report
par: Ramos, Miguel Moura, et autres
Publié: (2026) -
Nemotron-4 15B Technical Report
par: Parmar, Jupinder, et autres
Publié: (2024)