Thunder-LLM: Efficiently Adapting LLMs to Korean with Minimal Resources
Fuente:
arXiv
Salvato in:
| Autori principali: | Kim, Jinpyo, Cho, Gyeongje, Park, Chanwoo, Park, Jongwon, Kim, Jongmin, So, Yeonkyoun, Lee, Jaejin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments
di: Hahm, Sungeun, et al.
Pubblicazione: (2025)
di: Hahm, Sungeun, et al.
Pubblicazione: (2025)
Choices Speak Louder than Questions
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
Beyond Line-Level Filtering for the Pretraining Corpora of LLMs
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
di: Jung, Sungmok, et al.
Pubblicazione: (2026)
di: Jung, Sungmok, et al.
Pubblicazione: (2026)
Thunder-NUBench: A Benchmark for LLMs' Sentence-Level Negation Understanding
di: So, Yeonkyoung, et al.
Pubblicazione: (2025)
di: So, Yeonkyoung, et al.
Pubblicazione: (2025)
Ko-MuSR: A Multistep Soft Reasoning Benchmark for LLMs Capable of Understanding Korean
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
di: Park, Chanwoo, et al.
Pubblicazione: (2025)
Integrating Spatial and Frequency Information for Under-Display Camera Image Restoration
di: Ahn, Kyusu, et al.
Pubblicazione: (2025)
di: Ahn, Kyusu, et al.
Pubblicazione: (2025)
HetCCL: Accelerating LLM Training with Heterogeneous GPUs
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
di: Kim, Heehoon, et al.
Pubblicazione: (2026)
Open Ko-LLM Leaderboard2: Bridging Foundational and Practical Evaluation for Korean LLMs
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
di: Kim, Hyeonwoo, et al.
Pubblicazione: (2024)
Open Ko-LLM Leaderboard: Evaluating Large Language Models in Korean with Ko-H5 Benchmark
di: Park, Chanjun, et al.
Pubblicazione: (2024)
di: Park, Chanjun, et al.
Pubblicazione: (2024)
How language models extrapolate outside the training data: A case study in Textualized Gridworld
di: Kim, Doyoung, et al.
Pubblicazione: (2024)
di: Kim, Doyoung, et al.
Pubblicazione: (2024)
Are they lovers or friends? Evaluating LLMs' Social Reasoning in English and Korean Dialogues
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
di: Kim, Eunsu, et al.
Pubblicazione: (2025)
Can Code-Switched Texts Activate a Knowledge Switch in LLMs? A Case Study on English-Korean Code-Switching
di: Kim, Seoyeon, et al.
Pubblicazione: (2024)
di: Kim, Seoyeon, et al.
Pubblicazione: (2024)
SEDD: Scalable and Efficient Dataset Deduplication with GPUs
di: Son, Youngjun, et al.
Pubblicazione: (2025)
di: Son, Youngjun, et al.
Pubblicazione: (2025)
Steering LLMs toward Korean Local Speech: Iterative Refinement Framework for Faithful Dialect Translation
di: Park, Keunhyeung, et al.
Pubblicazione: (2025)
di: Park, Keunhyeung, et al.
Pubblicazione: (2025)
Unsupervised Extractive Dialogue Summarization in Hyperdimensional Space
di: Park, Seongmin, et al.
Pubblicazione: (2024)
di: Park, Seongmin, et al.
Pubblicazione: (2024)
RedWhale: An Adapted Korean LLM Through Efficient Continual Pretraining
di: Vo, Anh-Dung, et al.
Pubblicazione: (2024)
di: Vo, Anh-Dung, et al.
Pubblicazione: (2024)
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
di: Lee, Nahyun, et al.
Pubblicazione: (2026)
Modeling Layered Consciousness with Multi-Agent Large Language Models
di: Kim, Sang Hun, et al.
Pubblicazione: (2025)
di: Kim, Sang Hun, et al.
Pubblicazione: (2025)
Assessing Socio-Cultural Alignment and Technical Safety of Sovereign LLMs
di: Chae, Kyubyung, et al.
Pubblicazione: (2025)
di: Chae, Kyubyung, et al.
Pubblicazione: (2025)
HiKE: Hierarchical Evaluation Framework for Korean-English Code-Switching Speech Recognition
di: Paik, Gio, et al.
Pubblicazione: (2025)
di: Paik, Gio, et al.
Pubblicazione: (2025)
Making Qwen3 Think in Korean with Reinforcement Learning
di: Lee, Jungyup, et al.
Pubblicazione: (2025)
di: Lee, Jungyup, et al.
Pubblicazione: (2025)
PHISH in MESH: Korean Adversarial Phonetic Substitution and Phonetic-Semantic Feature Integration Defense
di: Kim, Byungjun, et al.
Pubblicazione: (2025)
di: Kim, Byungjun, et al.
Pubblicazione: (2025)
Expanding Search Space with Diverse Prompting Agents: An Efficient Sampling Approach for LLM Mathematical Reasoning
di: Lee, Gisang, et al.
Pubblicazione: (2024)
di: Lee, Gisang, et al.
Pubblicazione: (2024)
SDS KoPub VDR: A Benchmark Dataset for Visual Document Retrieval in Korean Public Documents
di: Lee, Jaehoon, et al.
Pubblicazione: (2025)
di: Lee, Jaehoon, et al.
Pubblicazione: (2025)
Enhancing Korean Dependency Parsing with Morphosyntactic Features
di: Park, Jungyeul, et al.
Pubblicazione: (2025)
di: Park, Jungyeul, et al.
Pubblicazione: (2025)
KOMBO: Korean Character Representations Based on the Combination Rules of Subcharacters
di: Kim, SungHo, et al.
Pubblicazione: (2026)
di: Kim, SungHo, et al.
Pubblicazione: (2026)
Evaluating Multimodal Generative AI with Korean Educational Standards
di: Park, Sanghee, et al.
Pubblicazione: (2025)
di: Park, Sanghee, et al.
Pubblicazione: (2025)
KatFishNet: Detecting LLM-Generated Korean Text through Linguistic Feature Analysis
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
di: Park, Shinwoo, et al.
Pubblicazione: (2025)
KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models
di: Kim, Seorin, et al.
Pubblicazione: (2025)
di: Kim, Seorin, et al.
Pubblicazione: (2025)
Optimizing Korean-Centric LLMs via Token Pruning
di: Kim, Hoyeol, et al.
Pubblicazione: (2026)
di: Kim, Hoyeol, et al.
Pubblicazione: (2026)
Handling Korean Out-of-Vocabulary Words with Phoneme Representation Learning
di: Kim, Nayeon, et al.
Pubblicazione: (2025)
di: Kim, Nayeon, et al.
Pubblicazione: (2025)
Models Know Models Best: Evaluation via Model-Preferred Formats
di: Lee, Joonhak, et al.
Pubblicazione: (2026)
di: Lee, Joonhak, et al.
Pubblicazione: (2026)
Multi-Dimensional Machine Translation Evaluation: Model Evaluation and Resource for Korean
di: Park, Dojun, et al.
Pubblicazione: (2024)
di: Park, Dojun, et al.
Pubblicazione: (2024)
Enhancing Document-Level Machine Translation via Filtered Synthetic Corpora and Two-Stage LLM Adaptation
di: Kim, Ireh, et al.
Pubblicazione: (2026)
di: Kim, Ireh, et al.
Pubblicazione: (2026)
Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models
di: Kim, Zae Myung, et al.
Pubblicazione: (2025)
di: Kim, Zae Myung, et al.
Pubblicazione: (2025)
KorNAT: LLM Alignment Benchmark for Korean Social Values and Common Knowledge
di: Lee, Jiyoung, et al.
Pubblicazione: (2024)
di: Lee, Jiyoung, et al.
Pubblicazione: (2024)
KITE: A Benchmark for Evaluating Korean Instruction-Following Abilities in Large Language Models
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
di: Kim, Dongjun, et al.
Pubblicazione: (2025)
Building Resource-Constrained Language Agents: A Korean Case Study on Chemical Toxicity Information
di: Cho, Hojun, et al.
Pubblicazione: (2025)
di: Cho, Hojun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
di: Cho, Gyeongje, et al.
Pubblicazione: (2025) -
Thunder-DeID: Accurate and Efficient De-identification Framework for Korean Court Judgments
di: Hahm, Sungeun, et al.
Pubblicazione: (2025) -
Choices Speak Louder than Questions
di: Cho, Gyeongje, et al.
Pubblicazione: (2025) -
Beyond Line-Level Filtering for the Pretraining Corpora of LLMs
di: Park, Chanwoo, et al.
Pubblicazione: (2025) -
Thunder-KoNUBench: A Corpus-Aligned Benchmark for Korean Negation Understanding
di: Jung, Sungmok, et al.
Pubblicazione: (2026)