Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Youmi, Mizuki, Sakae, Fujii, Kazuki, Nakamura, Taishi, Ohi, Masanari, Shimada, Hinari, Shiotani, Taihei, Saito, Koshiro, Maeda, Koki, Hattori, Kakeru, Okamoto, Takumi, Ishida, Shigeki, Yokota, Rio, Takamura, Hiroya, Okazaki, Naoaki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs
par: Saito, Koshiro, et autres
Publié: (2024)
par: Saito, Koshiro, et autres
Publié: (2024)
Rewriting Pre-Training Data Boosts LLM Performance in Math and Code
par: Fujii, Kazuki, et autres
Publié: (2025)
par: Fujii, Kazuki, et autres
Publié: (2025)
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
par: Fujii, Kazuki, et autres
Publié: (2024)
par: Fujii, Kazuki, et autres
Publié: (2024)
Building a Large Japanese Web Corpus for Large Language Models
par: Okazaki, Naoaki, et autres
Publié: (2024)
par: Okazaki, Naoaki, et autres
Publié: (2024)
JUBAKU: An Adversarial Benchmark for Exposing Culturally Grounded Stereotypes in Japanese LLMs
par: Shiotani, Taihei, et autres
Publié: (2026)
par: Shiotani, Taihei, et autres
Publié: (2026)
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
par: Ichinose, Tatsuya, et autres
Publié: (2026)
par: Ichinose, Tatsuya, et autres
Publié: (2026)
A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory
par: Shiotani, Taihei, et autres
Publié: (2026)
par: Shiotani, Taihei, et autres
Publié: (2026)
From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models
par: Ma, Youmi, et autres
Publié: (2026)
par: Ma, Youmi, et autres
Publié: (2026)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
par: Ohi, Masanari, et autres
Publié: (2024)
par: Ohi, Masanari, et autres
Publié: (2024)
Building a Japanese Document-Level Relation Extraction Dataset Assisted by Cross-Lingual Transfer
par: Ma, Youmi, et autres
Publié: (2024)
par: Ma, Youmi, et autres
Publié: (2024)
QuantumBench: A Benchmark for Quantum Problem Solving
par: Minami, Shunya, et autres
Publié: (2025)
par: Minami, Shunya, et autres
Publié: (2025)
JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding
par: Maeda, Koki, et autres
Publié: (2026)
par: Maeda, Koki, et autres
Publié: (2026)
Sampling-based Pseudo-Likelihood for Membership Inference Attacks
par: Kaneko, Masahiro, et autres
Publié: (2024)
par: Kaneko, Masahiro, et autres
Publié: (2024)
LLM Output Detectability and Task Performance Can be Jointly Optimized
par: Saito, Koshiro, et autres
Publié: (2026)
par: Saito, Koshiro, et autres
Publié: (2026)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
par: Oi, Masanari, et autres
Publié: (2026)
par: Oi, Masanari, et autres
Publié: (2026)
How You Prompt Matters! Even Task-Oriented Constraints in Instructions Affect LLM-Generated Text Detection
par: Koike, Ryuto, et autres
Publié: (2023)
par: Koike, Ryuto, et autres
Publié: (2023)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
par: Nishimura, Yuto, et autres
Publié: (2024)
par: Nishimura, Yuto, et autres
Publié: (2024)
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks
par: Inoue, Nakamasa, et autres
Publié: (2024)
par: Inoue, Nakamasa, et autres
Publié: (2024)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
par: Oi, Masanari, et autres
Publié: (2024)
par: Oi, Masanari, et autres
Publié: (2024)
Autoregressive Direct Preference Optimization
par: Oi, Masanari, et autres
Publié: (2026)
par: Oi, Masanari, et autres
Publié: (2026)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
par: Maeda, Koki, et autres
Publié: (2024)
par: Maeda, Koki, et autres
Publié: (2024)
Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
par: Nakamura, Taishi, et autres
Publié: (2025)
par: Nakamura, Taishi, et autres
Publié: (2025)
Is This Letter Truly Human‐Written?
par: Shigeki Matsubara
Publié: (2025)
par: Shigeki Matsubara
Publié: (2025)
Knowledge of Pretrained Language Models on Surface Information of Tokens
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
par: Hiraoka, Tatsuya, et autres
Publié: (2024)
Tokenization as Finite-State Transduction
par: Cognetta, Marco, et autres
Publié: (2024)
par: Cognetta, Marco, et autres
Publié: (2024)
Agent AI for Finance
par: Chen, Chung-Chi, et autres
Publié: (2025)
par: Chen, Chung-Chi, et autres
Publié: (2025)
Human Touch in Writing: What Distinguishes Human‐ and Artificial Intelligence‐Written Manuscripts?
par: Shigeki Matsubara
Publié: (2025)
par: Shigeki Matsubara
Publié: (2025)
Fermionic theory of nonequilibrium steady states
par: De Giuli, Eric, et autres
Publié: (2023)
par: De Giuli, Eric, et autres
Publié: (2023)
Statistical mechanics of fluids with hidden degrees of freedom
par: Shimada, Masanari, et autres
Publié: (2025)
par: Shimada, Masanari, et autres
Publié: (2025)
Bose glass in Ca$_2$RuO$_4$ nanofilms
par: Nobukane, Hiroyoshi, et autres
Publié: (2025)
par: Nobukane, Hiroyoshi, et autres
Publié: (2025)
Prompting for Numerical Sequences: A Case Study on Market Comment Generation
par: Kawarada, Masayuki, et autres
Publié: (2024)
par: Kawarada, Masayuki, et autres
Publié: (2024)
Multimodal Task Interference: A Benchmark and Analysis of History-Target Mismatch in Multimodal LLMs
par: Kawarada, Masayuki, et autres
Publié: (2026)
par: Kawarada, Masayuki, et autres
Publié: (2026)
On the Optimal Reasoning Length for RL-Trained Language Models
par: Nohara, Daisuke, et autres
Publié: (2026)
par: Nohara, Daisuke, et autres
Publié: (2026)
Balancing Speed and Stability: The Trade-offs of FP8 vs. BF16 Training in LLMs
par: Fujii, Kazuki, et autres
Publié: (2024)
par: Fujii, Kazuki, et autres
Publié: (2024)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
par: Sugiura, Issa, et autres
Publié: (2026)
par: Sugiura, Issa, et autres
Publié: (2026)
Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language Model
par: Sasagawa, Keito, et autres
Publié: (2024)
par: Sasagawa, Keito, et autres
Publié: (2024)
The Limit Sets of Linear and Nonlinear Infinite IFSs Related to Complex Continued Fractions
par: Okamoto, Takumi
Publié: (2026)
par: Okamoto, Takumi
Publié: (2026)
Adolescent Self‐Inserted Rectal Foreign Body Removed Manually With Topical Anesthetic Only
par: Takuto Shimada, et autres
Publié: (2026)
par: Takuto Shimada, et autres
Publié: (2026)
Bit-level BPE: Below the byte boundary
par: Moon, Sangwhan, et autres
Publié: (2025)
par: Moon, Sangwhan, et autres
Publié: (2025)
Drifting Objectives for Refining Discrete Diffusion Language Models
par: Oba, Daisuke, et autres
Publié: (2026)
par: Oba, Daisuke, et autres
Publié: (2026)
Documents similaires
-
Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs
par: Saito, Koshiro, et autres
Publié: (2024) -
Rewriting Pre-Training Data Boosts LLM Performance in Math and Code
par: Fujii, Kazuki, et autres
Publié: (2025) -
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
par: Fujii, Kazuki, et autres
Publié: (2024) -
Building a Large Japanese Web Corpus for Large Language Models
par: Okazaki, Naoaki, et autres
Publié: (2024) -
JUBAKU: An Adversarial Benchmark for Exposing Culturally Grounded Stereotypes in Japanese LLMs
par: Shiotani, Taihei, et autres
Publié: (2026)