Building a Large Japanese Web Corpus for Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Okazaki, Naoaki, Hattori, Kakeru, Shota, Hirai, Iida, Hiroki, Ohi, Masanari, Fujii, Kazuki, Nakamura, Taishi, Loem, Mengsay, Yokota, Rio, Mizuki, Sakae |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs
di: Saito, Koshiro, et al.
Pubblicazione: (2024)
di: Saito, Koshiro, et al.
Pubblicazione: (2024)
Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models
di: Ma, Youmi, et al.
Pubblicazione: (2025)
di: Ma, Youmi, et al.
Pubblicazione: (2025)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)
di: Oi, Masanari, et al.
Pubblicazione: (2024)
SAIE Framework: Support Alone Isn't Enough -- Advancing LLM Training with Adversarial Remarks
di: Loem, Mengsay, et al.
Pubblicazione: (2023)
di: Loem, Mengsay, et al.
Pubblicazione: (2023)
Balancing Speed and Stability: The Trade-offs of FP8 vs. BF16 Training in LLMs
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
Rewriting Pre-Training Data Boosts LLM Performance in Math and Code
di: Fujii, Kazuki, et al.
Pubblicazione: (2025)
di: Fujii, Kazuki, et al.
Pubblicazione: (2025)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
Joint Extraction Matters: Prompt-Based Visual Question Answering for Multi-Field Document Information Extraction
di: Loem, Mengsay, et al.
Pubblicazione: (2025)
di: Loem, Mengsay, et al.
Pubblicazione: (2025)
Contrasting Cognitive Styles in Vision-Language Models: Holistic Attention in Japanese Versus Analytical Focus in English
di: Sabir, Ahmed, et al.
Pubblicazione: (2025)
di: Sabir, Ahmed, et al.
Pubblicazione: (2025)
JUBAKU: An Adversarial Benchmark for Exposing Culturally Grounded Stereotypes in Japanese LLMs
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
Accelerating Large Language Model Training with 4D Parallelism and Memory Consumption Estimator
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
di: Fujii, Kazuki, et al.
Pubblicazione: (2024)
Drop-Upcycling: Training Sparse Mixture of Experts with Partial Re-initialization
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
On the Optimal Reasoning Length for RL-Trained Language Models
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
di: Nohara, Daisuke, et al.
Pubblicazione: (2026)
Building a Japanese Document-Level Relation Extraction Dataset Assisted by Cross-Lingual Transfer
di: Ma, Youmi, et al.
Pubblicazione: (2024)
di: Ma, Youmi, et al.
Pubblicazione: (2024)
JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding
di: Maeda, Koki, et al.
Pubblicazione: (2026)
di: Maeda, Koki, et al.
Pubblicazione: (2026)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2026)
di: Oi, Masanari, et al.
Pubblicazione: (2026)
Drifting Objectives for Refining Discrete Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
Social Bias Evaluation for Large Language Models Requires Prompt Variations
di: Hida, Rem, et al.
Pubblicazione: (2024)
di: Hida, Rem, et al.
Pubblicazione: (2024)
Autoregressive Direct Preference Optimization
di: Oi, Masanari, et al.
Pubblicazione: (2026)
di: Oi, Masanari, et al.
Pubblicazione: (2026)
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
di: Sugiura, Issa, et al.
Pubblicazione: (2025)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models
di: Ma, Youmi, et al.
Pubblicazione: (2026)
di: Ma, Youmi, et al.
Pubblicazione: (2026)
Knowledge of Pretrained Language Models on Surface Information of Tokens
di: Hiraoka, Tatsuya, et al.
Pubblicazione: (2024)
di: Hiraoka, Tatsuya, et al.
Pubblicazione: (2024)
Tokenization as Finite-State Transduction
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
Optimal Sparsity of Mixture-of-Experts Language Models for Reasoning Tasks
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
di: Nakamura, Taishi, et al.
Pubblicazione: (2025)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
di: Sugiura, Issa, et al.
Pubblicazione: (2026)
Polarization‐Resolved Approach to the Origin of the Nonresonant Background in Coherent Anti‐Stokes Hyper‐Raman Scattering Spectroscopy
di: Kazuki Inoue, et al.
Pubblicazione: (2026)
di: Kazuki Inoue, et al.
Pubblicazione: (2026)
A fungal‐binding agglutinin in the skin slime of Japanese flounder (Paralichthys olivaceus) is glyceraldehyde 3‐phosphate dehydrogenase
di: Shigeyuki Tsutsui, et al.
Pubblicazione: (2024)
di: Shigeyuki Tsutsui, et al.
Pubblicazione: (2024)
Supercomputing Frontiers 4th Asian Conference, SCFA 2018, Singapore, March 26-29, 2018, Proceedings
di: Rio Yokota
di: Rio Yokota
LCTG Bench: LLM Controlled Text Generation Benchmark
di: Kurihara, Kentaro, et al.
Pubblicazione: (2025)
di: Kurihara, Kentaro, et al.
Pubblicazione: (2025)
Constructing Multimodal Datasets from Scratch for Rapid Development of a Japanese Visual Language Model
di: Sasagawa, Keito, et al.
Pubblicazione: (2024)
di: Sasagawa, Keito, et al.
Pubblicazione: (2024)
HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis
di: Nishimura, Yuto, et al.
Pubblicazione: (2024)
di: Nishimura, Yuto, et al.
Pubblicazione: (2024)
ELP-Adapters: Parameter Efficient Adapter Tuning for Various Speech Processing Tasks
di: Inoue, Nakamasa, et al.
Pubblicazione: (2024)
di: Inoue, Nakamasa, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Continual Pre-Training for Cross-Lingual LLM Adaptation: Enhancing Japanese Language Capabilities
di: Fujii, Kazuki, et al.
Pubblicazione: (2024) -
Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs
di: Saito, Koshiro, et al.
Pubblicazione: (2024) -
Building Instruction-Tuning Datasets from Human-Written Instructions with Open-Weight Large Language Models
di: Ma, Youmi, et al.
Pubblicazione: (2025) -
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024) -
SAIE Framework: Support Alone Isn't Enough -- Advancing LLM Training with Adversarial Remarks
di: Loem, Mengsay, et al.
Pubblicazione: (2023)