A Japanese-Chinese Parallel Corpus Using Crowdsourcing for Web Mining
Fuente:
arXiv
Saved in:
| Main Authors: | Nagata, Masaaki, Morishita, Makoto, Chousa, Katsuki, Yasuda, Norihito |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus
by: Nagata, Masaaki, et al.
Published: (2025)
by: Nagata, Masaaki, et al.
Published: (2025)
WikiSplit++: Easy Data Refinement for Split and Rephrase
by: Tsukagoshi, Hayato, et al.
Published: (2024)
by: Tsukagoshi, Hayato, et al.
Published: (2024)
Hacking Neural Evaluation Metrics with Single Hub Text
by: Deguchi, Hiroyuki, et al.
Published: (2025)
by: Deguchi, Hiroyuki, et al.
Published: (2025)
One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness
by: Deguchi, Hiroyuki, et al.
Published: (2026)
by: Deguchi, Hiroyuki, et al.
Published: (2026)
Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge
by: Wu, Xuanxin, et al.
Published: (2025)
by: Wu, Xuanxin, et al.
Published: (2025)
Enhancing Translation Accuracy of Large Language Models through Continual Pre-Training on Parallel Data
by: Kondo, Minato, et al.
Published: (2024)
by: Kondo, Minato, et al.
Published: (2024)
Argument Mining as a Text-to-Text Generation Task
by: Kawarada, Masayuki, et al.
Published: (2026)
by: Kawarada, Masayuki, et al.
Published: (2026)
Case-Based Decision-Theoretic Decoding with Quality Memories
by: Deguchi, Hiroyuki, et al.
Published: (2025)
by: Deguchi, Hiroyuki, et al.
Published: (2025)
CADEL: A Corpus of Administrative Web Documents for Japanese Entity Linking
by: Higashiyama, Shohei, et al.
Published: (2026)
by: Higashiyama, Shohei, et al.
Published: (2026)
SYNTHEMPATHY: A Scalable Empathy Corpus Generated Using LLMs Without Any Crowdsourcing
by: Chen, Run, et al.
Published: (2025)
by: Chen, Run, et al.
Published: (2025)
Building a Large Japanese Web Corpus for Large Language Models
by: Okazaki, Naoaki, et al.
Published: (2024)
by: Okazaki, Naoaki, et al.
Published: (2024)
BiMax: Bidirectional MaxSim Score for Document-Level Alignment
by: Wang, Xiaotian, et al.
Published: (2025)
by: Wang, Xiaotian, et al.
Published: (2025)
Quality Does Matter: A Detailed Look at the Quality and Utility of Web-Mined Parallel Corpora
by: Ranathunga, Surangika, et al.
Published: (2024)
by: Ranathunga, Surangika, et al.
Published: (2024)
FFN: a Fine-grained Chinese-English Financial Domain Parallel Corpus
by: Fu, Yuxin, et al.
Published: (2024)
by: Fu, Yuxin, et al.
Published: (2024)
Refactoring Programs Using Large Language Models with Few-Shot Examples
by: Shirafuji, Atsushi, et al.
Published: (2023)
by: Shirafuji, Atsushi, et al.
Published: (2023)
Mining Word Boundaries from Speech-Text Parallel Data for Cross-domain Chinese Word Segmentation
by: Wang, Xuebin, et al.
Published: (2024)
by: Wang, Xuebin, et al.
Published: (2024)
Generating Diverse Translation with Perturbed kNN-MT
by: Nishida, Yuto, et al.
Published: (2024)
by: Nishida, Yuto, et al.
Published: (2024)
A Topic-aware Comparable Corpus of Chinese Variations
by: Lian, Da-Chen, et al.
Published: (2024)
by: Lian, Da-Chen, et al.
Published: (2024)
Word Alignment as Preference for Machine Translation
by: Wu, Qiyu, et al.
Published: (2024)
by: Wu, Qiyu, et al.
Published: (2024)
NeoAMT: Neologism-Aware Agentic Machine Translation with Reinforcement Learning
by: Miao, Zhongtao, et al.
Published: (2026)
by: Miao, Zhongtao, et al.
Published: (2026)
Feriji: A French-Zarma Parallel Corpus, Glossary & Translator
by: Keita, Mamadou K., et al.
Published: (2024)
by: Keita, Mamadou K., et al.
Published: (2024)
TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks
by: Fujii, Ryo, et al.
Published: (2026)
by: Fujii, Ryo, et al.
Published: (2026)
An Experimental Evaluation of Japanese Tokenizers for Sentiment-Based Text Classification
by: Rusli, Andre, et al.
Published: (2024)
by: Rusli, Andre, et al.
Published: (2024)
Parallel Corpus Augmentation using Masked Language Models
by: Kumari, Vibhuti, et al.
Published: (2024)
by: Kumari, Vibhuti, et al.
Published: (2024)
PEACH: A sentence-aligned Parallel English-Arabic Corpus for Healthcare
by: Al-Sabbagh, Rania
Published: (2025)
by: Al-Sabbagh, Rania
Published: (2025)
Variance Computation for Weighted Model Counting with Knowledge Compilation Approach
by: Nakamura, Kengo, et al.
Published: (2026)
by: Nakamura, Kengo, et al.
Published: (2026)
NAIST-SIC-Aligned: an Aligned English-Japanese Simultaneous Interpretation Corpus
by: Zhao, Jinming, et al.
Published: (2023)
by: Zhao, Jinming, et al.
Published: (2023)
OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training
by: Yu, Yijiong, et al.
Published: (2025)
by: Yu, Yijiong, et al.
Published: (2025)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
by: Xu, Zhipeng, et al.
Published: (2024)
by: Xu, Zhipeng, et al.
Published: (2024)
MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan
by: Nehrdich, Sebastian, et al.
Published: (2026)
by: Nehrdich, Sebastian, et al.
Published: (2026)
KazParC: Kazakh Parallel Corpus for Machine Translation
by: Yeshpanov, Rustem, et al.
Published: (2024)
by: Yeshpanov, Rustem, et al.
Published: (2024)
EthioMT: Parallel Corpus for Low-resource Ethiopian Languages
by: Tonja, Atnafu Lambebo, et al.
Published: (2024)
by: Tonja, Atnafu Lambebo, et al.
Published: (2024)
MQM-Chat: Multidimensional Quality Metrics for Chat Translation
by: Li, Yunmeng, et al.
Published: (2024)
by: Li, Yunmeng, et al.
Published: (2024)
Simplifying Translations for Children: Iterative Simplification Considering Age of Acquisition with LLMs
by: Oshika, Masashi, et al.
Published: (2024)
by: Oshika, Masashi, et al.
Published: (2024)
Long-Tail Crisis in Nearest Neighbor Language Models
by: Nishida, Yuto, et al.
Published: (2025)
by: Nishida, Yuto, et al.
Published: (2025)
A Corpus for Named Entity Recognition in Chinese Novels with Multi-genres
by: Zhao, Hanjie, et al.
Published: (2023)
by: Zhao, Hanjie, et al.
Published: (2023)
CHisIEC: An Information Extraction Corpus for Ancient Chinese History
by: Tang, Xuemei, et al.
Published: (2024)
by: Tang, Xuemei, et al.
Published: (2024)
An Analysis on Automated Metrics for Evaluating Japanese-English Chat Translation
by: Rusli, Andre, et al.
Published: (2024)
by: Rusli, Andre, et al.
Published: (2024)
Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
by: Singh, Pooja, et al.
Published: (2025)
by: Singh, Pooja, et al.
Published: (2025)
VivesDebate-Speech: A Corpus of Spoken Argumentation to Leverage Audio Features for Argument Mining
by: Ruiz-Dolz, Ramon, et al.
Published: (2023)
by: Ruiz-Dolz, Ramon, et al.
Published: (2023)
Similar Items
-
JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus
by: Nagata, Masaaki, et al.
Published: (2025) -
WikiSplit++: Easy Data Refinement for Split and Rephrase
by: Tsukagoshi, Hayato, et al.
Published: (2024) -
Hacking Neural Evaluation Metrics with Single Hub Text
by: Deguchi, Hiroyuki, et al.
Published: (2025) -
One Single Hub Text Breaks CLIP: Identifying Vulnerabilities in Cross-Modal Encoders via Hubness
by: Deguchi, Hiroyuki, et al.
Published: (2026) -
Policy-based Sentence Simplification: Replacing Parallel Corpora with LLM-as-a-Judge
by: Wu, Xuanxin, et al.
Published: (2025)