Rakuten Data Release: A Large-Scale and Long-Term Reviews Corpus for Hotel Domain
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nakayama, Yuki, Hikichi, Koki, Liu, Yun Ching, Hirate, Yu |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
RakutenAI-7B: Extending Large Language Models for Japanese
par: Rakuten Group, et autres
Publié: (2024)
par: Rakuten Group, et autres
Publié: (2024)
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
par: Sugiura, Issa, et autres
Publié: (2025)
par: Sugiura, Issa, et autres
Publié: (2025)
DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
par: Cruz, Walter Hernandez, et autres
Publié: (2026)
par: Cruz, Walter Hernandez, et autres
Publié: (2026)
A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews
par: Achkar, Pierre, et autres
Publié: (2026)
par: Achkar, Pierre, et autres
Publié: (2026)
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
par: Tanzer, Garrett, et autres
Publié: (2024)
par: Tanzer, Garrett, et autres
Publié: (2024)
Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
par: Kopiczko, Dawid J., et autres
Publié: (2026)
par: Kopiczko, Dawid J., et autres
Publié: (2026)
KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus
par: Shi, Xiaoming, et autres
Publié: (2025)
par: Shi, Xiaoming, et autres
Publié: (2025)
Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts
par: Song, Seyoung, et autres
Publié: (2025)
par: Song, Seyoung, et autres
Publié: (2025)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
par: Wu, Ping, et autres
Publié: (2025)
par: Wu, Ping, et autres
Publié: (2025)
Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data
par: Yoshida, Yura, et autres
Publié: (2026)
par: Yoshida, Yura, et autres
Publié: (2026)
CoastTerm: a Corpus for Multidisciplinary Term Extraction in Coastal Scientific Literature
par: Delaunay, Julien, et autres
Publié: (2024)
par: Delaunay, Julien, et autres
Publié: (2024)
CATs are Fuzzy PETs: A Corpus and Analysis of Potentially Euphemistic Terms
par: Gavidia, Martha, et autres
Publié: (2022)
par: Gavidia, Martha, et autres
Publié: (2022)
Automatic Construction of a Large-Scale Corpus for Geoparsing Using Wikipedia Hyperlinks
par: Ohno, Keyaki, et autres
Publié: (2024)
par: Ohno, Keyaki, et autres
Publié: (2024)
Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
par: Yu, Yi, et autres
Publié: (2026)
par: Yu, Yi, et autres
Publié: (2026)
JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus
par: Nagata, Masaaki, et autres
Publié: (2025)
par: Nagata, Masaaki, et autres
Publié: (2025)
Matina: A Large-Scale 73B Token Persian Text Corpus
par: Hosseinbeigi, Sara Bourbour, et autres
Publié: (2025)
par: Hosseinbeigi, Sara Bourbour, et autres
Publié: (2025)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
par: Ko, Ching-Yun, et autres
Publié: (2026)
par: Ko, Ching-Yun, et autres
Publié: (2026)
LAMUS: A Large-Scale Corpus for Legal Argument Mining from U.S. Caselaw using LLMs
par: Wang, Serene, et autres
Publié: (2026)
par: Wang, Serene, et autres
Publié: (2026)
Enhancing Rating Prediction with Off-the-Shelf LLMs Using In-Context User Reviews
par: Ryu, Koki, et autres
Publié: (2025)
par: Ryu, Koki, et autres
Publié: (2025)
HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
par: Gutiérrez, Bernal Jiménez, et autres
Publié: (2024)
par: Gutiérrez, Bernal Jiménez, et autres
Publié: (2024)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
par: Dekoninck, Jasper, et autres
Publié: (2025)
par: Dekoninck, Jasper, et autres
Publié: (2025)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models
par: Chen, Longze, et autres
Publié: (2024)
par: Chen, Longze, et autres
Publié: (2024)
CEO: Corpus-based Open-Domain Event Ontology Induction
par: Xu, Nan, et autres
Publié: (2023)
par: Xu, Nan, et autres
Publié: (2023)
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
par: Wu, Di, et autres
Publié: (2024)
par: Wu, Di, et autres
Publié: (2024)
Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
par: Singh, Pooja, et autres
Publié: (2025)
par: Singh, Pooja, et autres
Publié: (2025)
Data Augmentation for Fake Reviews Detection in Multiple Languages and Multiple Domains
par: Liu, Ming, et autres
Publié: (2025)
par: Liu, Ming, et autres
Publié: (2025)
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
par: Dai, Yuhang, et autres
Publié: (2025)
par: Dai, Yuhang, et autres
Publié: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
par: Diack, Abdoulaye, et autres
Publié: (2026)
par: Diack, Abdoulaye, et autres
Publié: (2026)
Enhancing Voice Wake-Up for Dysarthria: Mandarin Dysarthria Speech Corpus Release and Customized System Design
par: Gao, Ming, et autres
Publié: (2024)
par: Gao, Ming, et autres
Publié: (2024)
BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters
par: Bai, Ting, et autres
Publié: (2024)
par: Bai, Ting, et autres
Publié: (2024)
ArabDiscrim: A Decade-Long Arabic Facebook Corpus on Racism and Discrimination
par: Zaghouani, Wajdi, et autres
Publié: (2026)
par: Zaghouani, Wajdi, et autres
Publié: (2026)
Corpus-Steered Query Expansion with Large Language Models
par: Lei, Yibin, et autres
Publié: (2024)
par: Lei, Yibin, et autres
Publié: (2024)
WildLong: Synthesizing Realistic Long-Context Instruction Data at Scale
par: Li, Jiaxi, et autres
Publié: (2025)
par: Li, Jiaxi, et autres
Publié: (2025)
Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
par: P, Akhil Rajeev, et autres
Publié: (2026)
par: P, Akhil Rajeev, et autres
Publié: (2026)
Analyzing Consumer Reviews for Understanding Drivers of Hotels Ratings: An Indian Perspective
par: Dasgupta, Subhasis, et autres
Publié: (2024)
par: Dasgupta, Subhasis, et autres
Publié: (2024)
SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie Script
par: Kim, Eunwon, et autres
Publié: (2024)
par: Kim, Eunwon, et autres
Publié: (2024)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
par: Xu, Zhipeng, et autres
Publié: (2024)
par: Xu, Zhipeng, et autres
Publié: (2024)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
par: Al-Homoud, Haneen, et autres
Publié: (2025)
par: Al-Homoud, Haneen, et autres
Publié: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
par: Nakata, Wataru, et autres
Publié: (2024)
par: Nakata, Wataru, et autres
Publié: (2024)
Documents similaires
-
RakutenAI-7B: Extending Large Language Models for Japanese
par: Rakuten Group, et autres
Publié: (2024) -
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
par: Sugiura, Issa, et autres
Publié: (2025) -
DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
par: Cruz, Walter Hernandez, et autres
Publié: (2026) -
A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews
par: Achkar, Pierre, et autres
Publié: (2026) -
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
par: Tanzer, Garrett, et autres
Publié: (2024)