Rakuten Data Release: A Large-Scale and Long-Term Reviews Corpus for Hotel Domain
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Nakayama, Yuki, Hikichi, Koki, Liu, Yun Ching, Hirate, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
RakutenAI-7B: Extending Large Language Models for Japanese
von: Rakuten Group, et al.
Veröffentlicht: (2024)
von: Rakuten Group, et al.
Veröffentlicht: (2024)
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
von: Sugiura, Issa, et al.
Veröffentlicht: (2025)
von: Sugiura, Issa, et al.
Veröffentlicht: (2025)
DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
von: Cruz, Walter Hernandez, et al.
Veröffentlicht: (2026)
von: Cruz, Walter Hernandez, et al.
Veröffentlicht: (2026)
A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews
von: Achkar, Pierre, et al.
Veröffentlicht: (2026)
von: Achkar, Pierre, et al.
Veröffentlicht: (2026)
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
von: Tanzer, Garrett, et al.
Veröffentlicht: (2024)
von: Tanzer, Garrett, et al.
Veröffentlicht: (2024)
Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning
von: Kopiczko, Dawid J., et al.
Veröffentlicht: (2026)
von: Kopiczko, Dawid J., et al.
Veröffentlicht: (2026)
KwaiChat: A Large-Scale Video-Driven Multilingual Mixed-Type Dialogue Corpus
von: Shi, Xiaoming, et al.
Veröffentlicht: (2025)
von: Shi, Xiaoming, et al.
Veröffentlicht: (2025)
Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts
von: Song, Seyoung, et al.
Veröffentlicht: (2025)
von: Song, Seyoung, et al.
Veröffentlicht: (2025)
C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models
von: Wu, Ping, et al.
Veröffentlicht: (2025)
von: Wu, Ping, et al.
Veröffentlicht: (2025)
Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data
von: Yoshida, Yura, et al.
Veröffentlicht: (2026)
von: Yoshida, Yura, et al.
Veröffentlicht: (2026)
CoastTerm: a Corpus for Multidisciplinary Term Extraction in Coastal Scientific Literature
von: Delaunay, Julien, et al.
Veröffentlicht: (2024)
von: Delaunay, Julien, et al.
Veröffentlicht: (2024)
CATs are Fuzzy PETs: A Corpus and Analysis of Potentially Euphemistic Terms
von: Gavidia, Martha, et al.
Veröffentlicht: (2022)
von: Gavidia, Martha, et al.
Veröffentlicht: (2022)
Automatic Construction of a Large-Scale Corpus for Geoparsing Using Wikipedia Hyperlinks
von: Ohno, Keyaki, et al.
Veröffentlicht: (2024)
von: Ohno, Keyaki, et al.
Veröffentlicht: (2024)
Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents
von: Yu, Yi, et al.
Veröffentlicht: (2026)
von: Yu, Yi, et al.
Veröffentlicht: (2026)
JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus
von: Nagata, Masaaki, et al.
Veröffentlicht: (2025)
von: Nagata, Masaaki, et al.
Veröffentlicht: (2025)
Matina: A Large-Scale 73B Token Persian Text Corpus
von: Hosseinbeigi, Sara Bourbour, et al.
Veröffentlicht: (2025)
von: Hosseinbeigi, Sara Bourbour, et al.
Veröffentlicht: (2025)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
von: Ko, Ching-Yun, et al.
Veröffentlicht: (2026)
von: Ko, Ching-Yun, et al.
Veröffentlicht: (2026)
LAMUS: A Large-Scale Corpus for Legal Argument Mining from U.S. Caselaw using LLMs
von: Wang, Serene, et al.
Veröffentlicht: (2026)
von: Wang, Serene, et al.
Veröffentlicht: (2026)
Enhancing Rating Prediction with Off-the-Shelf LLMs Using In-Context User Reviews
von: Ryu, Koki, et al.
Veröffentlicht: (2025)
von: Ryu, Koki, et al.
Veröffentlicht: (2025)
HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models
von: Gutiérrez, Bernal Jiménez, et al.
Veröffentlicht: (2024)
von: Gutiérrez, Bernal Jiménez, et al.
Veröffentlicht: (2024)
The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs
von: Dekoninck, Jasper, et al.
Veröffentlicht: (2025)
von: Dekoninck, Jasper, et al.
Veröffentlicht: (2025)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
von: Mutisya, Hillary, et al.
Veröffentlicht: (2026)
von: Mutisya, Hillary, et al.
Veröffentlicht: (2026)
Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models
von: Chen, Longze, et al.
Veröffentlicht: (2024)
von: Chen, Longze, et al.
Veröffentlicht: (2024)
CEO: Corpus-based Open-Domain Event Ontology Induction
von: Xu, Nan, et al.
Veröffentlicht: (2023)
von: Xu, Nan, et al.
Veröffentlicht: (2023)
LongMemEval: Benchmarking Chat Assistants on Long-Term Interactive Memory
von: Wu, Di, et al.
Veröffentlicht: (2024)
von: Wu, Di, et al.
Veröffentlicht: (2024)
Leveraging the Cross-Domain & Cross-Linguistic Corpus for Low Resource NMT: A Case Study On Bhili-Hindi-English Parallel Corpus
von: Singh, Pooja, et al.
Veröffentlicht: (2025)
von: Singh, Pooja, et al.
Veröffentlicht: (2025)
Data Augmentation for Fake Reviews Detection in Multiple Languages and Multiple Domains
von: Liu, Ming, et al.
Veröffentlicht: (2025)
von: Liu, Ming, et al.
Veröffentlicht: (2025)
WenetSpeech-Chuan: A Large-Scale Sichuanese Corpus with Rich Annotation for Dialectal Speech Processing
von: Dai, Yuhang, et al.
Veröffentlicht: (2025)
von: Dai, Yuhang, et al.
Veröffentlicht: (2025)
WAXAL: A Large-Scale Multilingual African Language Speech Corpus
von: Diack, Abdoulaye, et al.
Veröffentlicht: (2026)
von: Diack, Abdoulaye, et al.
Veröffentlicht: (2026)
Enhancing Voice Wake-Up for Dysarthria: Mandarin Dysarthria Speech Corpus Release and Customized System Design
von: Gao, Ming, et al.
Veröffentlicht: (2024)
von: Gao, Ming, et al.
Veröffentlicht: (2024)
BaiJia: A Large-Scale Role-Playing Agent Corpus of Chinese Historical Characters
von: Bai, Ting, et al.
Veröffentlicht: (2024)
von: Bai, Ting, et al.
Veröffentlicht: (2024)
ArabDiscrim: A Decade-Long Arabic Facebook Corpus on Racism and Discrimination
von: Zaghouani, Wajdi, et al.
Veröffentlicht: (2026)
von: Zaghouani, Wajdi, et al.
Veröffentlicht: (2026)
Corpus-Steered Query Expansion with Large Language Models
von: Lei, Yibin, et al.
Veröffentlicht: (2024)
von: Lei, Yibin, et al.
Veröffentlicht: (2024)
WildLong: Synthesizing Realistic Long-Context Instruction Data at Scale
von: Li, Jiaxi, et al.
Veröffentlicht: (2025)
von: Li, Jiaxi, et al.
Veröffentlicht: (2025)
Analyzing Consumer Reviews for Understanding Drivers of Hotels Ratings: An Indian Perspective
von: Dasgupta, Subhasis, et al.
Veröffentlicht: (2024)
von: Dasgupta, Subhasis, et al.
Veröffentlicht: (2024)
Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation
von: P, Akhil Rajeev, et al.
Veröffentlicht: (2026)
von: P, Akhil Rajeev, et al.
Veröffentlicht: (2026)
SHARE: Shared Memory-Aware Open-Domain Long-Term Dialogue Dataset Constructed from Movie Script
von: Kim, Eunwon, et al.
Veröffentlicht: (2024)
von: Kim, Eunwon, et al.
Veröffentlicht: (2024)
Cleaner Pretraining Corpus Curation with Neural Web Scraping
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
von: Xu, Zhipeng, et al.
Veröffentlicht: (2024)
Cross-Lingual SynthDocs: A Large-Scale Synthetic Corpus for Any to Arabic OCR and Document Understanding
von: Al-Homoud, Haneen, et al.
Veröffentlicht: (2025)
von: Al-Homoud, Haneen, et al.
Veröffentlicht: (2025)
J-CHAT: Japanese Large-scale Spoken Dialogue Corpus for Spoken Dialogue Language Modeling
von: Nakata, Wataru, et al.
Veröffentlicht: (2024)
von: Nakata, Wataru, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
RakutenAI-7B: Extending Large Language Models for Japanese
von: Rakuten Group, et al.
Veröffentlicht: (2024) -
llm-jp-modernbert: A ModernBERT Model Trained on a Large-Scale Japanese Corpus with Long Context Length
von: Sugiura, Issa, et al.
Veröffentlicht: (2025) -
DLT-Corpus: A Large-Scale Text Collection for the Distributed Ledger Technology Domain
von: Cruz, Walter Hernandez, et al.
Veröffentlicht: (2026) -
A Large-Scale, Cross-Disciplinary Corpus of Systematic Reviews
von: Achkar, Pierre, et al.
Veröffentlicht: (2026) -
YouTube-SL-25: A Large-Scale, Open-Domain Multilingual Sign Language Parallel Corpus
von: Tanzer, Garrett, et al.
Veröffentlicht: (2024)