I run as fast as a rabbit, can you? A Multilingual Simile Dialogue Dataset
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ma, Longxuan, Zhang, Weinan, Zhou, Shuhan, Sun, Churui, Ke, Changxin, Liu, Ting |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Unstructured Text Enhanced Open-domain Dialogue System: A Systematic Survey
par: Ma, Longxuan, et autres
Publié: (2024)
par: Ma, Longxuan, et autres
Publié: (2024)
Policy-driven Knowledge Selection and Response Generation for Document-grounded Dialogue
par: Ma, Longxuan, et autres
Publié: (2024)
par: Ma, Longxuan, et autres
Publié: (2024)
DimStance: Multilingual Datasets for Dimensional Stance Analysis
par: Becker, Jonas, et autres
Publié: (2026)
par: Becker, Jonas, et autres
Publié: (2026)
Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
par: Tian, Changxin, et autres
Publié: (2025)
par: Tian, Changxin, et autres
Publié: (2025)
ML-Promise: A Multilingual Dataset for Corporate Promise Verification
par: Seki, Yohei, et autres
Publié: (2024)
par: Seki, Yohei, et autres
Publié: (2024)
DimABSA: Building Multilingual and Multidomain Datasets for Dimensional Aspect-Based Sentiment Analysis
par: Lee, Lung-Hao, et autres
Publié: (2026)
par: Lee, Lung-Hao, et autres
Publié: (2026)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
2M-BELEBELE: Highly Multilingual Speech and American Sign Language Comprehension Dataset
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
Exploring the Maze of Multilingual Modeling
par: Nezhad, Sina Bagheri, et autres
Publié: (2023)
par: Nezhad, Sina Bagheri, et autres
Publié: (2023)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
Towards Massive Multilingual Holistic Bias
par: Tan, Xiaoqing Ellen, et autres
Publié: (2024)
par: Tan, Xiaoqing Ellen, et autres
Publié: (2024)
LUCID: LLM-Generated Utterances for Complex and Interesting Dialogues
par: Stacey, Joe, et autres
Publié: (2024)
par: Stacey, Joe, et autres
Publié: (2024)
LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation
par: Yuan, Weikang, et autres
Publié: (2025)
par: Yuan, Weikang, et autres
Publié: (2025)
What Drives Performance in Multilingual Language Models?
par: Nezhad, Sina Bagheri, et autres
Publié: (2024)
par: Nezhad, Sina Bagheri, et autres
Publié: (2024)
idT5: Indonesian Version of Multilingual T5 Transformer
par: Fuadi, Mukhlish, et autres
Publié: (2023)
par: Fuadi, Mukhlish, et autres
Publié: (2023)
Ensembling Multilingual Transformers for Robust Sentiment Analysis of Tweets
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2025)
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2025)
Socially Responsible Data for Large Multilingual Language Models
par: Smart, Andrew, et autres
Publié: (2024)
par: Smart, Andrew, et autres
Publié: (2024)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Adapting Multilingual Models to Code-Mixed Tasks via Model Merging
par: Kodali, Prashant, et autres
Publié: (2025)
par: Kodali, Prashant, et autres
Publié: (2025)
Boosting Accuracy and Interpretability in Multilingual Hate Speech Detection Through Layer Freezing and Explainable AI
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2026)
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2026)
Tokenization and Morphology in Multilingual Language Models: A Comparative Analysis of mT5 and ByT5
par: Dang, Thao Anh, et autres
Publié: (2024)
par: Dang, Thao Anh, et autres
Publié: (2024)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
"AGI" team at SHROOM-CAP: Data-Centric Approach to Multilingual Hallucination Detection using XLM-RoBERTa
par: Rathva, Harsh, et autres
Publié: (2025)
par: Rathva, Harsh, et autres
Publié: (2025)
Locations of Characters in Narratives: Andersen and Persuasion Datasets
par: Ozyurt, Batuhan, et autres
Publié: (2025)
par: Ozyurt, Batuhan, et autres
Publié: (2025)
Predictive Simultaneous Interpretation: Harnessing Large Language Models for Democratizing Real-Time Multilingual Communication
par: Iida, Kurando, et autres
Publié: (2024)
par: Iida, Kurando, et autres
Publié: (2024)
A Dataset for Metaphor Detection in Early Medieval Hebrew Poetry
par: Toker, Michael, et autres
Publié: (2024)
par: Toker, Michael, et autres
Publié: (2024)
PILA: A Historical-Linguistic Dataset of Proto-Italic and Latin
par: Bothwell, Stephen, et autres
Publié: (2024)
par: Bothwell, Stephen, et autres
Publié: (2024)
MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
par: Bouchekif, Abdessalam, et autres
Publié: (2026)
LCFO: Long Context and Long Form Output Dataset and Benchmarking
par: Costa-jussà, Marta R., et autres
Publié: (2024)
par: Costa-jussà, Marta R., et autres
Publié: (2024)
EMO-KNOW: A Large Scale Dataset on Emotion and Emotion-cause
par: Nguyen, Mia Huong, et autres
Publié: (2024)
par: Nguyen, Mia Huong, et autres
Publié: (2024)
Scaling Synthetic Logical Reasoning Datasets with Context-Sensitive Declarative Grammars
par: Sileo, Damien
Publié: (2024)
par: Sileo, Damien
Publié: (2024)
WSM: Decay-Free Learning Rate Schedule via Checkpoint Merging for LLM Pre-training
par: Tian, Changxin, et autres
Publié: (2025)
par: Tian, Changxin, et autres
Publié: (2025)
Blocks Architecture (BloArk): Efficient, Cost-Effective, and Incremental Dataset Architecture for Wikipedia Revision History
par: Li, Lingxi, et autres
Publié: (2024)
par: Li, Lingxi, et autres
Publié: (2024)
RTI-Bench: A Structured Dataset for Indian Right-to-Information Decision Analysis
par: Bose, Joy
Publié: (2026)
par: Bose, Joy
Publié: (2026)
IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following
par: Sun, Mingrui, et autres
Publié: (2026)
par: Sun, Mingrui, et autres
Publié: (2026)
Tracking Semantic Change in Slovene: A Novel Dataset and Optimal Transport-Based Distance
par: Pranjić, Marko, et autres
Publié: (2024)
par: Pranjić, Marko, et autres
Publié: (2024)
The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations
par: Lequeu, Pierre-Antoine, et autres
Publié: (2026)
par: Lequeu, Pierre-Antoine, et autres
Publié: (2026)
myNER: Contextualized Burmese Named Entity Recognition with Bidirectional LSTM and fastText Embeddings via Joint Training with POS Tagging
par: Thant, Kaung Lwin, et autres
Publié: (2025)
par: Thant, Kaung Lwin, et autres
Publié: (2025)
State space models can express n-gram languages
par: Nandakumar, Vinoth, et autres
Publié: (2023)
par: Nandakumar, Vinoth, et autres
Publié: (2023)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
Documents similaires
-
Unstructured Text Enhanced Open-domain Dialogue System: A Systematic Survey
par: Ma, Longxuan, et autres
Publié: (2024) -
Policy-driven Knowledge Selection and Response Generation for Document-grounded Dialogue
par: Ma, Longxuan, et autres
Publié: (2024) -
DimStance: Multilingual Datasets for Dimensional Stance Analysis
par: Becker, Jonas, et autres
Publié: (2026) -
Towards Greater Leverage: Scaling Laws for Efficient Mixture-of-Experts Language Models
par: Tian, Changxin, et autres
Publié: (2025) -
ML-Promise: A Multilingual Dataset for Corporate Promise Verification
par: Seki, Yohei, et autres
Publié: (2024)