Enregistré dans:
| Auteurs principaux: | Cao, Renjie, Hu, Miaoyan, Wei, Jiahan, Ihnaini, Baha |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.09612 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
The Moral Foundations Reddit Corpus
par: Trager, Jackson, et autres
Publié: (2022)
par: Trager, Jackson, et autres
Publié: (2022)
On the Convergence of Moral Self-Correction in Large Language Models
par: Liu, Guangliang, et autres
Publié: (2025)
par: Liu, Guangliang, et autres
Publié: (2025)
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
par: Feng, Zhaopeng, et autres
Publié: (2025)
par: Feng, Zhaopeng, et autres
Publié: (2025)
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
par: Feng, Zhaopeng, et autres
Publié: (2025)
par: Feng, Zhaopeng, et autres
Publié: (2025)
EuroSpeech: A Multilingual Speech Corpus
par: Pfisterer, Samuel, et autres
Publié: (2025)
par: Pfisterer, Samuel, et autres
Publié: (2025)
Determinants of Training Corpus Size for Clinical Text Classification
par: Chaturvedi, Jaya, et autres
Publié: (2026)
par: Chaturvedi, Jaya, et autres
Publié: (2026)
OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models
par: Xue, Yida, et autres
Publié: (2026)
par: Xue, Yida, et autres
Publié: (2026)
MONOVAB : An Annotated Corpus for Bangla Multi-label Emotion Detection
par: Banshal, Sumit Kumar, et autres
Publié: (2023)
par: Banshal, Sumit Kumar, et autres
Publié: (2023)
GeneMamba: An Efficient and Effective Foundation Model on Single Cell Data
par: Qi, Cong, et autres
Publié: (2025)
par: Qi, Cong, et autres
Publié: (2025)
ANUBHUTI: A Comprehensive Corpus For Sentiment Analysis In Bangla Regional Languages
par: Kundu, Swastika, et autres
Publié: (2025)
par: Kundu, Swastika, et autres
Publié: (2025)
NSINA: A News Corpus for Sinhala
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
par: Hettiarachchi, Hansi, et autres
Publié: (2024)
HLDC: Hindi Legal Documents Corpus
par: Kapoor, Arnav, et autres
Publié: (2022)
par: Kapoor, Arnav, et autres
Publié: (2022)
BanglaSTEM: A Parallel Corpus for Technical Domain Bangla-English Translation
par: Hasan, Kazi Reyazul, et autres
Publié: (2025)
par: Hasan, Kazi Reyazul, et autres
Publié: (2025)
DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models
par: Thorat, Shantanu, et autres
Publié: (2025)
par: Thorat, Shantanu, et autres
Publié: (2025)
MahaParaphrase: A Marathi Paraphrase Detection Corpus and BERT-based Models
par: Jadhav, Suramya, et autres
Publié: (2025)
par: Jadhav, Suramya, et autres
Publié: (2025)
UPRPRC: Unified Pipeline for Reproducing Parallel Resources -- Corpus from the United Nations
par: Lu, Qiuyang, et autres
Publié: (2025)
par: Lu, Qiuyang, et autres
Publié: (2025)
Measuring Moral Inconsistencies in Large Language Models
par: Bonagiri, Vamshi Krishna, et autres
Publié: (2024)
par: Bonagiri, Vamshi Krishna, et autres
Publié: (2024)
The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages
par: Mutisya, Hillary, et autres
Publié: (2026)
par: Mutisya, Hillary, et autres
Publié: (2026)
Adapting Multilingual LLMs to Low-Resource Languages using Continued Pre-training and Synthetic Corpus
par: Joshi, Raviraj, et autres
Publié: (2024)
par: Joshi, Raviraj, et autres
Publié: (2024)
Investigating Affect Mining Techniques for Annotation Sample Selection in the Creation of Finnish Affective Speech Corpus
par: Lahtinen, Kalle, et autres
Publié: (2025)
par: Lahtinen, Kalle, et autres
Publié: (2025)
Cross-lingual Named Entity Corpus for Slavic Languages
par: Piskorski, Jakub, et autres
Publié: (2024)
par: Piskorski, Jakub, et autres
Publié: (2024)
Do Language Models Understand Morality? Towards a Robust Detection of Moral Content
par: Bulla, Luana, et autres
Publié: (2024)
par: Bulla, Luana, et autres
Publié: (2024)
FalAR: A Large-scale Speaker-Annotated European Portuguese Speech Corpus of Parliamentary Sessions
par: Teixeira, Francisco, et autres
Publié: (2026)
par: Teixeira, Francisco, et autres
Publié: (2026)
The Sparse Frontier: Sparse Attention Trade-offs in Transformer LLMs
par: Nawrot, Piotr, et autres
Publié: (2025)
par: Nawrot, Piotr, et autres
Publié: (2025)
BeliN: A Novel Corpus for Bengali Religious News Headline Generation using Contextual Feature Fusion
par: Osama, Md, et autres
Publié: (2025)
par: Osama, Md, et autres
Publié: (2025)
AlbNews: A Corpus of Headlines for Topic Modeling in Albanian
par: Çano, Erion, et autres
Publié: (2024)
par: Çano, Erion, et autres
Publié: (2024)
Representation Learning with Conditional Information Flow Maximization
par: Hu, Dou, et autres
Publié: (2024)
par: Hu, Dou, et autres
Publié: (2024)
A Hybrid Protocol for Large-Scale Semantic Dataset Generation in Low-Resource Languages: The Turkish Semantic Relations Corpus
par: Tosun, Ebubekir, et autres
Publié: (2026)
par: Tosun, Ebubekir, et autres
Publié: (2026)
VietMix: A Naturally-Occurring Parallel Corpus and Augmentation Framework for Vietnamese-English Code-Mixed Machine Translation
par: Tran, Hieu, et autres
Publié: (2025)
par: Tran, Hieu, et autres
Publié: (2025)
UQA: Corpus for Urdu Question Answering
par: Arif, Samee, et autres
Publié: (2024)
par: Arif, Samee, et autres
Publié: (2024)
Intelligent Go-Explore: Standing on the Shoulders of Giant Foundation Models
par: Lu, Cong, et autres
Publié: (2024)
par: Lu, Cong, et autres
Publié: (2024)
Automated Capability Discovery via Foundation Model Self-Exploration
par: Lu, Cong, et autres
Publié: (2025)
par: Lu, Cong, et autres
Publié: (2025)
MathPile: A Billion-Token-Scale Pretraining Corpus for Math
par: Wang, Zengzhi, et autres
Publié: (2023)
par: Wang, Zengzhi, et autres
Publié: (2023)
Retrieve, Then Classify: Corpus-Grounded Automation of Clinical Value Set Authoring
par: Mukherjee, Sumit, et autres
Publié: (2026)
par: Mukherjee, Sumit, et autres
Publié: (2026)
WorldSpeech: A Multilingual Speech Corpus from Around the World
par: Asonitis, Antonis, et autres
Publié: (2026)
par: Asonitis, Antonis, et autres
Publié: (2026)
Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models
par: Morlat, Geoffroy, et autres
Publié: (2025)
par: Morlat, Geoffroy, et autres
Publié: (2025)
Does Continued Pretraining on a Learner Corpus Improve Automated Essay Scoring on English Proficiency Tests? Evidence from EFCAMDAT
par: Nguyen, Duy Anh
Publié: (2026)
par: Nguyen, Duy Anh
Publié: (2026)
Structured Probabilistic Coding
par: Hu, Dou, et autres
Publié: (2023)
par: Hu, Dou, et autres
Publié: (2023)
Meta4XNLI: A Crosslingual Parallel Corpus for Metaphor Detection and Interpretation
par: Sanchez-Bayona, Elisa, et autres
Publié: (2024)
par: Sanchez-Bayona, Elisa, et autres
Publié: (2024)
Optimizing Large Language Models for Turkish: New Methodologies in Corpus Selection and Training
par: Kesgin, H. Toprak, et autres
Publié: (2024)
par: Kesgin, H. Toprak, et autres
Publié: (2024)
Documents similaires
-
The Moral Foundations Reddit Corpus
par: Trager, Jackson, et autres
Publié: (2022) -
On the Convergence of Moral Self-Correction in Large Language Models
par: Liu, Guangliang, et autres
Publié: (2025) -
MT-R1-Zero: Advancing LLM-based Machine Translation via R1-Zero-like Reinforcement Learning
par: Feng, Zhaopeng, et autres
Publié: (2025) -
MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning
par: Feng, Zhaopeng, et autres
Publié: (2025) -
EuroSpeech: A Multilingual Speech Corpus
par: Pfisterer, Samuel, et autres
Publié: (2025)