Curating Grounded Synthetic Data with Global Perspectives for Equitable AI
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Törnquist, Elin, Caulk, Robert Alexander |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Synthetic Voice Data for Automatic Speech Recognition in African Languages
par: DeRenzi, Brian, et autres
Publié: (2025)
par: DeRenzi, Brian, et autres
Publié: (2025)
Synthia: Scalable Grounded Persona Generation from Social Media Data
par: Rahimzadeh, Vahid, et autres
Publié: (2025)
par: Rahimzadeh, Vahid, et autres
Publié: (2025)
German Text Simplification: Finetuning Large Language Models with Semi-Synthetic Data
par: Klöser, Lars, et autres
Publié: (2024)
par: Klöser, Lars, et autres
Publié: (2024)
SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification
par: Kang, Migyeong, et autres
Publié: (2026)
par: Kang, Migyeong, et autres
Publié: (2026)
Named Entity Recognition for Address Extraction in Speech-to-Text Transcriptions Using Synthetic Data
par: Lajčinová, Bibiána, et autres
Publié: (2024)
par: Lajčinová, Bibiána, et autres
Publié: (2024)
CRISP: Persistent Concept Unlearning via Sparse Autoencoders
par: Ashuach, Tomer, et autres
Publié: (2025)
par: Ashuach, Tomer, et autres
Publié: (2025)
Frequency Matters: Fast Model-Agnostic Data Curation for Pruning and Quantization
par: Monaco, Francesco Pio, et autres
Publié: (2026)
par: Monaco, Francesco Pio, et autres
Publié: (2026)
propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale
par: Idahl, Maximilian, et autres
Publié: (2026)
par: Idahl, Maximilian, et autres
Publié: (2026)
Text-Based Approaches to Item Difficulty Modeling in Large-Scale Assessments: A Systematic Review
par: Peters, Sydney, et autres
Publié: (2025)
par: Peters, Sydney, et autres
Publié: (2025)
Clinical Document Corpora -- Real Ones, Translated and Synthetic Substitutes, and Assorted Domain Proxies: A Survey of Diversity in Corpus Design, with Focus on German Text Data
par: Hahn, Udo
Publié: (2024)
par: Hahn, Udo
Publié: (2024)
Scaling Synthetic Logical Reasoning Datasets with Context-Sensitive Declarative Grammars
par: Sileo, Damien
Publié: (2024)
par: Sileo, Damien
Publié: (2024)
COMET-poly: Machine Translation Metric Grounded in Other Candidates
par: Züfle, Maike, et autres
Publié: (2025)
par: Züfle, Maike, et autres
Publié: (2025)
KinyaColBERT: A Lexically Grounded Retrieval Model for Low-Resource Retrieval-Augmented Generation
par: Nzeyimana, Antoine, et autres
Publié: (2025)
par: Nzeyimana, Antoine, et autres
Publié: (2025)
GroUSE: A Benchmark to Evaluate Evaluators in Grounded Question Answering
par: Muller, Sacha, et autres
Publié: (2024)
par: Muller, Sacha, et autres
Publié: (2024)
EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
par: Yang, Pei, et autres
Publié: (2026)
par: Yang, Pei, et autres
Publié: (2026)
SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions
par: Wang, Tianyu, et autres
Publié: (2026)
par: Wang, Tianyu, et autres
Publié: (2026)
The Curious Case of Visual Grounding: Different Effects for Speech- and Text-based Language Encoders
par: Sauter, Adrian, et autres
Publié: (2025)
par: Sauter, Adrian, et autres
Publié: (2025)
SynDocDis: A Metadata-Driven Framework for Generating Synthetic Physician Discussions Using Large Language Models
par: Rubinstein, Beny, et autres
Publié: (2026)
par: Rubinstein, Beny, et autres
Publié: (2026)
AI Can Learn Scientific Taste
par: Tong, Jingqi, et autres
Publié: (2026)
par: Tong, Jingqi, et autres
Publié: (2026)
Evaluating the Efficacy of Hybrid Deep Learning Models in Distinguishing AI-Generated Text
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
par: Oketunji, Abiodun Finbarrs
Publié: (2023)
RomanLens: The Role Of Latent Romanization In Multilinguality In LLMs
par: Saji, Alan, et autres
Publié: (2025)
par: Saji, Alan, et autres
Publié: (2025)
Graphemic Normalization of the Perso-Arabic Script
par: Doctor, Raiomond, et autres
Publié: (2022)
par: Doctor, Raiomond, et autres
Publié: (2022)
Beyond Arabic: Software for Perso-Arabic Script Manipulation
par: Gutkin, Alexander, et autres
Publié: (2023)
par: Gutkin, Alexander, et autres
Publié: (2023)
Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment
par: Zhang, Yizhuo, et autres
Publié: (2025)
par: Zhang, Yizhuo, et autres
Publié: (2025)
UrduLLaMA 1.0: Dataset Curation, Preprocessing, and Evaluation in Low-Resource Settings
par: Fiaz, Layba, et autres
Publié: (2025)
par: Fiaz, Layba, et autres
Publié: (2025)
The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations
par: Lequeu, Pierre-Antoine, et autres
Publié: (2026)
par: Lequeu, Pierre-Antoine, et autres
Publié: (2026)
Socially Responsible Data for Large Multilingual Language Models
par: Smart, Andrew, et autres
Publié: (2024)
par: Smart, Andrew, et autres
Publié: (2024)
Boosting Accuracy and Interpretability in Multilingual Hate Speech Detection Through Layer Freezing and Explainable AI
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2026)
par: Bilehsavar, Meysam Shirdel, et autres
Publié: (2026)
Improving Retrieval-Augmented Neural Machine Translation with Monolingual Data
par: Bouthors, Maxime, et autres
Publié: (2025)
par: Bouthors, Maxime, et autres
Publié: (2025)
Towards Fundamental Language Models: Does Linguistic Competence Scale with Model Size?
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
par: Collado-Montañez, Jaime, et autres
Publié: (2025)
SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
par: Smădu, Răzvan-Alexandru, et autres
Publié: (2025)
Efficient Few-shot Learning for Multi-label Classification of Scientific Documents with Many Classes
par: Schopf, Tim, et autres
Publié: (2024)
par: Schopf, Tim, et autres
Publié: (2024)
Select or Project? Evaluating Lower-dimensional Vectors for LLM Training Data Explanations
par: Hinterleitner, Lukas, et autres
Publié: (2026)
par: Hinterleitner, Lukas, et autres
Publié: (2026)
SLAP: Stratified Loss-based Pruning for On-Policy Data-Efficient Instruction Tuning
par: Zou, Run, et autres
Publié: (2026)
par: Zou, Run, et autres
Publié: (2026)
Vocabulary Transfer for Biomedical Texts: Add Tokens if You Can Not Add Data
par: Singh, Priyanka, et autres
Publié: (2022)
par: Singh, Priyanka, et autres
Publié: (2022)
Please Make it Sound like Human: Encoder-Decoder vs. Decoder-Only Transformers for AI-to-Human Text Style Transfer
par: Paneru, Utsav
Publié: (2026)
par: Paneru, Utsav
Publié: (2026)
Automatic Generation of Conversational Interfaces for Tabular Data Analysis
par: Gomez-Vazquez, Marcos, et autres
Publié: (2023)
par: Gomez-Vazquez, Marcos, et autres
Publié: (2023)
The Effect of Data Partitioning Strategy on Model Generalizability: A Case Study of Morphological Segmentation
par: Liu, Zoey, et autres
Publié: (2024)
par: Liu, Zoey, et autres
Publié: (2024)
Improving the OOD Performance of Closed-Source LLMs on NLI Through Strategic Data Selection
par: Stacey, Joe, et autres
Publié: (2025)
par: Stacey, Joe, et autres
Publié: (2025)
Enhancing Paraphrase Type Generation: The Impact of DPO and RLHF Evaluated with Human-Ranked Data
par: Lübbers, Christopher Lee
Publié: (2025)
par: Lübbers, Christopher Lee
Publié: (2025)
Documents similaires
-
Synthetic Voice Data for Automatic Speech Recognition in African Languages
par: DeRenzi, Brian, et autres
Publié: (2025) -
Synthia: Scalable Grounded Persona Generation from Social Media Data
par: Rahimzadeh, Vahid, et autres
Publié: (2025) -
German Text Simplification: Finetuning Large Language Models with Semi-Synthetic Data
par: Klöser, Lars, et autres
Publié: (2024) -
SynSym: A Synthetic Data Generation Framework for Psychiatric Symptom Identification
par: Kang, Migyeong, et autres
Publié: (2026) -
Named Entity Recognition for Address Extraction in Speech-to-Text Transcriptions Using Synthetic Data
par: Lajčinová, Bibiána, et autres
Publié: (2024)