IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation
Fuente:
arXiv
Saved in:
| Main Authors: | Kantharuban, Anjali, Srivastava, Aarohi, Faisal, Fahim, Ahia, Orevaoghene, Anastasopoulos, Antonios, Chiang, David, Tsvetkov, Yulia, Neubig, Graham |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024)
by: Xie, Roy, et al.
Published: (2024)
An Efficient Approach for Studying Cross-Lingual Transfer in Multilingual Language Models
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
Data-Augmentation-Based Dialectal Adaptation for LLMs
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
We're Calling an Intervention: Exploring Fundamental Hurdles in Adapting Language Models to Nonstandard Text
by: Srivastava, Aarohi, et al.
Published: (2024)
by: Srivastava, Aarohi, et al.
Published: (2024)
Dialectal Toxicity Detection: Evaluating LLM-as-a-Judge Consistency Across Language Varieties
by: Faisal, Fahim, et al.
Published: (2024)
by: Faisal, Fahim, et al.
Published: (2024)
BASS: Benchmarking Audio LMs for Musical Structure and Semantic Reasoning
by: Jang, Min, et al.
Published: (2026)
by: Jang, Min, et al.
Published: (2026)
Stereotype or Personalization? User Identity Biases Chatbot Recommendations
by: Kantharuban, Anjali, et al.
Published: (2024)
by: Kantharuban, Anjali, et al.
Published: (2024)
MAGNET: Improving the Multilingual Fairness of Language Models with Adaptive Gradient-Based Tokenization
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
Dialect Matters: Cross-Lingual ASR Transfer for Low-Resource Indic Language Varieties
by: Dhasmana, Akriti, et al.
Published: (2026)
by: Dhasmana, Akriti, et al.
Published: (2026)
Voices Unheard: NLP Resources and Models for Yorùbá Regional Dialects
by: Ahia, Orevaoghene, et al.
Published: (2024)
by: Ahia, Orevaoghene, et al.
Published: (2024)
FLEXITOKENS: Flexible Tokenization for Evolving Language Models
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
by: Owodunni, Abraham Toluwase, et al.
Published: (2025)
Teaching LLMs to Abstain across Languages via Multilingual Feedback
by: Feng, Shangbin, et al.
Published: (2024)
by: Feng, Shangbin, et al.
Published: (2024)
CMULAB: An Open-Source Framework for Training and Deployment of Natural Language Processing Models
by: Sheikh, Zaid, et al.
Published: (2024)
by: Sheikh, Zaid, et al.
Published: (2024)
Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning
by: Krasner, Nathaniel, et al.
Published: (2025)
by: Krasner, Nathaniel, et al.
Published: (2025)
GMU Systems for the IWSLT 2025 Low-Resource Speech Translation Shared Task
by: Meng, Chutong, et al.
Published: (2025)
by: Meng, Chutong, et al.
Published: (2025)
Back to School: Translation Using Grammar Books
by: Hus, Jonathan, et al.
Published: (2024)
by: Hus, Jonathan, et al.
Published: (2024)
Fine-grained Hallucination Detection and Editing for Language Models
by: Mishra, Abhika, et al.
Published: (2024)
by: Mishra, Abhika, et al.
Published: (2024)
Speaking of Language: Reflections on Metalanguage Research in NLP
by: Schneider, Nathan, et al.
Published: (2026)
by: Schneider, Nathan, et al.
Published: (2026)
MYTE: Morphology-Driven Byte Encoding for Better and Fairer Multilingual Language Modeling
by: Limisiewicz, Tomasz, et al.
Published: (2024)
by: Limisiewicz, Tomasz, et al.
Published: (2024)
A Study on Scaling Up Multilingual News Framing Analysis
by: Akter, Syeda Sabrina, et al.
Published: (2024)
by: Akter, Syeda Sabrina, et al.
Published: (2024)
Dialect Normalization using Large Language Models and Morphological Rules
by: Dimakis, Antonios, et al.
Published: (2025)
by: Dimakis, Antonios, et al.
Published: (2025)
Developing a Mixed-Methods Pipeline for Community-Oriented Digitization of Kwak'wala Legacy Texts
by: Agarwal, Milind, et al.
Published: (2025)
by: Agarwal, Milind, et al.
Published: (2025)
A Case Study on Filtering for End-to-End Speech Translation
by: Alam, Md Mahfuz Ibn, et al.
Published: (2024)
by: Alam, Md Mahfuz Ibn, et al.
Published: (2024)
Script-Agnostic Language Identification
by: Agarwal, Milind, et al.
Published: (2024)
by: Agarwal, Milind, et al.
Published: (2024)
Metadata Conditioned Large Language Models for Localization
by: Mukherjee, Anjishnu, et al.
Published: (2026)
by: Mukherjee, Anjishnu, et al.
Published: (2026)
Automated Python Translation
by: Otten, Joshua, et al.
Published: (2025)
by: Otten, Joshua, et al.
Published: (2025)
mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation
by: Raihan, Nishat, et al.
Published: (2024)
by: Raihan, Nishat, et al.
Published: (2024)
TigerCoder: A Novel Suite of LLMs for Code Generation in Bangla
by: Raihan, Nishat, et al.
Published: (2025)
by: Raihan, Nishat, et al.
Published: (2025)
Lost in the Tower of Babel: The Adverse Effects of Incidental Multilingualism in LLMs
by: Mukherjee, Anjishnu, et al.
Published: (2026)
by: Mukherjee, Anjishnu, et al.
Published: (2026)
Crossroads of Continents: Automated Artifact Extraction for Cultural Adaptation with Large Multimodal Models
by: Mukherjee, Anjishnu, et al.
Published: (2024)
by: Mukherjee, Anjishnu, et al.
Published: (2024)
Urban Mobility Assessment Using LLMs
by: Bhandari, Prabin, et al.
Published: (2024)
by: Bhandari, Prabin, et al.
Published: (2024)
Critical Learning Periods: Leveraging Early Training Dynamics for Efficient Data Pruning
by: Chimoto, Everlyn Asiko, et al.
Published: (2024)
by: Chimoto, Everlyn Asiko, et al.
Published: (2024)
Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
by: Zheng, Brian Siyuan, et al.
Published: (2025)
by: Zheng, Brian Siyuan, et al.
Published: (2025)
Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages
by: Yue, Xiang, et al.
Published: (2024)
by: Yue, Xiang, et al.
Published: (2024)
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
by: Fayyazsanavi, Pooya, et al.
Published: (2024)
by: Fayyazsanavi, Pooya, et al.
Published: (2024)
Finding Flawed Fictions: Evaluating Complex Reasoning in Language Models via Plot Hole Detection
by: Ahuja, Kabir, et al.
Published: (2025)
by: Ahuja, Kabir, et al.
Published: (2025)
CODET: A Benchmark for Contrastive Dialectal Evaluation of Machine Translation
by: Alam, Md Mahfuz Ibn, et al.
Published: (2023)
by: Alam, Md Mahfuz Ibn, et al.
Published: (2023)
A Morphologically-Aware Dictionary-based Data Augmentation Technique for Machine Translation of Under-Represented Languages
by: Alam, Md Mahfuz Ibn, et al.
Published: (2024)
by: Alam, Md Mahfuz Ibn, et al.
Published: (2024)
Safe Language Generation in the Limit
by: Anastasopoulos, Antonios, et al.
Published: (2026)
by: Anastasopoulos, Antonios, et al.
Published: (2026)
Similar Items
-
DIALECTBENCH: A NLP Benchmark for Dialects, Varieties, and Closely-Related Languages
by: Faisal, Fahim, et al.
Published: (2024) -
Extracting Lexical Features from Dialects via Interpretable Dialect Classifiers
by: Xie, Roy, et al.
Published: (2024) -
An Efficient Approach for Studying Cross-Lingual Transfer in Multilingual Language Models
by: Faisal, Fahim, et al.
Published: (2024) -
Data-Augmentation-Based Dialectal Adaptation for LLMs
by: Faisal, Fahim, et al.
Published: (2024) -
We're Calling an Intervention: Exploring Fundamental Hurdles in Adapting Language Models to Nonstandard Text
by: Srivastava, Aarohi, et al.
Published: (2024)