Teochew-Wild: The First In-the-wild Teochew Dataset with Orthographic Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pan, Linrong, Jiang, Chenglong, Hou, Gaoze, Gao, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Choice of Teochew Chinese Students in Vinh Chau – Soc Trang Today
par: Vu Nhat Tan
Publié: (2025)
par: Vu Nhat Tan
Publié: (2025)
Modeling Orthographic Variation Improves NLP Performance for Nigerian Pidgin
par: Lin, Pin-Jie, et autres
Publié: (2024)
par: Lin, Pin-Jie, et autres
Publié: (2024)
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025)
par: Khouja, Jude, et autres
Publié: (2025)
Language Complexity and Speech Recognition Accuracy: Orthographic Complexity Hurts, Phonological Complexity Doesn't
par: Taguchi, Chihiro, et autres
Publié: (2024)
par: Taguchi, Chihiro, et autres
Publié: (2024)
Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach
par: Yang, Han, et autres
Publié: (2025)
par: Yang, Han, et autres
Publié: (2025)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
par: Peng, Hao, et autres
Publié: (2026)
par: Peng, Hao, et autres
Publié: (2026)
Herald: A Natural Language Annotated Lean 4 Dataset
par: Gao, Guoxiong, et autres
Publié: (2024)
par: Gao, Guoxiong, et autres
Publié: (2024)
TruthStance: An Annotated Dataset of Conversations on Truth Social
par: Ameen, Fathima, et autres
Publié: (2026)
par: Ameen, Fathima, et autres
Publié: (2026)
AKEW: Assessing Knowledge Editing in the Wild
par: Wu, Xiaobao, et autres
Publié: (2024)
par: Wu, Xiaobao, et autres
Publié: (2024)
WildIFEval: Instruction Following in the Wild
par: Lior, Gili, et autres
Publié: (2025)
par: Lior, Gili, et autres
Publié: (2025)
ShareChat: A Dataset of Chatbot Conversations in the Wild
par: Yan, Yueru, et autres
Publié: (2025)
par: Yan, Yueru, et autres
Publié: (2025)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
par: Feng, Duanyu, et autres
Publié: (2024)
par: Feng, Duanyu, et autres
Publié: (2024)
Sina at FigNews 2024: Multilingual Datasets Annotated with Bias and Propaganda
par: Duaibes, Lina, et autres
Publié: (2024)
par: Duaibes, Lina, et autres
Publié: (2024)
ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction
par: Jung, Jeesu, et autres
Publié: (2025)
par: Jung, Jeesu, et autres
Publié: (2025)
BoundingDocs: a Unified Dataset for Document Question Answering with Spatial Annotations
par: Giovannini, Simone, et autres
Publié: (2025)
par: Giovannini, Simone, et autres
Publié: (2025)
MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations
par: Scott, Aaron, et autres
Publié: (2025)
par: Scott, Aaron, et autres
Publié: (2025)
Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations
par: Cai, Wenrui, et autres
Publié: (2025)
par: Cai, Wenrui, et autres
Publié: (2025)
CMDAG: A Chinese Metaphor Dataset with Annotated Grounds as CoT for Boosting Metaphor Generation
par: Shao, Yujie, et autres
Publié: (2024)
par: Shao, Yujie, et autres
Publié: (2024)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
par: Choi, Juhwan, et autres
Publié: (2024)
par: Choi, Juhwan, et autres
Publié: (2024)
WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
par: Liu, Tengxiao, et autres
Publié: (2026)
par: Liu, Tengxiao, et autres
Publié: (2026)
WildHallucinations: Evaluating Long-form Factuality in LLMs with Real-World Entity Queries
par: Zhao, Wenting, et autres
Publié: (2024)
par: Zhao, Wenting, et autres
Publié: (2024)
AnnoCaseLaw: A Richly-Annotated Dataset For Benchmarking Explainable Legal Judgment Prediction
par: Sesodia, Magnus, et autres
Publié: (2025)
par: Sesodia, Magnus, et autres
Publié: (2025)
DeFine: A Decomposed and Fine-Grained Annotated Dataset for Long-form Article Generation
par: Wang, Ming, et autres
Publié: (2025)
par: Wang, Ming, et autres
Publié: (2025)
CasiMedicos-Arg: A Medical Question Answering Dataset Annotated with Explanatory Argumentative Structures
par: Sviridova, Ekaterina, et autres
Publié: (2024)
par: Sviridova, Ekaterina, et autres
Publié: (2024)
Exploring Cross-Cultural Differences in English Hate Speech Annotations: From Dataset Construction to Analysis
par: Lee, Nayeon, et autres
Publié: (2023)
par: Lee, Nayeon, et autres
Publié: (2023)
Who Annotates in NLP? A Large-scale Assessment of Human Annotation Reporting between 2018 and 2025
par: Kunilovskaya, Maria, et autres
Publié: (2026)
par: Kunilovskaya, Maria, et autres
Publié: (2026)
WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild
par: Lin, Bill Yuchen, et autres
Publié: (2024)
par: Lin, Bill Yuchen, et autres
Publié: (2024)
COMI-LINGUA: Expert Annotated Large-Scale Dataset for Multitask NLP in Hindi-English Code-Mixing
par: Sheth, Rajvee, et autres
Publié: (2025)
par: Sheth, Rajvee, et autres
Publié: (2025)
NLP Security and Ethics, in the Wild
par: Lent, Heather, et autres
Publié: (2025)
par: Lent, Heather, et autres
Publié: (2025)
Vero: An Open RL Recipe for General Visual Reasoning
par: Sarch, Gabriel, et autres
Publié: (2026)
par: Sarch, Gabriel, et autres
Publié: (2026)
A Highly Clean Recipe Dataset with Ingredient States Annotation for State Probing Task
par: Toyooka, Mashiro, et autres
Publié: (2025)
par: Toyooka, Mashiro, et autres
Publié: (2025)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
par: Lu, Yujie, et autres
Publié: (2024)
par: Lu, Yujie, et autres
Publié: (2024)
CocoaBench: Evaluating Unified Digital Agents in the Wild
par: CocoaBench Team, et autres
Publié: (2026)
par: CocoaBench Team, et autres
Publié: (2026)
Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
par: Liu, Maoqi, et autres
Publié: (2025)
par: Liu, Maoqi, et autres
Publié: (2025)
QACP: An Annotated Question Answering Dataset for Assisting Chinese Python Programming Learners
par: Xiao, Rui, et autres
Publié: (2024)
par: Xiao, Rui, et autres
Publié: (2024)
Repurposing Annotation Guidelines to Instruct LLM Annotators: A Case Study
par: Kim, Kon Woo, et autres
Publié: (2025)
par: Kim, Kon Woo, et autres
Publié: (2025)
How Annotation Trains Annotators: Competence Development in Social Influence Recognition
par: Markiewicz, Maciej, et autres
Publié: (2026)
par: Markiewicz, Maciej, et autres
Publié: (2026)
VLQA: The First Comprehensive, Large, and High-Quality Vietnamese Dataset for Legal Question Answering
par: Nguyen, Tan-Minh, et autres
Publié: (2025)
par: Nguyen, Tan-Minh, et autres
Publié: (2025)
SwitchLingua: The First Large-Scale Multilingual and Multi-Ethnic Code-Switching Dataset
par: Xie, Peng, et autres
Publié: (2025)
par: Xie, Peng, et autres
Publié: (2025)
Mapping Overlaps in Benchmarks through Perplexity in the Wild
par: Wu, Siyang, et autres
Publié: (2025)
par: Wu, Siyang, et autres
Publié: (2025)
Documents similaires
-
Language Choice of Teochew Chinese Students in Vinh Chau – Soc Trang Today
par: Vu Nhat Tan
Publié: (2025) -
Modeling Orthographic Variation Improves NLP Performance for Nigerian Pidgin
par: Lin, Pin-Jie, et autres
Publié: (2024) -
LINGOLY-TOO: Disentangling Reasoning from Knowledge with Templatised Orthographic Obfuscation
par: Khouja, Jude, et autres
Publié: (2025) -
Language Complexity and Speech Recognition Accuracy: Orthographic Complexity Hurts, Phonological Complexity Doesn't
par: Taguchi, Chihiro, et autres
Publié: (2024) -
Enhancing Robustness of Autoregressive Language Models against Orthographic Attacks via Pixel-based Approach
par: Yang, Han, et autres
Publié: (2025)