Cost-efficient Crowdsourcing for Span-based Sequence Labeling: Worker Selection and Data Augmentation
Fuente:
arXiv
Saved in:
| Main Authors: | Wang, Yujie, Huang, Chao, Yang, Liner, Fang, Zhixuan, Huang, Yaping, Liu, Yang, Yu, Jingsi, Yang, Erhong |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cross-domain Chinese Sentence Pattern Parsing
by: Yu, Jingsi, et al.
Published: (2024)
by: Yu, Jingsi, et al.
Published: (2024)
From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs
by: An, Jiyuan, et al.
Published: (2026)
by: An, Jiyuan, et al.
Published: (2026)
PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models
by: An, Jiyuan, et al.
Published: (2026)
by: An, Jiyuan, et al.
Published: (2026)
From Text to CQL: Bridging Natural Language and Corpus Search Engine
by: Lu, Luming, et al.
Published: (2024)
by: Lu, Luming, et al.
Published: (2024)
Span-level Emotion-Cause-Category Triplet Extraction with Instruction Tuning LLMs and Data Augmentation
by: Li, Xiangju, et al.
Published: (2025)
by: Li, Xiangju, et al.
Published: (2025)
RAG-based Crowdsourcing Task Decomposition via Masked Contrastive Learning with Prompts
by: Yang, Jing, et al.
Published: (2024)
by: Yang, Jing, et al.
Published: (2024)
If in a Crowdsourced Data Annotation Pipeline, a GPT-4
by: He, Zeyu, et al.
Published: (2024)
by: He, Zeyu, et al.
Published: (2024)
Is Crowdsourcing Breaking Your Bank? Cost-Effective Fine-Tuning of Pre-trained Language Models with Proximal Policy Optimization
by: Yang, Shuo, et al.
Published: (2024)
by: Yang, Shuo, et al.
Published: (2024)
Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge
by: Zhang, Wenbo, et al.
Published: (2026)
by: Zhang, Wenbo, et al.
Published: (2026)
Inference-Time Language Model Alignment via Integrated Value Guidance
by: Liu, Zhixuan, et al.
Published: (2024)
by: Liu, Zhixuan, et al.
Published: (2024)
Retrieval-Augmented Language Model for Extreme Multi-Label Knowledge Graph Link Prediction
by: Lin, Yu-Hsiang, et al.
Published: (2024)
by: Lin, Yu-Hsiang, et al.
Published: (2024)
Transformer Enhanced Relation Classification: A Comparative Analysis of Contextuality, Data Efficiency and Sequence Complexity
by: Jing, Bowen, et al.
Published: (2025)
by: Jing, Bowen, et al.
Published: (2025)
MCTS: A Multi-Reference Chinese Text Simplification Dataset
by: Chong, Ruining, et al.
Published: (2023)
by: Chong, Ruining, et al.
Published: (2023)
OMGEval: An Open Multilingual Generative Evaluation Benchmark for Large Language Models
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
Cost-efficient Knowledge-based Question Answering with Large Language Models
by: Dong, Junnan, et al.
Published: (2024)
by: Dong, Junnan, et al.
Published: (2024)
Weak-to-Strong Search: Align Large Language Models via Searching over Small Language Models
by: Zhou, Zhanhui, et al.
Published: (2024)
by: Zhou, Zhanhui, et al.
Published: (2024)
Entropy-Based Data Selection for Language Models
by: Li, Hongming, et al.
Published: (2026)
by: Li, Hongming, et al.
Published: (2026)
Adaptive Graph Refinement and Label Propagation with LLMs for Cost-Effective Entity Resolution
by: Wang, Hongtao, et al.
Published: (2026)
by: Wang, Hongtao, et al.
Published: (2026)
An Effective Incorporating Heterogeneous Knowledge Curriculum Learning for Sequence Labeling
by: Tang, Xuemei, et al.
Published: (2024)
by: Tang, Xuemei, et al.
Published: (2024)
Frustratingly Easy Label Projection for Cross-lingual Transfer
by: Chen, Yang, et al.
Published: (2022)
by: Chen, Yang, et al.
Published: (2022)
Mini-batch Coresets for Memory-efficient Language Model Training on Data Mixtures
by: Nguyen, Dang, et al.
Published: (2024)
by: Nguyen, Dang, et al.
Published: (2024)
Multi-News+: Cost-efficient Dataset Cleansing via LLM-based Data Annotation
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Life-Code: Central Dogma Modeling with Multi-Omics Sequence Unification
by: Liu, Zicheng, et al.
Published: (2025)
by: Liu, Zicheng, et al.
Published: (2025)
Relation-based Counterfactual Data Augmentation and Contrastive Learning for Robustifying Natural Language Inference Models
by: Yang, Heerin, et al.
Published: (2024)
by: Yang, Heerin, et al.
Published: (2024)
HGAdapter: Hypergraph-based Adapters in Language Models for Code Summarization and Clone Detection
by: Yang, Guang, et al.
Published: (2025)
by: Yang, Guang, et al.
Published: (2025)
Retrieval-Augmented Generation with Hierarchical Knowledge
by: Huang, Haoyu, et al.
Published: (2025)
by: Huang, Haoyu, et al.
Published: (2025)
Multi-layer Sequence Labeling-based Joint Biomedical Event Extraction
by: Chen, Gongchi, et al.
Published: (2024)
by: Chen, Gongchi, et al.
Published: (2024)
$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation
by: Hu, Jucheng, et al.
Published: (2025)
by: Hu, Jucheng, et al.
Published: (2025)
PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMs
by: Huang, Tianyi, et al.
Published: (2026)
by: Huang, Tianyi, et al.
Published: (2026)
ATLAS: Autoformalizing Theorems through Lifting, Augmentation, and Synthesis of Data
by: Liu, Xiaoyang, et al.
Published: (2025)
by: Liu, Xiaoyang, et al.
Published: (2025)
SoftEDA: Rethinking Rule-Based Data Augmentation with Soft Labels
by: Choi, Juhwan, et al.
Published: (2024)
by: Choi, Juhwan, et al.
Published: (2024)
Self-Selected Attention Span for Accelerating Large Language Model Inference
by: Jin, Tian, et al.
Published: (2024)
by: Jin, Tian, et al.
Published: (2024)
The Cost of Thinking: Increased Jailbreak Risk in Large Language Models
by: Yang, Fan
Published: (2025)
by: Yang, Fan
Published: (2025)
Influence Guided Context Selection for Effective Retrieval-Augmented Generation
by: Deng, Jiale, et al.
Published: (2025)
by: Deng, Jiale, et al.
Published: (2025)
Adaptive Data Augmentation for Aspect Sentiment Quad Prediction
by: Zhang, Wenyuan, et al.
Published: (2024)
by: Zhang, Wenyuan, et al.
Published: (2024)
Rethinking Data Selection at Scale: Random Selection is Almost All You Need
by: Xia, Tingyu, et al.
Published: (2024)
by: Xia, Tingyu, et al.
Published: (2024)
Comprehensive Evaluation of Multimodal AI Models in Medical Imaging Diagnosis: From Data Augmentation to Preference-Based Comparison
by: Ruan, Cailian, et al.
Published: (2024)
by: Ruan, Cailian, et al.
Published: (2024)
SEDA: A Self-Adapted Entity-Centric Data Augmentation for Boosting Gird-based Discontinuous NER Models
by: Su, Wen-Fang, et al.
Published: (2025)
by: Su, Wen-Fang, et al.
Published: (2025)
LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
by: Xiao, Yilin, et al.
Published: (2026)
by: Xiao, Yilin, et al.
Published: (2026)
Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths
by: Fu, Tianyu, et al.
Published: (2024)
by: Fu, Tianyu, et al.
Published: (2024)
Similar Items
-
Cross-domain Chinese Sentence Pattern Parsing
by: Yu, Jingsi, et al.
Published: (2024) -
From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMs
by: An, Jiyuan, et al.
Published: (2026) -
PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models
by: An, Jiyuan, et al.
Published: (2026) -
From Text to CQL: Bridging Natural Language and Corpus Search Engine
by: Lu, Luming, et al.
Published: (2024) -
Span-level Emotion-Cause-Category Triplet Extraction with Instruction Tuning LLMs and Data Augmentation
by: Li, Xiangju, et al.
Published: (2025)