Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Minghao, Di, Zonglin, Wei, Jiaheng, Wang, Zhongruo, Zhang, Hengxiang, Xiao, Ruixuan, Wang, Haoyu, Pang, Jinlong, Chen, Hao, Shah, Ankit, Wei, Hongxin, He, Xinlei, Zhao, Zhaowei, Wang, Haobo, Feng, Lei, Wang, Jindong, Davis, James, Liu, Yang |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improving Data Efficiency via Curating LLM-Driven Rating Systems
par: Pang, Jinlong, et autres
Publié: (2024)
par: Pang, Jinlong, et autres
Publié: (2024)
LLM Unlearning via Loss Adjustment with Only Forget Data
par: Wang, Yaxuan, et autres
Publié: (2024)
par: Wang, Yaxuan, et autres
Publié: (2024)
Defending Membership Inference Attacks via Privacy-aware Sparsity Tuning
par: Hu, Qiang, et autres
Publié: (2024)
par: Hu, Qiang, et autres
Publié: (2024)
Inference Time Optimization with Confidence Dynamics
par: Wang, Yu, et autres
Publié: (2026)
par: Wang, Yu, et autres
Publié: (2026)
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
par: Pang, Jinlong, et autres
Publié: (2025)
par: Pang, Jinlong, et autres
Publié: (2025)
Human and AI Perceptual Differences in Image Classification Errors
par: Liu, Minghao, et autres
Publié: (2023)
par: Liu, Minghao, et autres
Publié: (2023)
On LLMs-Driven Synthetic Data Generation, Curation, and Evaluation: A Survey
par: Long, Lin, et autres
Publié: (2024)
par: Long, Lin, et autres
Publié: (2024)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks
par: Chen, Hao, et autres
Publié: (2023)
par: Chen, Hao, et autres
Publié: (2023)
Detecting Distillation Data from Reasoning Models
par: Zhang, Hengxiang, et autres
Publié: (2025)
par: Zhang, Hengxiang, et autres
Publié: (2025)
GUARD: Generation-time LLM Unlearning via Adaptive Restriction and Detection
par: Deng, Zhijie, et autres
Publié: (2025)
par: Deng, Zhijie, et autres
Publié: (2025)
Incentivizing High-quality Participation From Federated Learning Agents
par: Pang, Jinlong, et autres
Publié: (2025)
par: Pang, Jinlong, et autres
Publié: (2025)
Open-Vocabulary Calibration for Fine-tuned CLIP
par: Wang, Shuoyuan, et autres
Publié: (2024)
par: Wang, Shuoyuan, et autres
Publié: (2024)
Evaluating LLM-Contaminated Crowdsourcing Data Without Ground Truth
par: Zhang, Yichi, et autres
Publié: (2025)
par: Zhang, Yichi, et autres
Publié: (2025)
Fairness Without Harm: An Influence-Guided Active Sampling Approach
par: Pang, Jinlong, et autres
Publié: (2024)
par: Pang, Jinlong, et autres
Publié: (2024)
AFPR-CIM: An Analog-Domain Floating-Point RRAM-based Compute-In-Memory Architecture with Dynamic Range Adaptive FP-ADC
par: Liu, Haobo, et autres
Publié: (2024)
par: Liu, Haobo, et autres
Publié: (2024)
Optimization-Free Test-Time Adaptation for Cross-Person Activity Recognition
par: Wang, Shuoyuan, et autres
Publié: (2023)
par: Wang, Shuoyuan, et autres
Publié: (2023)
Small-Margin Preferences Still Matter-If You Train Them Right
par: Pang, Jinlong, et autres
Publié: (2026)
par: Pang, Jinlong, et autres
Publié: (2026)
MarsRetrieval: Benchmarking Vision-Language Models for Planetary-Scale Geospatial Retrieval on Mars
par: Wang, Shuoyuan, et autres
Publié: (2026)
par: Wang, Shuoyuan, et autres
Publié: (2026)
Disc3D: Automatic Curation of High-Quality 3D Dialog Data via Discriminative Object Referring
par: Wei, Siyuan, et autres
Publié: (2025)
par: Wei, Siyuan, et autres
Publié: (2025)
PAGE: Parametric Generative Explainer for Graph Neural Network
par: Qiu, Yang, et autres
Publié: (2024)
par: Qiu, Yang, et autres
Publié: (2024)
Enhancing RAG with Active Learning on Conversation Records: Reject Incapables and Answer Capables
par: Geng, Xuzhao, et autres
Publié: (2025)
par: Geng, Xuzhao, et autres
Publié: (2025)
ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis
par: Wang, Hao, et autres
Publié: (2026)
par: Wang, Hao, et autres
Publié: (2026)
An Efficient Wireless iBCI Headstage with Adaptive ADC Sample Rate
par: Liu, Hongyao, et autres
Publié: (2026)
par: Liu, Hongyao, et autres
Publié: (2026)
Impact of Noisy Supervision in Foundation Model Learning
par: Chen, Hao, et autres
Publié: (2024)
par: Chen, Hao, et autres
Publié: (2024)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
par: Yang, Haobo, et autres
Publié: (2025)
par: Yang, Haobo, et autres
Publié: (2025)
SelectMix: Enhancing Label Noise Robustness through Targeted Sample Mixing
par: Liu, Qiuhao, et autres
Publié: (2025)
par: Liu, Qiuhao, et autres
Publié: (2025)
Understanding and Mitigating Miscalibration in Prompt Tuning for Vision-Language Models
par: Wang, Shuoyuan, et autres
Publié: (2024)
par: Wang, Shuoyuan, et autres
Publié: (2024)
LM-mixup: Text Data Augmentation via Language Model based Mixup
par: Deng, Zhijie, et autres
Publié: (2025)
par: Deng, Zhijie, et autres
Publié: (2025)
CLLMate: A Multimodal Benchmark for Weather and Climate Events Forecasting
par: Li, Haobo, et autres
Publié: (2024)
par: Li, Haobo, et autres
Publié: (2024)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
par: Zhang, Hengxiang, et autres
Publié: (2024)
par: Zhang, Hengxiang, et autres
Publié: (2024)
Human Detection in Realistic Through-the-Wall Environments using Raw Radar ADC Data and Parametric Neural Networks
par: Wang, Wei, et autres
Publié: (2024)
par: Wang, Wei, et autres
Publié: (2024)
The Impact of Bitcoin ETF Approval on Bitcoin's Hedging Properties Against Traditional Assets
par: Hong, Yihan, et autres
Publié: (2025)
par: Hong, Yihan, et autres
Publié: (2025)
A Euclidean Distance Matrix Model for Convex Clustering
par: Wang, Zhaowei, et autres
Publié: (2021)
par: Wang, Zhaowei, et autres
Publié: (2021)
Self-Ensemble Post Learning for Noisy Domain Generalization
par: Lu, Wang, et autres
Publié: (2025)
par: Lu, Wang, et autres
Publié: (2025)
H2O2 Self‐Supplying CaO2/CuO2/Fe3O4 Nanoplatform for Enhanced Chemodynamic Therapy of Cancer Cells
par: Bojian Liu, et autres
Publié: (2024)
par: Bojian Liu, et autres
Publié: (2024)
An efficient evolutionary structural optimization method for multi-resolution designs
par: Wang, Hongxin, et autres
Publié: (2019)
par: Wang, Hongxin, et autres
Publié: (2019)
OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models
par: Zheng, Hao, et autres
Publié: (2025)
par: Zheng, Hao, et autres
Publié: (2025)
DAMBench: A Multi-Modal Benchmark for Deep Learning-based Atmospheric Data Assimilation
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
RePST: Language Model Empowered Spatio-Temporal Forecasting via Semantic-Oriented Reprogramming
par: Wang, Hao, et autres
Publié: (2024)
par: Wang, Hao, et autres
Publié: (2024)
Documents similaires
-
Improving Data Efficiency via Curating LLM-Driven Rating Systems
par: Pang, Jinlong, et autres
Publié: (2024) -
LLM Unlearning via Loss Adjustment with Only Forget Data
par: Wang, Yaxuan, et autres
Publié: (2024) -
Defending Membership Inference Attacks via Privacy-aware Sparsity Tuning
par: Hu, Qiang, et autres
Publié: (2024) -
Inference Time Optimization with Confidence Dynamics
par: Wang, Yu, et autres
Publié: (2026) -
Token Cleaning: Fine-Grained Data Selection for LLM Supervised Fine-Tuning
par: Pang, Jinlong, et autres
Publié: (2025)