Unmasking and Improving Data Credibility: A Study with Datasets for Training Harmless Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhu, Zhaowei, Wang, Jialu, Cheng, Hao, Liu, Yang |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers
di: Solatorio, Aivin V., et al.
Pubblicazione: (2025)
di: Solatorio, Aivin V., et al.
Pubblicazione: (2025)
Towards Best Practices for Open Datasets for LLM Training
di: Baack, Stefan, et al.
Pubblicazione: (2025)
di: Baack, Stefan, et al.
Pubblicazione: (2025)
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
di: Zhou, Han, et al.
Pubblicazione: (2024)
di: Zhou, Han, et al.
Pubblicazione: (2024)
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)
ResumeAtlas: Revisiting Resume Classification with Large-Scale Datasets and Large Language Models
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
di: Heakl, Ahmed, et al.
Pubblicazione: (2024)
Impacts of Racial Bias in Historical Training Data for News AI
di: Bhargava, Rahul, et al.
Pubblicazione: (2025)
di: Bhargava, Rahul, et al.
Pubblicazione: (2025)
CycleResearcher: Improving Automated Research via Automated Review
di: Weng, Yixuan, et al.
Pubblicazione: (2024)
di: Weng, Yixuan, et al.
Pubblicazione: (2024)
Improving Consistency in Retrieval-Augmented Systems with Group Similarity Rewards
di: Hamman, Faisal, et al.
Pubblicazione: (2025)
di: Hamman, Faisal, et al.
Pubblicazione: (2025)
Position: The Most Expensive Part of an LLM should be its Training Data
di: Kandpal, Nikhil, et al.
Pubblicazione: (2025)
di: Kandpal, Nikhil, et al.
Pubblicazione: (2025)
Predicting Learning Performance with Large Language Models: A Study in Adult Literacy
di: Zhang, Liang, et al.
Pubblicazione: (2024)
di: Zhang, Liang, et al.
Pubblicazione: (2024)
Personalized Decision Modeling: Utility Optimization or Textualized-Symbolic Reasoning
di: Zhao, Yibo, et al.
Pubblicazione: (2025)
di: Zhao, Yibo, et al.
Pubblicazione: (2025)
Adapting Mental Health Prediction Tasks for Cross-lingual Learning via Meta-Training and In-context Learning with Large Language Model
di: Lifelo, Zita, et al.
Pubblicazione: (2024)
di: Lifelo, Zita, et al.
Pubblicazione: (2024)
Hypothesis Generation with Large Language Models
di: Zhou, Yangqiaoyu, et al.
Pubblicazione: (2024)
di: Zhou, Yangqiaoyu, et al.
Pubblicazione: (2024)
Foundational Challenges in Assuring Alignment and Safety of Large Language Models
di: Anwar, Usman, et al.
Pubblicazione: (2024)
di: Anwar, Usman, et al.
Pubblicazione: (2024)
Embedding Enhancement via Fine-Tuned Language Models for Learner-Item Cognitive Modeling
di: Liu, Yuanhao, et al.
Pubblicazione: (2026)
di: Liu, Yuanhao, et al.
Pubblicazione: (2026)
Exploring Accuracy-Fairness Trade-off in Large Language Models
di: Zhang, Qingquan, et al.
Pubblicazione: (2024)
di: Zhang, Qingquan, et al.
Pubblicazione: (2024)
Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models
di: Feng, Duanyu, et al.
Pubblicazione: (2023)
di: Feng, Duanyu, et al.
Pubblicazione: (2023)
SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
di: Xu, Tianyang, et al.
Pubblicazione: (2025)
Large Language Models Assume People are More Rational than We Really are
di: Liu, Ryan, et al.
Pubblicazione: (2024)
di: Liu, Ryan, et al.
Pubblicazione: (2024)
Deconstructing The Ethics of Large Language Models from Long-standing Issues to New-emerging Dilemmas: A Survey
di: Deng, Chengyuan, et al.
Pubblicazione: (2024)
di: Deng, Chengyuan, et al.
Pubblicazione: (2024)
Large Language Models as Urban Residents: An LLM Agent Framework for Personal Mobility Generation
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
di: Wang, Jiawei, et al.
Pubblicazione: (2024)
Correlated Errors in Large Language Models
di: Kim, Elliot, et al.
Pubblicazione: (2025)
di: Kim, Elliot, et al.
Pubblicazione: (2025)
Large Language Models are Geographically Biased
di: Manvi, Rohin, et al.
Pubblicazione: (2024)
di: Manvi, Rohin, et al.
Pubblicazione: (2024)
From Data to Behavior: Predicting Unintended Model Behaviors Before Training
di: Wang, Mengru, et al.
Pubblicazione: (2026)
di: Wang, Mengru, et al.
Pubblicazione: (2026)
Procedural Fairness Through Decoupling Objectionable Data Generating Components
di: Tang, Zeyu, et al.
Pubblicazione: (2023)
di: Tang, Zeyu, et al.
Pubblicazione: (2023)
Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
di: Kapoor, Anjali K., et al.
Pubblicazione: (2026)
LLMCarbon: Modeling the end-to-end Carbon Footprint of Large Language Models
di: Faiz, Ahmad, et al.
Pubblicazione: (2023)
di: Faiz, Ahmad, et al.
Pubblicazione: (2023)
Assessing Large Language Models on Climate Information
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
di: Bulian, Jannis, et al.
Pubblicazione: (2023)
BiasEdit: Debiasing Stereotyped Language Models via Model Editing
di: Xu, Xin, et al.
Pubblicazione: (2025)
di: Xu, Xin, et al.
Pubblicazione: (2025)
Psychological Counseling Ability of Large Language Models
di: Peng, Fangyu, et al.
Pubblicazione: (2025)
di: Peng, Fangyu, et al.
Pubblicazione: (2025)
Mining Social Determinants of Health for Heart Failure Patient 30-Day Readmission via Large Language Model
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
di: Shao, Mingchen, et al.
Pubblicazione: (2025)
Implicit Personalization in Language Models: A Systematic Study
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
di: Jin, Zhijing, et al.
Pubblicazione: (2024)
Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models
di: Zhang, Yue, et al.
Pubblicazione: (2023)
di: Zhang, Yue, et al.
Pubblicazione: (2023)
Bias and Fairness in Large Language Models: A Survey
di: Gallegos, Isabel O., et al.
Pubblicazione: (2023)
di: Gallegos, Isabel O., et al.
Pubblicazione: (2023)
A Taxonomy of Stereotype Content in Large Language Models
di: Nicolas, Gandalf, et al.
Pubblicazione: (2024)
di: Nicolas, Gandalf, et al.
Pubblicazione: (2024)
Deliberative Alignment: Reasoning Enables Safer Language Models
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
di: Guan, Melody Y., et al.
Pubblicazione: (2024)
Transforming Agency. On the mode of existence of Large Language Models
di: Barandiaran, Xabier E., et al.
Pubblicazione: (2024)
di: Barandiaran, Xabier E., et al.
Pubblicazione: (2024)
Towards Large Language Models that Benefit for All: Benchmarking Group Fairness in Reward Models
di: Song, Kefan, et al.
Pubblicazione: (2025)
di: Song, Kefan, et al.
Pubblicazione: (2025)
Surveying Attitudinal Alignment Between Large Language Models Vs. Humans Towards 17 Sustainable Development Goals
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
di: Wu, Qingyang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025) -
Large Language Models and Synthetic Data for Monitoring Dataset Mentions in Research Papers
di: Solatorio, Aivin V., et al.
Pubblicazione: (2025) -
Towards Best Practices for Open Datasets for LLM Training
di: Baack, Stefan, et al.
Pubblicazione: (2025) -
Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments
di: Zhou, Han, et al.
Pubblicazione: (2024) -
Compromising Honesty and Harmlessness in Language Models via Deception Attacks
di: Vaugrante, Laurène, et al.
Pubblicazione: (2025)