Transforming Sensitive Documents into Quantitative Data: An AI-Based Preprocessing Toolchain for Structured and Privacy-Conscious Analysis
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ledberg, Anders, Thalén, Anna |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Annotation Sensitivity: Training Data Collection Methods Affect Model Performance
par: Kern, Christoph, et autres
Publié: (2023)
par: Kern, Christoph, et autres
Publié: (2023)
Documents Are People and Words Are Items: A Psychometric Approach to Textual Data with Contextual Embeddings
par: Chen, Jinsong
Publié: (2025)
par: Chen, Jinsong
Publié: (2025)
Geological Inference from Textual Data using Word Embeddings
par: Linphrachaya, Nanmanas, et autres
Publié: (2025)
par: Linphrachaya, Nanmanas, et autres
Publié: (2025)
A New Semisupervised Technique for Polarity Analysis using Masked Language Models
par: Watanabe, Kohei
Publié: (2026)
par: Watanabe, Kohei
Publié: (2026)
Exploring the Potential Role of Generative AI in the TRAPD Procedure for Survey Translation
par: Metheney, Erica Ann, et autres
Publié: (2024)
par: Metheney, Erica Ann, et autres
Publié: (2024)
Counterfactually Fair Reinforcement Learning via Sequential Data Preprocessing
par: Wang, Jitao, et autres
Publié: (2025)
par: Wang, Jitao, et autres
Publié: (2025)
Systematic Evaluation of Uncertainty Estimation Methods in Large Language Models
par: Hobelsberger, Christian, et autres
Publié: (2025)
par: Hobelsberger, Christian, et autres
Publié: (2025)
Human-AI Co-design for Clinical Prediction Models
par: Feng, Jean, et autres
Publié: (2026)
par: Feng, Jean, et autres
Publié: (2026)
Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Proximal Causal Inference With Text Data
par: Chen, Jacob M., et autres
Publié: (2024)
par: Chen, Jacob M., et autres
Publié: (2024)
End-To-End Causal Effect Estimation from Unstructured Natural Language Data
par: Dhawan, Nikita, et autres
Publié: (2024)
par: Dhawan, Nikita, et autres
Publié: (2024)
Information-based Preprocessing of PLC Data for Automatic Behavior Modeling
par: Sai, Brandon K., et autres
Publié: (2023)
par: Sai, Brandon K., et autres
Publié: (2023)
Syntax-Guided Diffusion Language Models with User-Integrated Personalization
par: Zhang, Ruqian, et autres
Publié: (2025)
par: Zhang, Ruqian, et autres
Publié: (2025)
A chart review process aided by natural language processing and multi-wave adaptive sampling to expedite validation of code-based algorithms for large database studies
par: Wang, Shirley V, et autres
Publié: (2025)
par: Wang, Shirley V, et autres
Publié: (2025)
How Model Size, Temperature, and Prompt Style Affect LLM-Human Assessment Score Alignment
par: Jung, Julie, et autres
Publié: (2025)
par: Jung, Julie, et autres
Publié: (2025)
Aligning NLP Models with Target Population Perspectives using PAIR: Population-Aligned Instance Replication
par: Eckman, Stephanie, et autres
Publié: (2025)
par: Eckman, Stephanie, et autres
Publié: (2025)
Distributed Asymmetric Allocation: A Topic Model for Large Imbalanced Corpora in Social Sciences
par: Watanabe, Kohei
Publié: (2025)
par: Watanabe, Kohei
Publié: (2025)
Automated scoring of the Ambiguous Intentions Hostility Questionnaire using fine-tuned large language models
par: Lyu, Y., et autres
Publié: (2025)
par: Lyu, Y., et autres
Publié: (2025)
A Position Paper on the Automatic Generation of Machine Learning Leaderboards
par: Timmer, Roelien C, et autres
Publié: (2025)
par: Timmer, Roelien C, et autres
Publié: (2025)
Maximizing Signal in Human-Model Preference Alignment
par: Kraus, Kelsey, et autres
Publié: (2025)
par: Kraus, Kelsey, et autres
Publié: (2025)
Differential contributions of machine learning and statistical analysis to language and cognitive sciences
par: Sun, Kun, et autres
Publié: (2024)
par: Sun, Kun, et autres
Publié: (2024)
Exploring Intra and Inter-language Consistency in Embeddings with ICA
par: Li, Rongzhi, et autres
Publié: (2024)
par: Li, Rongzhi, et autres
Publié: (2024)
Calibrate, Don't Curate: Label-Efficient Estimation from Noisy LLM Judges
par: Li, Yanran
Publié: (2026)
par: Li, Yanran
Publié: (2026)
Quantifying and Mitigating Socially Desirable Responding in LLMs: A Desirability-Matched Graded Forced-Choice Psychometric Study
par: Okada, Kensuke, et autres
Publié: (2026)
par: Okada, Kensuke, et autres
Publié: (2026)
Isolated Causal Effects of Natural Language
par: Lin, Victoria, et autres
Publié: (2024)
par: Lin, Victoria, et autres
Publié: (2024)
An Embedded Diachronic Sense Change Model with a Case Study from Ancient Greek
par: Zafar, Schyan, et autres
Publié: (2023)
par: Zafar, Schyan, et autres
Publié: (2023)
A Finite-Calibration Regime Map for LLM Judge Panels
par: Zhu, Bin, et autres
Publié: (2026)
par: Zhu, Bin, et autres
Publié: (2026)
Evaluating Patient Safety Risks in Generative AI: Development and Validation of a FMECA Framework for Generated Clinical Content
par: Bednarczyk, Lydie, et autres
Publié: (2026)
par: Bednarczyk, Lydie, et autres
Publié: (2026)
Adaptive Uncertainty Quantification for Generative AI
par: Kim, Jungeum, et autres
Publié: (2024)
par: Kim, Jungeum, et autres
Publié: (2024)
Prior Sensitivity Analysis without Model Re-fit
par: Sugasawa, Shonosuke
Publié: (2024)
par: Sugasawa, Shonosuke
Publié: (2024)
Constructing the Truth: Text Mining and Linguistic Networks in Public Hearings of Case 03 of the Special Jurisdiction for Peace (JEP)
par: Sosa, Juan, et autres
Publié: (2025)
par: Sosa, Juan, et autres
Publié: (2025)
Leveraging text data for causal inference using electronic health records
par: Mozer, Reagan, et autres
Publié: (2023)
par: Mozer, Reagan, et autres
Publié: (2023)
Measuring What Cannot Be Surveyed: LLMs as Instruments for Latent Cognitive Variables in Labor Economics
par: Maya, Cristian Espinal
Publié: (2026)
par: Maya, Cristian Espinal
Publié: (2026)
Improving Probabilistic Models in Text Classification via Active Learning
par: Bosley, Mitchell, et autres
Publié: (2022)
par: Bosley, Mitchell, et autres
Publié: (2022)
Sensitivity Analysis on Interaction Effects of Policy-Augmented Bayesian Networks
par: Zhao, Junkai, et autres
Publié: (2024)
par: Zhao, Junkai, et autres
Publié: (2024)
AutoEval Done Right: Using Synthetic Data for Model Evaluation
par: Boyeau, Pierre, et autres
Publié: (2024)
par: Boyeau, Pierre, et autres
Publié: (2024)
MPO: An Efficient Post-Processing Framework for Mixing Diverse Preference Alignment
par: Wang, Tianze, et autres
Publié: (2025)
par: Wang, Tianze, et autres
Publié: (2025)
Causal Representation Learning from Multimodal Clinical Records under Non-Random Modality Missingness
par: Liang, Zihan, et autres
Publié: (2025)
par: Liang, Zihan, et autres
Publié: (2025)
MuPlon: Multi-Path Causal Optimization for Claim Verification through Controlling Confounding
par: Guo, Hanghui, et autres
Publié: (2025)
par: Guo, Hanghui, et autres
Publié: (2025)
Using Large Language Models to Suggest Informative Prior Distributions in Bayesian Statistics
par: Riegler, Michael A., et autres
Publié: (2025)
par: Riegler, Michael A., et autres
Publié: (2025)
Documents similaires
-
Annotation Sensitivity: Training Data Collection Methods Affect Model Performance
par: Kern, Christoph, et autres
Publié: (2023) -
Documents Are People and Words Are Items: A Psychometric Approach to Textual Data with Contextual Embeddings
par: Chen, Jinsong
Publié: (2025) -
Geological Inference from Textual Data using Word Embeddings
par: Linphrachaya, Nanmanas, et autres
Publié: (2025) -
A New Semisupervised Technique for Polarity Analysis using Masked Language Models
par: Watanabe, Kohei
Publié: (2026) -
Exploring the Potential Role of Generative AI in the TRAPD Procedure for Survey Translation
par: Metheney, Erica Ann, et autres
Publié: (2024)