Sampling-based Pseudo-Likelihood for Membership Inference Attacks
Fuente:
arXiv
Salvato in:
| Autori principali: | Kaneko, Masahiro, Ma, Youmi, Wata, Yuki, Okazaki, Naoaki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Machine Text Detectors are Membership Inference Attacks
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models
di: Ma, Youmi, et al.
Pubblicazione: (2026)
di: Ma, Youmi, et al.
Pubblicazione: (2026)
Building a Japanese Document-Level Relation Extraction Dataset Assisted by Cross-Lingual Transfer
di: Ma, Youmi, et al.
Pubblicazione: (2024)
di: Ma, Youmi, et al.
Pubblicazione: (2024)
Evaluating Gender Bias of Pre-trained Language Models in Natural Language Inference by Considering All Labels
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2023)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2023)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)
di: Oi, Masanari, et al.
Pubblicazione: (2024)
Solving NLP Problems through Human-System Collaboration: A Discussion-based Approach
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
Social Bias Evaluation for Large Language Models Requires Prompt Variations
di: Hida, Rem, et al.
Pubblicazione: (2024)
di: Hida, Rem, et al.
Pubblicazione: (2024)
A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
OUTFOX: LLM-Generated Essay Detection Through In-Context Learning with Adversarially Generated Examples
di: Koike, Ryuto, et al.
Pubblicazione: (2023)
di: Koike, Ryuto, et al.
Pubblicazione: (2023)
How You Prompt Matters! Even Task-Oriented Constraints in Instructions Affect LLM-Generated Text Detection
di: Koike, Ryuto, et al.
Pubblicazione: (2023)
di: Koike, Ryuto, et al.
Pubblicazione: (2023)
SAIE Framework: Support Alone Isn't Enough -- Advancing LLM Training with Adversarial Remarks
di: Loem, Mengsay, et al.
Pubblicazione: (2023)
di: Loem, Mengsay, et al.
Pubblicazione: (2023)
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
Synthesizing Instruction-Tuning Datasets with Contrastive Decoding
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
di: Ichinose, Tatsuya, et al.
Pubblicazione: (2026)
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
LLM Output Detectability and Task Performance Can be Jointly Optimized
di: Saito, Koshiro, et al.
Pubblicazione: (2026)
di: Saito, Koshiro, et al.
Pubblicazione: (2026)
Stopping Computation for Converged Tokens in Masked Diffusion-LM Decoding
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
ExaGPT: Example-Based Machine-Generated Text Detection for Human Interpretability
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
di: Koike, Ryuto, et al.
Pubblicazione: (2025)
JUBAKU: An Adversarial Benchmark for Exposing Culturally Grounded Stereotypes in Japanese LLMs
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
Knowledge of Pretrained Language Models on Surface Information of Tokens
di: Hiraoka, Tatsuya, et al.
Pubblicazione: (2024)
di: Hiraoka, Tatsuya, et al.
Pubblicazione: (2024)
Tokenization as Finite-State Transduction
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
Paraphrasing Adversarial Attack on LLM-as-a-Reviewer
di: Kaneko, Masahiro
Pubblicazione: (2026)
di: Kaneko, Masahiro
Pubblicazione: (2026)
Decoding-Free Sampling Strategies for LLM Marginalization
di: Pohl, David, et al.
Pubblicazione: (2025)
di: Pohl, David, et al.
Pubblicazione: (2025)
Distributional Properties of Subword Regularization
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
Bit-level BPE: Below the byte boundary
di: Moon, Sangwhan, et al.
Pubblicazione: (2025)
di: Moon, Sangwhan, et al.
Pubblicazione: (2025)
QuantumBench: A Benchmark for Quantum Problem Solving
di: Minami, Shunya, et al.
Pubblicazione: (2025)
di: Minami, Shunya, et al.
Pubblicazione: (2025)
Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Drifting Objectives for Refining Discrete Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Diffusion-State Policy Optimization for Masked Diffusion Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
di: Oba, Daisuke, et al.
Pubblicazione: (2026)
Membership Inference Attacks Against In-Context Learning
di: Wen, Rui, et al.
Pubblicazione: (2024)
di: Wen, Rui, et al.
Pubblicazione: (2024)
ReCaLL: Membership Inference via Relative Conditional Log-Likelihoods
di: Xie, Roy, et al.
Pubblicazione: (2024)
di: Xie, Roy, et al.
Pubblicazione: (2024)
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Do Membership Inference Attacks Work on Large Language Models?
di: Duan, Michael, et al.
Pubblicazione: (2024)
di: Duan, Michael, et al.
Pubblicazione: (2024)
Two Counterexamples to Tokenization and the Noiseless Channel
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
di: Cognetta, Marco, et al.
Pubblicazione: (2024)
Boundary-targeted Membership Inference Attacks on Safety Classifiers
di: Hughes, Anthony, et al.
Pubblicazione: (2026)
di: Hughes, Anthony, et al.
Pubblicazione: (2026)
Aligning Tree-Search Policies with Fixed Token Budgets in Test-Time Scaling of LLMs
di: Miyamoto, Sora, et al.
Pubblicazione: (2026)
di: Miyamoto, Sora, et al.
Pubblicazione: (2026)
Membership Inference Attacks and Privacy in Topic Modeling
di: Manzonelli, Nico, et al.
Pubblicazione: (2024)
di: Manzonelli, Nico, et al.
Pubblicazione: (2024)
Membership Inference Attacks on LLM-based Recommender Systems
di: He, Jiajie, et al.
Pubblicazione: (2025)
di: He, Jiajie, et al.
Pubblicazione: (2025)
Membership Inference Attack against Long-Context Large Language Models
di: Wang, Zixiong, et al.
Pubblicazione: (2024)
di: Wang, Zixiong, et al.
Pubblicazione: (2024)
JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks
di: Kaneko, Masahiro, et al.
Pubblicazione: (2026)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Machine Text Detectors are Membership Inference Attacks
di: Koike, Ryuto, et al.
Pubblicazione: (2025) -
From Interpretability to Performance: Optimizing Retrieval Heads for Long-Context Language Models
di: Ma, Youmi, et al.
Pubblicazione: (2026) -
Building a Japanese Document-Level Relation Extraction Dataset Assisted by Cross-Lingual Transfer
di: Ma, Youmi, et al.
Pubblicazione: (2024) -
Evaluating Gender Bias of Pre-trained Language Models in Natural Language Inference by Considering All Labels
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2023) -
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)