Salvato in:
| Autori principali: | Kaneko, Masahiro, Baldwin, Timothy |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2403.16139 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
Eagle: Ethical Dataset Given from Real Interactions
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
Beyond the Resumé: A Rubric-Aware Automatic Interview System for Information Elicitation
di: Stuart, Harry, et al.
Pubblicazione: (2026)
di: Stuart, Harry, et al.
Pubblicazione: (2026)
The Gaps between Pre-train and Downstream Settings in Bias Evaluation and Debiasing
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024)
Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025)
JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks
di: Kaneko, Masahiro, et al.
Pubblicazione: (2026)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2026)
In-Contextual Gender Bias Suppression for Large Language Models
di: Oba, Daisuke, et al.
Pubblicazione: (2023)
di: Oba, Daisuke, et al.
Pubblicazione: (2023)
On the Alignment of Large Language Models with Global Human Opinion
di: Liu, Yang, et al.
Pubblicazione: (2025)
di: Liu, Yang, et al.
Pubblicazione: (2025)
Social Bias Evaluation for Large Language Models Requires Prompt Variations
di: Hida, Rem, et al.
Pubblicazione: (2024)
di: Hida, Rem, et al.
Pubblicazione: (2024)
Intent-Aware Self-Correction for Mitigating Social Biases in Large Language Models
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2025)
Psychometric Predictive Power of Large Language Models
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
Evaluating Gender Bias of Pre-trained Language Models in Natural Language Inference by Considering All Labels
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2023)
di: Anantaprayoon, Panatchakorn, et al.
Pubblicazione: (2023)
Loose LIPS Sink Ships: Asking Questions in Battleship with Language-Informed Program Sampling
di: Grand, Gabriel, et al.
Pubblicazione: (2024)
di: Grand, Gabriel, et al.
Pubblicazione: (2024)
Benchmarking Gender and Political Bias in Large Language Models
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
di: Yang, Jinrui, et al.
Pubblicazione: (2025)
Garbage Attention in Large Language Models: BOS Sink Heads and Sink-aware Pruning
di: Sok, Jaewon, et al.
Pubblicazione: (2026)
di: Sok, Jaewon, et al.
Pubblicazione: (2026)
Paraphrasing Adversarial Attack on LLM-as-a-Reviewer
di: Kaneko, Masahiro
Pubblicazione: (2026)
di: Kaneko, Masahiro
Pubblicazione: (2026)
To Sink or Not to Sink: Visual Information Pathways in Large Vision-Language Models
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
di: Luo, Jiayun, et al.
Pubblicazione: (2025)
Likelihood-based Mitigation of Evaluation Bias in Large Language Models
di: Oi, Masanari, et al.
Pubblicazione: (2024)
di: Oi, Masanari, et al.
Pubblicazione: (2024)
First Finish Search: Efficient Test-Time Scaling in Large Language Models
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
di: Agarwal, Aradhye, et al.
Pubblicazione: (2025)
Large Language Models Are Human-Like Internally
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2025)
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2025)
Uncertainty Quantification for Large Language Diffusion Models
di: Vazhentsev, Artem, et al.
Pubblicazione: (2026)
di: Vazhentsev, Artem, et al.
Pubblicazione: (2026)
Towards Transparent AI: A Survey on Explainable Large Language Models
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
Leaking LoRa: An Evaluation of Password Leaks and Knowledge Storage in Large Language Models
di: Marinelli, Ryan, et al.
Pubblicazione: (2025)
di: Marinelli, Ryan, et al.
Pubblicazione: (2025)
Does Vision Accelerate Hierarchical Generalization in Neural Language Learners?
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
di: Kuribayashi, Tatsuki, et al.
Pubblicazione: (2023)
CTR-Sink: Attention Sink for Language Models in Click-Through Rate Prediction
di: Li, Zixuan, et al.
Pubblicazione: (2025)
di: Li, Zixuan, et al.
Pubblicazione: (2025)
Large Language Models Lack Understanding of Character Composition of Words
di: Shin, Andrew, et al.
Pubblicazione: (2024)
di: Shin, Andrew, et al.
Pubblicazione: (2024)
Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation
di: Zhu, Qin, et al.
Pubblicazione: (2024)
di: Zhu, Qin, et al.
Pubblicazione: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
di: Ohi, Masanari, et al.
Pubblicazione: (2024)
Towards Transparent AI: A Survey on Explainable Language Models
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
di: Palikhe, Avash, et al.
Pubblicazione: (2025)
Don't Ignore the Tail: Decoupling top-K Probabilities for Efficient Language Model Distillation
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
di: Dasgupta, Sayantan, et al.
Pubblicazione: (2026)
A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
di: Shiotani, Taihei, et al.
Pubblicazione: (2026)
Solving NLP Problems through Human-System Collaboration: A Discussion-based Approach
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
di: Kaneko, Masahiro, et al.
Pubblicazione: (2023)
A Chinese Dataset for Evaluating the Safeguards in Large Language Models
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
di: Wang, Yuxia, et al.
Pubblicazione: (2024)
Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models
di: Binkowski, Jakub, et al.
Pubblicazione: (2026)
di: Binkowski, Jakub, et al.
Pubblicazione: (2026)
How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective
di: Peng, Runyu, et al.
Pubblicazione: (2026)
di: Peng, Runyu, et al.
Pubblicazione: (2026)
Attention Sinks in Diffusion Language Models
di: Rulli, Maximo Eduardo, et al.
Pubblicazione: (2025)
di: Rulli, Maximo Eduardo, et al.
Pubblicazione: (2025)
Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
di: Qiu, Zihan, et al.
Pubblicazione: (2025)
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
di: Wang, Renxi, et al.
Pubblicazione: (2024)
di: Wang, Renxi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025) -
Balanced Multi-Factor In-Context Learning for Multilingual Large Language Models
di: Kaneko, Masahiro, et al.
Pubblicazione: (2025) -
Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024) -
Eagle: Ethical Dataset Given from Real Interactions
di: Kaneko, Masahiro, et al.
Pubblicazione: (2024) -
Beyond the Resumé: A Rubric-Aware Automatic Interview System for Information Elicitation
di: Stuart, Harry, et al.
Pubblicazione: (2026)