Improving Commonsense Bias Classification by Mitigating the Influence of Demographic Terms
Fuente:
arXiv
Salvato in:
| Autori principali: | Lee, JinKyu, Kim, Jihie |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Word Overuse and Alignment in Large Language Models: The Influence of Learning from Human Feedback
di: Juzek, Tom S., et al.
Pubblicazione: (2025)
di: Juzek, Tom S., et al.
Pubblicazione: (2025)
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026)
di: Kim, Heejun, et al.
Pubblicazione: (2026)
Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language Explanations
di: Mahale, Ajay Pravin
Pubblicazione: (2026)
di: Mahale, Ajay Pravin
Pubblicazione: (2026)
Towards Ontology-Enhanced Representation Learning for Large Language Models
di: Ronzano, Francesco, et al.
Pubblicazione: (2024)
di: Ronzano, Francesco, et al.
Pubblicazione: (2024)
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)
di: Yang, Yibo
Pubblicazione: (2025)
AIPsy-Affect: A Keyword-Free Clinical Stimulus Battery for Mechanistic Interpretability of Emotion in Language Models
di: Keeman, Michael
Pubblicazione: (2026)
di: Keeman, Michael
Pubblicazione: (2026)
lmfaoooo at SemEval-2026 Task 1: Humor Is an Audience. Preference Modeling for Constrained Humor Generation
di: Tikhonov, Alexey, et al.
Pubblicazione: (2026)
di: Tikhonov, Alexey, et al.
Pubblicazione: (2026)
Product-of-Experts Training Reduces Dataset Artifacts in Natural Language Inference
di: Mathew, Aby Mammen
Pubblicazione: (2026)
di: Mathew, Aby Mammen
Pubblicazione: (2026)
No Memorization, No Detection: Output Distribution-Based Contamination Detection in Small Language Models
di: Sela, Omer
Pubblicazione: (2026)
di: Sela, Omer
Pubblicazione: (2026)
Communicative Agents for Slideshow Storytelling Video Generation based on LLMs
di: Fan, Jingxing, et al.
Pubblicazione: (2025)
di: Fan, Jingxing, et al.
Pubblicazione: (2025)
Integrating External Tools with Large Language Models to Improve Accuracy
di: Niketan, Nripesh, et al.
Pubblicazione: (2025)
di: Niketan, Nripesh, et al.
Pubblicazione: (2025)
Multi-Model Synthetic Training for Mission-Critical Small Language Models
di: Platt, Nolan, et al.
Pubblicazione: (2025)
di: Platt, Nolan, et al.
Pubblicazione: (2025)
IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
Fine-tuning of Large Language Models for Constituency Parsing Using a Sequence to Sequence Approach
di: Delgado, Francisco Jose Cortes, et al.
Pubblicazione: (2025)
di: Delgado, Francisco Jose Cortes, et al.
Pubblicazione: (2025)
Doğal Dil İşlemede Tokenizasyon Standartları ve Ölçümü: Türkçe Üzerinden Büyük Dil Modellerinin Karşılaştırmalı Analizi
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
Büyük Dil Modelleri için TR-MMLU Benchmarkı: Performans Değerlendirmesi, Zorluklar ve İyileştirme Fırsatları
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
di: Bayram, M. Ali, et al.
Pubblicazione: (2025)
Targeted Lexical Injection: Unlocking Latent Cross-Lingual Alignment in Lugha-Llama via Early-Layer LoRA Fine-Tuning
di: Ngugi, Stanley
Pubblicazione: (2025)
di: Ngugi, Stanley
Pubblicazione: (2025)
How Human-Like Are Large Language Models? A Register-Aware Linguistic Evaluation Framework
di: Nieth, Björn, et al.
Pubblicazione: (2026)
di: Nieth, Björn, et al.
Pubblicazione: (2026)
Manipulating Transformer-Based Models: Controllability, Steerability, and Robust Interventions
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
di: Alpay, Faruk, et al.
Pubblicazione: (2025)
Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B
di: Zhang, Xue
Pubblicazione: (2025)
di: Zhang, Xue
Pubblicazione: (2025)
Harnessing non-adversarial robustness in large language models
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
di: Zhou, Qinghua, et al.
Pubblicazione: (2026)
Detecting Sleeper Agents in Large Language Models via Semantic Drift Analysis
di: Zanbaghi, Shahin, et al.
Pubblicazione: (2025)
di: Zanbaghi, Shahin, et al.
Pubblicazione: (2025)
A Confidence-Diversity Framework for Calibrating AI Judgement in Accessible Qualitative Coding Tasks
di: Zhao, Zhilong, et al.
Pubblicazione: (2025)
di: Zhao, Zhilong, et al.
Pubblicazione: (2025)
How much do LLMs learn from negative examples?
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
di: Hamdan, Shadi, et al.
Pubblicazione: (2025)
NOTAI.AI: Explainable Detection of Machine-Generated Text via Curvature and Feature Attribution
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
di: Breneur, Oleksandr Marchenko, et al.
Pubblicazione: (2026)
Rethinking the Multilingual Reasoning Gap with Layer Swap
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
di: Lasbordes, Maxence, et al.
Pubblicazione: (2026)
Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent
di: Xia, Bowei, et al.
Pubblicazione: (2026)
di: Xia, Bowei, et al.
Pubblicazione: (2026)
Unpacking Hateful Memes: Presupposed Context and False Claims
di: Cai, Weibin, et al.
Pubblicazione: (2025)
di: Cai, Weibin, et al.
Pubblicazione: (2025)
Monotonicity as an Architectural Bias for Robust Language Models
di: Cooper, Patrick, et al.
Pubblicazione: (2026)
di: Cooper, Patrick, et al.
Pubblicazione: (2026)
Do Reasoning Models Enhance Embedding Models?
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
di: Chan, Wun Yu, et al.
Pubblicazione: (2026)
Hybrid Gated Flow (HGF): Stabilizing 1.58-bit LLMs via Selective Low-Rank Correction
di: Pizzo, David Alejandro Trejo
Pubblicazione: (2026)
di: Pizzo, David Alejandro Trejo
Pubblicazione: (2026)
ProbeScale: Probing Analysis to Optimize Neural Scaling Laws for Efficient Small Language Model Inference
di: Das, Sourav
Pubblicazione: (2026)
di: Das, Sourav
Pubblicazione: (2026)
TSDS: Data Selection for Task-Specific Model Finetuning
di: Liu, Zifan, et al.
Pubblicazione: (2024)
di: Liu, Zifan, et al.
Pubblicazione: (2024)
Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts
di: Garg, Saloni, et al.
Pubblicazione: (2026)
di: Garg, Saloni, et al.
Pubblicazione: (2026)
Measuring and curing reasoning rigidity: from decorative chain-of-thought to genuine faithfulness
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
di: Basu, Abhinaba, et al.
Pubblicazione: (2026)
NeuroState-Bench: A Human-Calibrated Benchmark for Commitment Integrity in LLM Agent Profiles
di: Jia, Xiao
Pubblicazione: (2026)
di: Jia, Xiao
Pubblicazione: (2026)
Mitigating Position-Shift Failures in Text-Based Modular Arithmetic via Position Curriculum and Template Diversity
di: Yudin, Nikolay
Pubblicazione: (2026)
di: Yudin, Nikolay
Pubblicazione: (2026)
How Pruning Reshapes Features: Sparse Autoencoder Analysis of Weight-Pruned Language Models
di: Borobia, Hector, et al.
Pubblicazione: (2026)
di: Borobia, Hector, et al.
Pubblicazione: (2026)
The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth
di: Henry, James
Pubblicazione: (2026)
di: Henry, James
Pubblicazione: (2026)
The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models
di: Wang, Zhixiang
Pubblicazione: (2025)
di: Wang, Zhixiang
Pubblicazione: (2025)
Documenti analoghi
-
Word Overuse and Alignment in Large Language Models: The Influence of Learning from Human Feedback
di: Juzek, Tom S., et al.
Pubblicazione: (2025) -
From Noise to Diversity: Random Embedding Injection in LLM Reasoning
di: Kim, Heejun, et al.
Pubblicazione: (2026) -
Causally Grounded Mechanistic Interpretability for LLMs with Faithful Natural-Language Explanations
di: Mahale, Ajay Pravin
Pubblicazione: (2026) -
Towards Ontology-Enhanced Representation Learning for Large Language Models
di: Ronzano, Francesco, et al.
Pubblicazione: (2024) -
CLMN: Concept based Language Models via Neural Symbolic Reasoning
di: Yang, Yibo
Pubblicazione: (2025)