Outliers Dimensions that Disrupt Transformers Are Driven by Frequency
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Puccetti, Giovanni, Rogers, Anna, Drozd, Aleksandr, Dell'Orletta, Felice |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
AI "News" Content Farms Are Easy to Make and Hard to Detect: A Case Study in Italian
par: Puccetti, Giovanni, et autres
Publié: (2024)
par: Puccetti, Giovanni, et autres
Publié: (2024)
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
par: Pedrotti, Andrea, et autres
Publié: (2025)
par: Pedrotti, Andrea, et autres
Publié: (2025)
Linguistic Profiling of a Neural Language Model
par: Miaschi, Alessio, et autres
Publié: (2020)
par: Miaschi, Alessio, et autres
Publié: (2020)
Linguistic Knowledge Can Enhance Encoder-Decoder Models (If You Let It)
par: Miaschi, Alessio, et autres
Publié: (2024)
par: Miaschi, Alessio, et autres
Publié: (2024)
Linguistically-driven Selection of Correct Arcs for Dependency Parsing
par: Felice Dell’Orletta
Publié: (2013)
par: Felice Dell’Orletta
Publié: (2013)
Contextualized Counterspeech: Strategies for Adaptation, Personalization, and Evaluation
par: Cima, Lorenzo, et autres
Publié: (2024)
par: Cima, Lorenzo, et autres
Publié: (2024)
Leveraging Encoder-only Large Language Models for Mobile App Review Feature Extraction
par: Motger, Quim, et autres
Publié: (2024)
par: Motger, Quim, et autres
Publié: (2024)
Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation
par: Moroni, Luca, et autres
Publié: (2025)
par: Moroni, Luca, et autres
Publié: (2025)
Outlier Dimensions Encode Task-Specific Knowledge
par: Rudman, William, et autres
Publié: (2023)
par: Rudman, William, et autres
Publié: (2023)
Fine-tuning with HED-IT: The impact of human post-editing for dialogical language models
par: Occhipinti, Daniela, et autres
Publié: (2024)
par: Occhipinti, Daniela, et autres
Publié: (2024)
Adaptive Rigor in AI System Evaluation using Temperature-Controlled Verdict Aggregation via Generalized Power Mean
par: Meshkov, Aleksandr
Publié: (2026)
par: Meshkov, Aleksandr
Publié: (2026)
Is It a Free Lunch for Removing Outliers during Pretraining?
par: Liao, Baohao, et autres
Publié: (2024)
par: Liao, Baohao, et autres
Publié: (2024)
Rethinking the Outlier Distribution in Large Language Models: An In-depth Study
par: Raman, Rahul, et autres
Publié: (2025)
par: Raman, Rahul, et autres
Publié: (2025)
From Noise to Signal: When Outliers Seed New Topics
par: Zve, Evangelia, et autres
Publié: (2026)
par: Zve, Evangelia, et autres
Publié: (2026)
T-FREX: A Transformer-based Feature Extraction Method from Mobile App Reviews
par: Motger, Quim, et autres
Publié: (2024)
par: Motger, Quim, et autres
Publié: (2024)
Identifying Narrative Patterns and Outliers in Holocaust Testimonies Using Topic Modeling
par: Ifergan, Maxim, et autres
Publié: (2024)
par: Ifergan, Maxim, et autres
Publié: (2024)
Anti-Length Shift: Dynamic Outlier Truncation for Training Efficient Reasoning Models
par: Wu, Wei, et autres
Publié: (2026)
par: Wu, Wei, et autres
Publié: (2026)
Systematic Outliers in Large Language Models
par: An, Yongqi, et autres
Publié: (2025)
par: An, Yongqi, et autres
Publié: (2025)
BATQuant: Outlier-resilient MXFP4 Quantization via Learnable Block-wise Optimization
par: Li, Ji-Fu, et autres
Publié: (2026)
par: Li, Ji-Fu, et autres
Publié: (2026)
A Review on the Applications of Transformer-based language models for Nucleotide Sequence Analysis
par: Ghosh, Nimisha, et autres
Publié: (2024)
par: Ghosh, Nimisha, et autres
Publié: (2024)
FROST: Filtering Reasoning Outliers with Attention for Efficient Reasoning
par: Luo, Haozheng, et autres
Publié: (2026)
par: Luo, Haozheng, et autres
Publié: (2026)
Outlier-weighed Layerwise Sampling for LLM Fine-tuning
par: Li, Pengxiang, et autres
Publié: (2024)
par: Li, Pengxiang, et autres
Publié: (2024)
Empaths at SemEval-2025 Task 11: Retrieval-Augmented Approach to Perceived Emotions Prediction
par: Morozov, Lev, et autres
Publié: (2025)
par: Morozov, Lev, et autres
Publié: (2025)
Semantic-Driven Topic Modeling Using Transformer-Based Embeddings and Clustering Algorithms
par: Mersha, Melkamu Abay, et autres
Publié: (2024)
par: Mersha, Melkamu Abay, et autres
Publié: (2024)
TripTide: A Benchmark for Adaptive Travel Planning under Disruptions
par: Karmakar, Priyanshu, et autres
Publié: (2025)
par: Karmakar, Priyanshu, et autres
Publié: (2025)
SPARQL Query Generation with LLMs: Measuring the Impact of Training Data Memorization and Knowledge Injection
par: Gashkov, Aleksandr, et autres
Publié: (2025)
par: Gashkov, Aleksandr, et autres
Publié: (2025)
Enhancing multimodal analogical reasoning with Logic Augmented Generation
par: Lippolis, Anna Sofia, et autres
Publié: (2025)
par: Lippolis, Anna Sofia, et autres
Publié: (2025)
Separating Tongue from Thought: Activation Patching Reveals Language-Agnostic Concept Representations in Transformers
par: Dumas, Clément, et autres
Publié: (2024)
par: Dumas, Clément, et autres
Publié: (2024)
Affective Computing Has Changed: The Foundation Model Disruption
par: Schuller, Björn, et autres
Publié: (2024)
par: Schuller, Björn, et autres
Publié: (2024)
Outliers and Calibration Sets have Diminishing Effect on Quantization of Modern LLMs
par: Paglieri, Davide, et autres
Publié: (2024)
par: Paglieri, Davide, et autres
Publié: (2024)
Executable Ontologies: Synthesizing Event Semantics with Dataflow Architecture
par: Boldachev, Aleksandr
Publié: (2025)
par: Boldachev, Aleksandr
Publié: (2025)
Domain Specialization as the Key to Make Large Language Models Disruptive: A Comprehensive Survey
par: Ling, Chen, et autres
Publié: (2023)
par: Ling, Chen, et autres
Publié: (2023)
WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models
par: Yu, Yongan, et autres
Publié: (2025)
par: Yu, Yongan, et autres
Publié: (2025)
Large Language Models in the Task of Automatic Validation of Text Classifier Predictions
par: Tsymbalov, Aleksandr, et autres
Publié: (2025)
par: Tsymbalov, Aleksandr, et autres
Publié: (2025)
Opir: Efficient Multi-Task Safety Classification for Toxicity, Jailbreaks, Hate Speech, and Harmful Content
par: Stepanov, Ihor, et autres
Publié: (2026)
par: Stepanov, Ihor, et autres
Publié: (2026)
Text-to-SPARQL Goes Beyond English: Multilingual Question Answering Over Knowledge Graphs through Human-Inspired Reasoning
par: Perevalov, Aleksandr, et autres
Publié: (2025)
par: Perevalov, Aleksandr, et autres
Publié: (2025)
Enhancing Debunking Effectiveness through LLM-based Personality Adaptation
par: Dell'Oglio, Pietro, et autres
Publié: (2026)
par: Dell'Oglio, Pietro, et autres
Publié: (2026)
The Arabic Generality Score: Another Dimension of Modeling Arabic Dialectness
par: Shaban, Sanad, et autres
Publié: (2025)
par: Shaban, Sanad, et autres
Publié: (2025)
HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs
par: Liu, Jiaxin, et autres
Publié: (2025)
par: Liu, Jiaxin, et autres
Publié: (2025)
High-Dimension Human Value Representation in Large Language Models
par: Cahyawijaya, Samuel, et autres
Publié: (2024)
par: Cahyawijaya, Samuel, et autres
Publié: (2024)
Documents similaires
-
AI "News" Content Farms Are Easy to Make and Hard to Detect: A Case Study in Italian
par: Puccetti, Giovanni, et autres
Publié: (2024) -
Stress-testing Machine Generated Text Detection: Shifting Language Models Writing Style to Fool Detectors
par: Pedrotti, Andrea, et autres
Publié: (2025) -
Linguistic Profiling of a Neural Language Model
par: Miaschi, Alessio, et autres
Publié: (2020) -
Linguistic Knowledge Can Enhance Encoder-Decoder Models (If You Let It)
par: Miaschi, Alessio, et autres
Publié: (2024) -
Linguistically-driven Selection of Correct Arcs for Dependency Parsing
par: Felice Dell’Orletta
Publié: (2013)