Gamma Mixture Modeling for Cosine Similarity in Small Language Models
Fuente:
arXiv
Guardado en:
| Autor principal: | Player, Kevin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity
por: Hinostroza, Cristian, et al.
Publicado: (2026)
por: Hinostroza, Cristian, et al.
Publicado: (2026)
The Hidden Pitfalls of the Cosine Similarity Loss
por: Draganov, Andrew, et al.
Publicado: (2024)
por: Draganov, Andrew, et al.
Publicado: (2024)
Is Cosine-Similarity of Embeddings Really About Similarity?
por: Steck, Harald, et al.
Publicado: (2024)
por: Steck, Harald, et al.
Publicado: (2024)
Variance-Adjusted Cosine Distance as Similarity Metric
por: Sahoo, Satyajeet, et al.
Publicado: (2025)
por: Sahoo, Satyajeet, et al.
Publicado: (2025)
In Defense of Cosine Similarity: Normalization Eliminates the Gauge Freedom
por: Bouhsine, Taha
Publicado: (2026)
por: Bouhsine, Taha
Publicado: (2026)
Statistical Advantages of Perturbing Cosine Router in Mixture of Experts
por: Nguyen, Huy, et al.
Publicado: (2024)
por: Nguyen, Huy, et al.
Publicado: (2024)
Semantics at an Angle: When Cosine Similarity Works Until It Doesn't
por: You, Kisung
Publicado: (2025)
por: You, Kisung
Publicado: (2025)
Outlier Detection Using Vector Cosine Similarity by Adding a Dimension
por: Shen, Zhongyang
Publicado: (2025)
por: Shen, Zhongyang
Publicado: (2025)
SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control
por: Orfanoudakis, Stavros, et al.
Publicado: (2026)
por: Orfanoudakis, Stavros, et al.
Publicado: (2026)
Surpassing Cosine Similarity for Multidimensional Comparisons: Dimension Insensitive Euclidean Metric
por: Tessari, Federico, et al.
Publicado: (2024)
por: Tessari, Federico, et al.
Publicado: (2024)
Low-Rank Tensor Approximation of Weights in Large Language Models via Cosine Lanczos Bidiagonalization
por: Ichi, A. El, et al.
Publicado: (2026)
por: Ichi, A. El, et al.
Publicado: (2026)
A TRIANGLE Enables Multimodal Alignment Beyond Cosine Similarity
por: Cicchetti, Giordano, et al.
Publicado: (2025)
por: Cicchetti, Giordano, et al.
Publicado: (2025)
The Cosine Schedule is Fisher-Rao-Optimal for Masked Discrete Diffusion Models
por: Zhang, Leo, et al.
Publicado: (2025)
por: Zhang, Leo, et al.
Publicado: (2025)
PNCS:Power-Norm Cosine Similarity for Diverse Client Selection in Federated Learning
por: Li, Liangyan, et al.
Publicado: (2025)
por: Li, Liangyan, et al.
Publicado: (2025)
Cottention: Linear Transformers With Cosine Attention
por: Mongaras, Gabriel, et al.
Publicado: (2024)
por: Mongaras, Gabriel, et al.
Publicado: (2024)
ACE: Exploring Activation Cosine Similarity and Variance for Accurate and Calibration-Efficient LLM Pruning
por: Mi, Zhendong, et al.
Publicado: (2025)
por: Mi, Zhendong, et al.
Publicado: (2025)
Beyond Cosine Similarity: Taming Semantic Drift and Antonym Intrusion in a 15-Million Node Turkish Synonym Graph
por: Tosun, Ebubekir, et al.
Publicado: (2026)
por: Tosun, Ebubekir, et al.
Publicado: (2026)
Load Balancing Mixture of Experts with Similarity Preserving Routers
por: Omi, Nabil, et al.
Publicado: (2025)
por: Omi, Nabil, et al.
Publicado: (2025)
Semantic Text Transmission via Prediction with Small Language Models: Cost-Similarity Trade-off
por: Madhabhavi, Bhavani A, et al.
Publicado: (2024)
por: Madhabhavi, Bhavani A, et al.
Publicado: (2024)
Mixture of Experts in Large Language Models
por: Zhang, Danyang, et al.
Publicado: (2025)
por: Zhang, Danyang, et al.
Publicado: (2025)
Similarity-Aware Mixture-of-Experts for Data-Efficient Continual Learning
por: Mclaughlin, Connor, et al.
Publicado: (2026)
por: Mclaughlin, Connor, et al.
Publicado: (2026)
Cosine-Similarity Routing with Semantic Anchors for Interpretable Mixture-of-Experts Language Models
por: Ternovtsii, Ivan, et al.
Publicado: (2025)
por: Ternovtsii, Ivan, et al.
Publicado: (2025)
CosineGate: Semantic Dynamic Routing via Cosine Incompatibility in Residual Networks
por: Thota, Yogeswar Reddy
Publicado: (2025)
por: Thota, Yogeswar Reddy
Publicado: (2025)
Toward Inference-optimal Mixture-of-Expert Large Language Models
por: Yun, Longfei, et al.
Publicado: (2024)
por: Yun, Longfei, et al.
Publicado: (2024)
SMolLM: Small Language Models Learn Small Molecular Grammar
por: Jindal, Akhil, et al.
Publicado: (2026)
por: Jindal, Akhil, et al.
Publicado: (2026)
Bayesian Mixture of Experts For Large Language Models
por: Dialameh, Maryam, et al.
Publicado: (2025)
por: Dialameh, Maryam, et al.
Publicado: (2025)
Mixture-of-Personas Language Models for Population Simulation
por: Bui, Ngoc, et al.
Publicado: (2025)
por: Bui, Ngoc, et al.
Publicado: (2025)
No Need to Talk: Asynchronous Mixture of Language Models
por: Filippova, Anastasiia, et al.
Publicado: (2024)
por: Filippova, Anastasiia, et al.
Publicado: (2024)
From Molecules to Mixtures: Learning Representations of Olfactory Mixture Similarity using Inductive Biases
por: Tom, Gary, et al.
Publicado: (2025)
por: Tom, Gary, et al.
Publicado: (2025)
Differentiable Mixture-of-Agents Incentivizes Swarm Intelligence of Large Language Models
por: Wu, Xingjian, et al.
Publicado: (2026)
por: Wu, Xingjian, et al.
Publicado: (2026)
Analyzing Similarity Metrics for Data Selection for Language Model Pretraining
por: Sam, Dylan, et al.
Publicado: (2025)
por: Sam, Dylan, et al.
Publicado: (2025)
When Style Similarity Scores Fail: Diagnosing Raw CSD Cosine in Artist-Style Evaluation
por: Frochte, Jörg
Publicado: (2026)
por: Frochte, Jörg
Publicado: (2026)
Scaling Laws for Upcycling Mixture-of-Experts Language Models
por: Liew, Seng Pei, et al.
Publicado: (2025)
por: Liew, Seng Pei, et al.
Publicado: (2025)
A Survey on Mixture of Experts in Large Language Models
por: Cai, Weilin, et al.
Publicado: (2024)
por: Cai, Weilin, et al.
Publicado: (2024)
HMoE: Heterogeneous Mixture of Experts for Language Modeling
por: Wang, An, et al.
Publicado: (2024)
por: Wang, An, et al.
Publicado: (2024)
Structural Inference: Interpreting Small Language Models with Susceptibilities
por: Baker, Garrett, et al.
Publicado: (2025)
por: Baker, Garrett, et al.
Publicado: (2025)
Efficient Neural Networks with Discrete Cosine Transform Activations
por: Martinez-Gost, Marc, et al.
Publicado: (2025)
por: Martinez-Gost, Marc, et al.
Publicado: (2025)
Federated Gaussian Mixture Models
por: Pettersson, Sophia Zhang, et al.
Publicado: (2025)
por: Pettersson, Sophia Zhang, et al.
Publicado: (2025)
Mixtures of Transparent Local Models
por: Diaby, Niffa Cheick Oumar, et al.
Publicado: (2026)
por: Diaby, Niffa Cheick Oumar, et al.
Publicado: (2026)
Mixture of Scales: Memory-Efficient Token-Adaptive Binarization for Large Language Models
por: Jo, Dongwon, et al.
Publicado: (2024)
por: Jo, Dongwon, et al.
Publicado: (2024)
Ejemplares similares
-
Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity
por: Hinostroza, Cristian, et al.
Publicado: (2026) -
The Hidden Pitfalls of the Cosine Similarity Loss
por: Draganov, Andrew, et al.
Publicado: (2024) -
Is Cosine-Similarity of Embeddings Really About Similarity?
por: Steck, Harald, et al.
Publicado: (2024) -
Variance-Adjusted Cosine Distance as Similarity Metric
por: Sahoo, Satyajeet, et al.
Publicado: (2025) -
In Defense of Cosine Similarity: Normalization Eliminates the Gauge Freedom
por: Bouhsine, Taha
Publicado: (2026)