Single layer tiny Co$^4$ outpaces GPT-2 and GPT-BERT
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zain, Noor Ul, Raza, Mohsin, Adeel, Ahsan |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
An Overlooked Role of Context-Sensitive Dendrites
par: Raza, Mohsin, et autres
Publié: (2024)
par: Raza, Mohsin, et autres
Publié: (2024)
Context-sensitive neocortical neurons transform the effectiveness and efficiency of neural information processing
par: Ahmed, Khubaib, et autres
Publié: (2022)
par: Ahmed, Khubaib, et autres
Publié: (2022)
Monitoring the evolution of antisemitic discourse on extremist social media using BERT
par: Mustafa, Raza Ul, et autres
Publié: (2024)
par: Mustafa, Raza Ul, et autres
Publié: (2024)
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
par: Wu, Da, et autres
Publié: (2023)
par: Wu, Da, et autres
Publié: (2023)
ArabianGPT: Native Arabic GPT-based Large Language Model
par: Koubaa, Anis, et autres
Publié: (2024)
par: Koubaa, Anis, et autres
Publié: (2024)
Universal Neurons in GPT2 Language Models
par: Gurnee, Wes, et autres
Publié: (2024)
par: Gurnee, Wes, et autres
Publié: (2024)
Can GPT Redefine Medical Understanding? Evaluating GPT on Biomedical Machine Reading Comprehension
par: Vatsal, Shubham, et autres
Publié: (2024)
par: Vatsal, Shubham, et autres
Publié: (2024)
Architectural Flaw Detection in Civil Engineering Using GPT-4
par: Kumar, Saket, et autres
Publié: (2024)
par: Kumar, Saket, et autres
Publié: (2024)
GPT-4o Lacks Core Features of Theory of Mind
par: Muchovej, John, et autres
Publié: (2026)
par: Muchovej, John, et autres
Publié: (2026)
tinyBenchmarks: evaluating LLMs with fewer examples
par: Polo, Felipe Maia, et autres
Publié: (2024)
par: Polo, Felipe Maia, et autres
Publié: (2024)
Fairness of ChatGPT
par: Li, Yunqi, et autres
Publié: (2023)
par: Li, Yunqi, et autres
Publié: (2023)
Benchmarking ChatGPT on Algorithmic Reasoning
par: McLeish, Sean, et autres
Publié: (2024)
par: McLeish, Sean, et autres
Publié: (2024)
Can we trust the evaluation on ChatGPT?
par: Aiyappa, Rachith, et autres
Publié: (2023)
par: Aiyappa, Rachith, et autres
Publié: (2023)
NExT-GPT: Any-to-Any Multimodal LLM
par: Wu, Shengqiong, et autres
Publié: (2023)
par: Wu, Shengqiong, et autres
Publié: (2023)
HumanEval on Latest GPT Models -- 2024
par: Li, Daniel, et autres
Publié: (2024)
par: Li, Daniel, et autres
Publié: (2024)
Beyond Attention: Toward Machines with Intrinsic Higher Mental States
par: Adeel, Ahsan
Publié: (2025)
par: Adeel, Ahsan
Publié: (2025)
Low-Resource Languages Jailbreak GPT-4
par: Yong, Zheng-Xin, et autres
Publié: (2023)
par: Yong, Zheng-Xin, et autres
Publié: (2023)
Using Hallucinations to Bypass GPT4's Filter
par: Lemkin, Benjamin
Publié: (2024)
par: Lemkin, Benjamin
Publié: (2024)
How Prevalent is Gender Bias in ChatGPT? -- Exploring German and English ChatGPT Responses
par: Urchs, Stefanie, et autres
Publié: (2023)
par: Urchs, Stefanie, et autres
Publié: (2023)
Can We Count on LLMs? The Fixed-Effect Fallacy and Claims of GPT-4 Capabilities
par: Ball, Thomas, et autres
Publié: (2024)
par: Ball, Thomas, et autres
Publié: (2024)
Mechanistic Interpretability of GPT-like Models on Summarization Tasks
par: Mishra, Anurag
Publié: (2025)
par: Mishra, Anurag
Publié: (2025)
Anchored Answers: Unravelling Positional Bias in GPT-2's Multiple-Choice Questions
par: Li, Ruizhe, et autres
Publié: (2024)
par: Li, Ruizhe, et autres
Publié: (2024)
EvoGPT-f: An Evolutionary GPT Framework for Benchmarking Formal Math Languages
par: Mercer, Johnathan
Publié: (2024)
par: Mercer, Johnathan
Publié: (2024)
The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements
par: Zhao, Bingchen, et autres
Publié: (2025)
par: Zhao, Bingchen, et autres
Publié: (2025)
ModelGPT: Unleashing LLM's Capabilities for Tailored Model Generation
par: Tang, Zihao, et autres
Publié: (2024)
par: Tang, Zihao, et autres
Publié: (2024)
Assessing the Impact of Prompting Methods on ChatGPT's Mathematical Capabilities
par: Chen, Yuhao, et autres
Publié: (2023)
par: Chen, Yuhao, et autres
Publié: (2023)
LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, A Technical Report
par: Zhao, Justin, et autres
Publié: (2024)
par: Zhao, Justin, et autres
Publié: (2024)
If in a Crowdsourced Data Annotation Pipeline, a GPT-4
par: He, Zeyu, et autres
Publié: (2024)
par: He, Zeyu, et autres
Publié: (2024)
ChatQA: Surpassing GPT-4 on Conversational QA and RAG
par: Liu, Zihan, et autres
Publié: (2024)
par: Liu, Zihan, et autres
Publié: (2024)
CityGPT: Empowering Urban Spatial Cognition of Large Language Models
par: Feng, Jie, et autres
Publié: (2024)
par: Feng, Jie, et autres
Publié: (2024)
GPT-3 Powered Information Extraction for Building Robust Knowledge Bases
par: Choudhury, Ritabrata Roy, et autres
Publié: (2024)
par: Choudhury, Ritabrata Roy, et autres
Publié: (2024)
HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs
par: Chen, Junying, et autres
Publié: (2024)
par: Chen, Junying, et autres
Publié: (2024)
ClimateGPT: Towards AI Synthesizing Interdisciplinary Research on Climate Change
par: Thulke, David, et autres
Publié: (2024)
par: Thulke, David, et autres
Publié: (2024)
Utilizing GPT to Enhance Text Summarization: A Strategy to Minimize Hallucinations
par: Shakil, Hassan, et autres
Publié: (2024)
par: Shakil, Hassan, et autres
Publié: (2024)
Jill Watson: A Virtual Teaching Assistant powered by ChatGPT
par: Taneja, Karan, et autres
Publié: (2024)
par: Taneja, Karan, et autres
Publié: (2024)
CogGPT: Unleashing the Power of Cognitive Dynamics on Large Language Models
par: Lv, Yaojia, et autres
Publié: (2024)
par: Lv, Yaojia, et autres
Publié: (2024)
HuatuoGPT-II, One-stage Training for Medical Adaption of LLMs
par: Chen, Junying, et autres
Publié: (2023)
par: Chen, Junying, et autres
Publié: (2023)
Testing the Depth of ChatGPT's Comprehension via Cross-Modal Tasks Based on ASCII-Art: GPT3.5's Abilities in Regard to Recognizing and Generating ASCII-Art Are Not Totally Lacking
par: Bayani, David
Publié: (2023)
par: Bayani, David
Publié: (2023)
Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs
par: Sato, Ryoma
Publié: (2026)
par: Sato, Ryoma
Publié: (2026)
Evaluating the Performance of ChatGPT for Spam Email Detection
par: Si, Shijing, et autres
Publié: (2024)
par: Si, Shijing, et autres
Publié: (2024)
Documents similaires
-
An Overlooked Role of Context-Sensitive Dendrites
par: Raza, Mohsin, et autres
Publié: (2024) -
Context-sensitive neocortical neurons transform the effectiveness and efficiency of neural information processing
par: Ahmed, Khubaib, et autres
Publié: (2022) -
Monitoring the evolution of antisemitic discourse on extremist social media using BERT
par: Mustafa, Raza Ul, et autres
Publié: (2024) -
Exploring the Reversal Curse and Other Deductive Logical Reasoning in BERT and GPT-Based Large Language Models
par: Wu, Da, et autres
Publié: (2023) -
ArabianGPT: Native Arabic GPT-based Large Language Model
par: Koubaa, Anis, et autres
Publié: (2024)