GPT-4 passes most of the 297 written Polish Board Certification Examinations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Pokrywka, Jakub, Kaczmarek, Jeremi, Gorzelańczyk, Edward |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Transformer Models for Suicide Risk Detection on Social Media
par: Pokrywka, Jakub, et autres
Publié: (2024)
par: Pokrywka, Jakub, et autres
Publié: (2024)
Polish-English medical knowledge transfer: A new benchmark and results
par: Grzybowski, Łukasz, et autres
Publié: (2024)
par: Grzybowski, Łukasz, et autres
Publié: (2024)
Passage Retrieval of Polish Texts Using OKAPI BM25 and an Ensemble of Cross Encoders
par: Pokrywka, Jakub
Publié: (2024)
par: Pokrywka, Jakub
Publié: (2024)
Optimizing Retrieval-Augmented Generation of Medical Content for Spaced Repetition Learning
par: Kaczmarek, Jeremi I., et autres
Publié: (2025)
par: Kaczmarek, Jeremi I., et autres
Publié: (2025)
Punctuation Prediction for Polish Texts using Transformers
par: Pokrywka, Jakub
Publié: (2024)
par: Pokrywka, Jakub
Publié: (2024)
LLMzSzŁ: a comprehensive LLM benchmark for Polish
par: Jassem, Krzysztof, et autres
Publié: (2025)
par: Jassem, Krzysztof, et autres
Publié: (2025)
Does GPT-4 pass the Turing test?
par: Jones, Cameron R., et autres
Publié: (2023)
par: Jones, Cameron R., et autres
Publié: (2023)
Differentiate ChatGPT-generated and Human-written Medical Texts
par: Liao, Wenxiong, et autres
Publié: (2023)
par: Liao, Wenxiong, et autres
Publié: (2023)
Bielik-Q2-Sharp: A Comparative Study of Extreme 2-bit Quantization Methods for a Polish 11B Language Model
par: Prejzner, Jakub
Publié: (2026)
par: Prejzner, Jakub
Publié: (2026)
Chasing COMET: Leveraging Minimum Bayes Risk Decoding for Self-Improving Machine Translation
par: Guttmann, Kamil, et autres
Publié: (2024)
par: Guttmann, Kamil, et autres
Publié: (2024)
Polish-ASTE: Aspect-Sentiment Triplet Extraction Datasets for Polish
par: Lango, Marta, et autres
Publié: (2025)
par: Lango, Marta, et autres
Publié: (2025)
A comprehensive study of LLM-based argument classification: from LLAMA through GPT-4o to Deepseek-R1
par: Pietroń, Marcin, et autres
Publié: (2025)
par: Pietroń, Marcin, et autres
Publié: (2025)
GPTEval: A Survey on Assessments of ChatGPT and GPT-4
par: Mao, Rui, et autres
Publié: (2023)
par: Mao, Rui, et autres
Publié: (2023)
Is GPT-4 a reliable rater? Evaluating Consistency in GPT-4 Text Ratings
par: Hackl, Veronika, et autres
Publié: (2023)
par: Hackl, Veronika, et autres
Publié: (2023)
GPT-4 Technical Report
par: OpenAI, et autres
Publié: (2023)
par: OpenAI, et autres
Publié: (2023)
Evidence-Grounded Subspecialty Reasoning: Evaluating a Curated Clinical Intelligence Layer on the 2025 Endocrinology Board-Style Examination
par: Hosseinian, Amir, et autres
Publié: (2026)
par: Hosseinian, Amir, et autres
Publié: (2026)
StylOch at PAN: Gradient-Boosted Trees with Frequency-Based Stylometric Features
par: Ochab, Jeremi K., et autres
Publié: (2025)
par: Ochab, Jeremi K., et autres
Publié: (2025)
Signatures of human-like processing in Transformer forward passes
par: Hu, Jennifer, et autres
Publié: (2025)
par: Hu, Jennifer, et autres
Publié: (2025)
BERT vs GPT for financial engineering
par: Sharkey, Edward, et autres
Publié: (2024)
par: Sharkey, Edward, et autres
Publié: (2024)
Is Sanskrit the most token-efficient language? A quantitative study using GPT, Gemini, and SentencePiece
par: Kumar, Anshul
Publié: (2026)
par: Kumar, Anshul
Publié: (2026)
A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2
par: Pietroń, Marcin, et autres
Publié: (2026)
par: Pietroń, Marcin, et autres
Publié: (2026)
Examining Multimodal Gender and Content Bias in ChatGPT-4o
par: Balestri, Roberto
Publié: (2024)
par: Balestri, Roberto
Publié: (2024)
Comparative Analysis of ChatGPT, GPT-4, and Microsoft Bing Chatbots for GRE Test
par: Abu-Haifa, Mohammad, et autres
Publié: (2023)
par: Abu-Haifa, Mohammad, et autres
Publié: (2023)
PLLuM: A Family of Polish Large Language Models
par: Kocoń, Jan, et autres
Publié: (2025)
par: Kocoń, Jan, et autres
Publié: (2025)
Stylometry recognizes human and LLM-generated texts in short samples
par: Przystalski, Karol, et autres
Publié: (2025)
par: Przystalski, Karol, et autres
Publié: (2025)
AI Text Detectors and the Misclassification of Slightly Polished Arabic Text
par: Almohaimeed, Saleh, et autres
Publié: (2025)
par: Almohaimeed, Saleh, et autres
Publié: (2025)
Building another Spanish dictionary, this time with GPT-4
par: Ortega-Martín, Miguel, et autres
Publié: (2024)
par: Ortega-Martín, Miguel, et autres
Publié: (2024)
Kun: Answer Polishment for Chinese Self-Alignment with Instruction Back-Translation
par: Zheng, Tianyu, et autres
Publié: (2024)
par: Zheng, Tianyu, et autres
Publié: (2024)
ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language
par: Górski, Franciszek, et autres
Publié: (2025)
par: Górski, Franciszek, et autres
Publié: (2025)
Understanding the Role of Temperature in Diverse Question Generation by GPT-4
par: Agarwal, Arav, et autres
Publié: (2024)
par: Agarwal, Arav, et autres
Publié: (2024)
Removing RLHF Protections in GPT-4 via Fine-Tuning
par: Zhan, Qiusi, et autres
Publié: (2023)
par: Zhan, Qiusi, et autres
Publié: (2023)
Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
par: Miyai, Atsuyuki, et autres
Publié: (2026)
par: Miyai, Atsuyuki, et autres
Publié: (2026)
Self-Polish: Enhance Reasoning in Large Language Models via Problem Refinement
par: Xi, Zhiheng, et autres
Publié: (2023)
par: Xi, Zhiheng, et autres
Publié: (2023)
Polishing Every Facet of the GEM: Testing Linguistic Competence of LLMs and Humans in Korean
par: Kim, SungHo, et autres
Publié: (2025)
par: Kim, SungHo, et autres
Publié: (2025)
Can GPT-4 learn to analyse moves in research article abstracts?
par: Yu, Danni, et autres
Publié: (2024)
par: Yu, Danni, et autres
Publié: (2024)
GPT-4 on Clinic Depression Assessment: An LLM-Based Pilot Study
par: Lorenzoni, Giuliano, et autres
Publié: (2024)
par: Lorenzoni, Giuliano, et autres
Publié: (2024)
Gemini Pro Defeated by GPT-4V: Evidence from Education
par: Lee, Gyeong-Geon, et autres
Publié: (2023)
par: Lee, Gyeong-Geon, et autres
Publié: (2023)
Explainability and Certification of AI-Generated Educational Assessments
par: Yaacoub, Antoun, et autres
Publié: (2026)
par: Yaacoub, Antoun, et autres
Publié: (2026)
RogueGPT: dis-ethical tuning transforms ChatGPT4 into a Rogue AI in 158 Words
par: Buscemi, Alessio, et autres
Publié: (2024)
par: Buscemi, Alessio, et autres
Publié: (2024)
Evaluating Students' Open-ended Written Responses with LLMs: Using the RAG Framework for GPT-3.5, GPT-4, Claude-3, and Mistral-Large
par: Jauhiainen, Jussi S., et autres
Publié: (2024)
par: Jauhiainen, Jussi S., et autres
Publié: (2024)
Documents similaires
-
Evaluating Transformer Models for Suicide Risk Detection on Social Media
par: Pokrywka, Jakub, et autres
Publié: (2024) -
Polish-English medical knowledge transfer: A new benchmark and results
par: Grzybowski, Łukasz, et autres
Publié: (2024) -
Passage Retrieval of Polish Texts Using OKAPI BM25 and an Ensemble of Cross Encoders
par: Pokrywka, Jakub
Publié: (2024) -
Optimizing Retrieval-Augmented Generation of Medical Content for Spaced Repetition Learning
par: Kaczmarek, Jeremi I., et autres
Publié: (2025) -
Punctuation Prediction for Polish Texts using Transformers
par: Pokrywka, Jakub
Publié: (2024)