Salvato in:
| Autori principali: | Takeshita, Masashi, Rzepka, Rafal |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2506.16187 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Speciesism in Natural Language Processing Research
di: Takeshita, Masashi, et al.
Pubblicazione: (2024)
di: Takeshita, Masashi, et al.
Pubblicazione: (2024)
Japanese Tort-case Dataset for Rationale-supported Legal Judgment Prediction
di: Yamada, Hiroaki, et al.
Pubblicazione: (2023)
di: Yamada, Hiroaki, et al.
Pubblicazione: (2023)
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026)
di: Liu, Junyu, et al.
Pubblicazione: (2026)
Evaluation Ethics of LLMs in Legal Domain
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024)
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
di: Wei, Jianhui, et al.
Pubblicazione: (2025)
LLM-jp: A Cross-organizational Project for the Research and Development of Fully Open Japanese LLMs
di: LLM-jp, et al.
Pubblicazione: (2024)
di: LLM-jp, et al.
Pubblicazione: (2024)
Extended Japanese Commonsense Morality Dataset with Masked Token and Label Enhancement
di: Ohashi, Takumi, et al.
Pubblicazione: (2024)
di: Ohashi, Takumi, et al.
Pubblicazione: (2024)
JMMMU: A Japanese Massive Multi-discipline Multimodal Understanding Benchmark for Culture-aware Evaluation
di: Onohara, Shota, et al.
Pubblicazione: (2024)
di: Onohara, Shota, et al.
Pubblicazione: (2024)
Benchmarking Large Language Models on CFLUE -- A Chinese Financial Language Understanding Evaluation Dataset
di: Zhu, Jie, et al.
Pubblicazione: (2024)
di: Zhu, Jie, et al.
Pubblicazione: (2024)
An Analysis on Automated Metrics for Evaluating Japanese-English Chat Translation
di: Rusli, Andre, et al.
Pubblicazione: (2024)
di: Rusli, Andre, et al.
Pubblicazione: (2024)
JMultiWOZ: A Large-Scale Japanese Multi-Domain Task-Oriented Dialogue Dataset
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2024)
di: Ohashi, Atsumoto, et al.
Pubblicazione: (2024)
NLP Security and Ethics, in the Wild
di: Lent, Heather, et al.
Pubblicazione: (2025)
di: Lent, Heather, et al.
Pubblicazione: (2025)
A11y-Compressor: A Framework for Enhancing the Efficiency of GUI Agent Observations through Visual Context Reconstruction and Redundancy Reduction
di: Takeshita, Michito, et al.
Pubblicazione: (2026)
di: Takeshita, Michito, et al.
Pubblicazione: (2026)
Performance Evaluation of Emotion Classification in Japanese Using RoBERTa and DeBERTa
di: Takenaka, Yoichi
Pubblicazione: (2025)
di: Takenaka, Yoichi
Pubblicazione: (2025)
KokoroChat: A Japanese Psychological Counseling Dialogue Dataset Collected via Role-Playing by Trained Counselors
di: Qi, Zhiyang, et al.
Pubblicazione: (2025)
di: Qi, Zhiyang, et al.
Pubblicazione: (2025)
M$^3$FinMeeting: A Multilingual, Multi-Sector, and Multi-Task Financial Meeting Understanding Evaluation Dataset
di: Zhu, Jie, et al.
Pubblicazione: (2025)
di: Zhu, Jie, et al.
Pubblicazione: (2025)
Evaluation of AI Ethics Tools in Language Models: A Developers' Perspective Case Study
di: Silva, Jhessica, et al.
Pubblicazione: (2025)
di: Silva, Jhessica, et al.
Pubblicazione: (2025)
JP-TL-Bench: Anchored Pairwise LLM Evaluation for Bidirectional Japanese-English Translation
di: Lin, Leonard, et al.
Pubblicazione: (2026)
di: Lin, Leonard, et al.
Pubblicazione: (2026)
SMILE: Multimodal Dataset for Understanding Laughter in Video with Language Models
di: Hyun, Lee, et al.
Pubblicazione: (2023)
di: Hyun, Lee, et al.
Pubblicazione: (2023)
Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese
di: Kawai, Masataka, et al.
Pubblicazione: (2026)
di: Kawai, Masataka, et al.
Pubblicazione: (2026)
Development of a Large-scale Dataset of Chest Computed Tomography Reports in Japanese and a High-performance Finding Classification Model
di: Yamagishi, Yosuke, et al.
Pubblicazione: (2024)
di: Yamagishi, Yosuke, et al.
Pubblicazione: (2024)
BLUCK: A Benchmark Dataset for Bengali Linguistic Understanding and Cultural Knowledge
di: Kabir, Daeen, et al.
Pubblicazione: (2025)
di: Kabir, Daeen, et al.
Pubblicazione: (2025)
Emotion and Intent Joint Understanding in Multimodal Conversation: A Benchmarking Dataset
di: Liu, Rui, et al.
Pubblicazione: (2024)
di: Liu, Rui, et al.
Pubblicazione: (2024)
Practising responsibility: Ethics in NLP as a hands-on course
di: Nissim, Malvina, et al.
Pubblicazione: (2025)
di: Nissim, Malvina, et al.
Pubblicazione: (2025)
Empirical Evaluation of Public HateSpeech Datasets
di: Jaf, Sadar, et al.
Pubblicazione: (2024)
di: Jaf, Sadar, et al.
Pubblicazione: (2024)
KokushiMD-10: Benchmark for Evaluating Large Language Models on Ten Japanese National Healthcare Licensing Examinations
di: Liu, Junyu, et al.
Pubblicazione: (2025)
di: Liu, Junyu, et al.
Pubblicazione: (2025)
Blinded Radiologist and LLM-Based Evaluation of LLM-Generated Japanese Translations of Chest CT Reports: Comparative Study
di: Yamagishi, Yosuke, et al.
Pubblicazione: (2026)
di: Yamagishi, Yosuke, et al.
Pubblicazione: (2026)
Evaluating Spatial Understanding of Large Language Models
di: Yamada, Yutaro, et al.
Pubblicazione: (2023)
di: Yamada, Yutaro, et al.
Pubblicazione: (2023)
Understanding the Role of LLMs in Multimodal Evaluation Benchmarks
di: Jiang, Botian, et al.
Pubblicazione: (2024)
di: Jiang, Botian, et al.
Pubblicazione: (2024)
Understanding and Mitigating Dataset Corruption in LLM Steering
di: Anderson, Cullen, et al.
Pubblicazione: (2026)
di: Anderson, Cullen, et al.
Pubblicazione: (2026)
Rethinking Loss Functions for Fact Verification
di: Mukobara, Yuta, et al.
Pubblicazione: (2024)
di: Mukobara, Yuta, et al.
Pubblicazione: (2024)
A Survey of Pun Generation: Datasets, Evaluations and Methodologies
di: Su, Yuchen, et al.
Pubblicazione: (2025)
di: Su, Yuchen, et al.
Pubblicazione: (2025)
Is the Top Still Spinning? Evaluating Subjectivity in Narrative Understanding
di: Subbiah, Melanie, et al.
Pubblicazione: (2025)
di: Subbiah, Melanie, et al.
Pubblicazione: (2025)
Effectiveness of Zero-shot-CoT in Japanese Prompts
di: Takayama, Shusuke, et al.
Pubblicazione: (2025)
di: Takayama, Shusuke, et al.
Pubblicazione: (2025)
Navigating LLM Ethics: Advancements, Challenges, and Future Directions
di: Jiao, Junfeng, et al.
Pubblicazione: (2024)
di: Jiao, Junfeng, et al.
Pubblicazione: (2024)
TruthEval: A Dataset to Evaluate LLM Truthfulness and Reliability
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
di: Khatun, Aisha, et al.
Pubblicazione: (2024)
Understanding Dataset Difficulty with $\mathcal{V}$-Usable Information
di: Ethayarajh, Kawin, et al.
Pubblicazione: (2021)
di: Ethayarajh, Kawin, et al.
Pubblicazione: (2021)
Understanding the Dataset Practitioners Behind Large Language Model Development
di: Qian, Crystal, et al.
Pubblicazione: (2024)
di: Qian, Crystal, et al.
Pubblicazione: (2024)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
di: Choukrani, Omar, et al.
Pubblicazione: (2025)
di: Choukrani, Omar, et al.
Pubblicazione: (2025)
Towards Understanding the Robustness of LLM-based Evaluations under Perturbations
di: Chaudhary, Manav, et al.
Pubblicazione: (2024)
di: Chaudhary, Manav, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Speciesism in Natural Language Processing Research
di: Takeshita, Masashi, et al.
Pubblicazione: (2024) -
Japanese Tort-case Dataset for Rationale-supported Legal Judgment Prediction
di: Yamada, Hiroaki, et al.
Pubblicazione: (2023) -
JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models
di: Liu, Junyu, et al.
Pubblicazione: (2026) -
Evaluation Ethics of LLMs in Legal Domain
di: Zhang, Ruizhe, et al.
Pubblicazione: (2024) -
MedEthicsQA: A Comprehensive Question Answering Benchmark for Medical Ethics Evaluation of LLMs
di: Wei, Jianhui, et al.
Pubblicazione: (2025)