Intrinsic vs. Extrinsic Evaluation of Czech Sentence Embeddings: Semantic Relevance Doesn't Help with MT Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Barančíková, Petra, Bojar, Ondřej |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
ParCzech4Speech: A New Speech Corpus Derived from Czech Parliamentary Data
par: Stankov, Vladislav, et autres
Publié: (2025)
par: Stankov, Vladislav, et autres
Publié: (2025)
Overview of the Sensemaking Task at the ELOQUENT 2025 Lab: LLMs as Teachers, Students and Evaluators
par: Šindelář, Pavel, et autres
Publié: (2025)
par: Šindelář, Pavel, et autres
Publié: (2025)
Continuous Rating as Reliable Human Evaluation of Simultaneous Speech Translation
par: Javorský, Dávid, et autres
Publié: (2022)
par: Javorský, Dávid, et autres
Publié: (2022)
Evaluating Optimal Reference Translations
par: Zouhar, Vilém, et autres
Publié: (2023)
par: Zouhar, Vilém, et autres
Publié: (2023)
Finetuning LLMs for EvaCun 2025 token prediction shared task
par: Jon, Josef, et autres
Publié: (2025)
par: Jon, Josef, et autres
Publié: (2025)
End-to-end Automatic Speech Recognition and Speech Translation: Integration of Speech Foundational Models and LLMs
par: Luu, Nam, et autres
Publié: (2025)
par: Luu, Nam, et autres
Publié: (2025)
Understanding the role of FFNs in driving multilingual behaviour in LLMs
par: Bhattacharya, Sunit, et autres
Publié: (2024)
par: Bhattacharya, Sunit, et autres
Publié: (2024)
Quality and Quantity of Machine Translation References for Automatic Metrics
par: Zouhar, Vilém, et autres
Publié: (2024)
par: Zouhar, Vilém, et autres
Publié: (2024)
Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism
par: Zhang, Haoxiang, et autres
Publié: (2026)
par: Zhang, Haoxiang, et autres
Publié: (2026)
Library Learning Doesn't: The Curious Case of the Single-Use "Library"
par: Berlot-Attwell, Ian, et autres
Publié: (2024)
par: Berlot-Attwell, Ian, et autres
Publié: (2024)
Better Late Than Never: Meta-Evaluation of Latency Metrics for Simultaneous Speech-to-Text Translation
par: Polák, Peter, et autres
Publié: (2025)
par: Polák, Peter, et autres
Publié: (2025)
Reinforcement Learning for Reasoning in Small LLMs: What Works and What Doesn't
par: Dang, Quy-Anh, et autres
Publié: (2025)
par: Dang, Quy-Anh, et autres
Publié: (2025)
ChatGPT Doesn't Trust Chargers Fans: Guardrail Sensitivity in Context
par: Li, Victoria R., et autres
Publié: (2024)
par: Li, Victoria R., et autres
Publié: (2024)
Dynamic Meta-Metrics: Source-Sentence Conditioned Weighting for MT Evaluation
par: Zhang, Luke, et autres
Publié: (2026)
par: Zhang, Luke, et autres
Publié: (2026)
Prompting LLMs: Length Control for Isometric Machine Translation
par: Javorský, Dávid, et autres
Publié: (2025)
par: Javorský, Dávid, et autres
Publié: (2025)
MockConf: A Student Interpretation Dataset: Analysis, Word- and Span-level Alignment and Baselines
par: Javorský, Dávid, et autres
Publié: (2025)
par: Javorský, Dávid, et autres
Publié: (2025)
Multimodal Shannon Game with Images
par: Zouhar, Vilém, et autres
Publié: (2023)
par: Zouhar, Vilém, et autres
Publié: (2023)
Order Doesn't Matter, But Reasoning Does: Training LLMs with Order-Centric Augmentation
par: He, Qianxi, et autres
Publié: (2025)
par: He, Qianxi, et autres
Publié: (2025)
Long-Form End-to-End Speech Translation via Latent Alignment Segmentation
par: Polák, Peter, et autres
Publié: (2023)
par: Polák, Peter, et autres
Publié: (2023)
One-Topic-Doesn't-Fit-All: Transcreating Reading Comprehension Test for Personalized Learning
par: Han, Jieun, et autres
Publié: (2025)
par: Han, Jieun, et autres
Publié: (2025)
SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs
par: Lin, Jiacheng, et autres
Publié: (2025)
par: Lin, Jiacheng, et autres
Publié: (2025)
Just Because We Camp, Doesn't Mean We Should: The Ethics of Modelling Queer Voices
par: Sigurgeirsson, Atli, et autres
Publié: (2024)
par: Sigurgeirsson, Atli, et autres
Publié: (2024)
Language Complexity and Speech Recognition Accuracy: Orthographic Complexity Hurts, Phonological Complexity Doesn't
par: Taguchi, Chihiro, et autres
Publié: (2024)
par: Taguchi, Chihiro, et autres
Publié: (2024)
Sentence Smith: Controllable Edits for Evaluating Text Embeddings
par: Li, Hongji, et autres
Publié: (2025)
par: Li, Hongji, et autres
Publié: (2025)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
par: Zhong, Qihuang, et autres
Publié: (2024)
par: Zhong, Qihuang, et autres
Publié: (2024)
IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language
par: Chance, Christina, et autres
Publié: (2026)
par: Chance, Christina, et autres
Publié: (2026)
Evaluating Unsupervised Dimensionality Reduction Methods for Pretrained Sentence Embeddings
par: Zhang, Gaifan, et autres
Publié: (2024)
par: Zhang, Gaifan, et autres
Publié: (2024)
Cross-Modal Projection in Multimodal LLMs Doesn't Really Project Visual Attributes to Textual Space
par: Verma, Gaurav, et autres
Publié: (2024)
par: Verma, Gaurav, et autres
Publié: (2024)
Why Prompt Optimization Works, and Why It Sometimes Doesn't: A Causal-Inspired Edit-Level Analysis
par: Gong, Shuzhi, et autres
Publié: (2026)
par: Gong, Shuzhi, et autres
Publié: (2026)
Analyzing Correlations Between Intrinsic and Extrinsic Bias Metrics of Static Word Embeddings With Their Measuring Biases Aligned
par: Katô, Taisei, et autres
Publié: (2024)
par: Katô, Taisei, et autres
Publié: (2024)
Corpus of Cross-lingual Dialogues with Minutes and Detection of Misunderstandings
par: Čechovič, Marko, et autres
Publié: (2025)
par: Čechovič, Marko, et autres
Publié: (2025)
BridG MT: Enhancing LLMs' Machine Translation Capabilities with Sentence Bridging and Gradual MT
par: Choi, Seung-Woo, et autres
Publié: (2024)
par: Choi, Seung-Woo, et autres
Publié: (2024)
Findings of the Third Automatic Minuting (AutoMin) Challenge
par: Shinde, Kartik, et autres
Publié: (2025)
par: Shinde, Kartik, et autres
Publié: (2025)
Training data generation for context-dependent rubric-based short answer grading
par: Šindelář, Pavel, et autres
Publié: (2026)
par: Šindelář, Pavel, et autres
Publié: (2026)
Static Word Embeddings for Sentence Semantic Representation
par: Wada, Takashi, et autres
Publié: (2025)
par: Wada, Takashi, et autres
Publié: (2025)
MTEB-French: Resources for French Sentence Embedding Evaluation and Analysis
par: Ciancone, Mathieu, et autres
Publié: (2024)
par: Ciancone, Mathieu, et autres
Publié: (2024)
Semantic Compression for Word and Sentence Embeddings using Discrete Wavelet Transform
par: Salama, Rana Aref, et autres
Publié: (2025)
par: Salama, Rana Aref, et autres
Publié: (2025)
Are ELECTRA's Sentence Embeddings Beyond Repair? The Case of Semantic Textual Similarity
par: Rep, Ivan, et autres
Publié: (2024)
par: Rep, Ivan, et autres
Publié: (2024)
Extrinsic Evaluation of Cultural Competence in Large Language Models
par: Bhatt, Shaily, et autres
Publié: (2024)
par: Bhatt, Shaily, et autres
Publié: (2024)
More Discriminative Sentence Embeddings via Semantic Graph Smoothing
par: Fettal, Chakib, et autres
Publié: (2024)
par: Fettal, Chakib, et autres
Publié: (2024)
Documents similaires
-
ParCzech4Speech: A New Speech Corpus Derived from Czech Parliamentary Data
par: Stankov, Vladislav, et autres
Publié: (2025) -
Overview of the Sensemaking Task at the ELOQUENT 2025 Lab: LLMs as Teachers, Students and Evaluators
par: Šindelář, Pavel, et autres
Publié: (2025) -
Continuous Rating as Reliable Human Evaluation of Simultaneous Speech Translation
par: Javorský, Dávid, et autres
Publié: (2022) -
Evaluating Optimal Reference Translations
par: Zouhar, Vilém, et autres
Publié: (2023) -
Finetuning LLMs for EvaCun 2025 token prediction shared task
par: Jon, Josef, et autres
Publié: (2025)