XferBench: a Data-Driven Benchmark for Emergent Language
Fuente:
arXiv
Salvato in:
| Autori principali: | Boldt, Brendon, Mortensen, David |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Morpheme Induction for Emergent Language
di: Boldt, Brendon, et al.
Pubblicazione: (2025)
di: Boldt, Brendon, et al.
Pubblicazione: (2025)
ELCC: the Emergent Language Corpus Collection
di: Boldt, Brendon, et al.
Pubblicazione: (2024)
di: Boldt, Brendon, et al.
Pubblicazione: (2024)
Searching for the Most Human-like Emergent Language
di: Boldt, Brendon, et al.
Pubblicazione: (2025)
di: Boldt, Brendon, et al.
Pubblicazione: (2025)
A Review of the Applications of Deep Learning-Based Emergent Communication
di: Boldt, Brendon, et al.
Pubblicazione: (2024)
di: Boldt, Brendon, et al.
Pubblicazione: (2024)
Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes
di: Jayawardhana, Mayuka, et al.
Pubblicazione: (2025)
di: Jayawardhana, Mayuka, et al.
Pubblicazione: (2025)
Emergent Lexical Semantics in Neural Language Models: Testing Martin's Law on LLM-Generated Text
di: Kugler, Kai
Pubblicazione: (2025)
di: Kugler, Kai
Pubblicazione: (2025)
Budget-Xfer: Budget-Constrained Source Language Selection for Cross-Lingual Transfer to African Languages
di: Idris, Tewodros Kederalah, et al.
Pubblicazione: (2026)
di: Idris, Tewodros Kederalah, et al.
Pubblicazione: (2026)
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
di: Gao, Yuxuan, et al.
Pubblicazione: (2026)
EBBS: An Ensemble with Bi-Level Beam Search for Zero-Shot Machine Translation
di: Wen, Yuqiao, et al.
Pubblicazione: (2024)
di: Wen, Yuqiao, et al.
Pubblicazione: (2024)
Exploring Model Invariance with Discrete Search for Ultra-Low-Bit Quantization
di: Wen, Yuqiao, et al.
Pubblicazione: (2025)
di: Wen, Yuqiao, et al.
Pubblicazione: (2025)
KSHSeek: Data-Driven Approaches to Mitigating and Detecting Knowledge-Shortcut Hallucinations in Generative Models
di: Liu, Zhongxin, et al.
Pubblicazione: (2025)
di: Liu, Zhongxin, et al.
Pubblicazione: (2025)
UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop
di: Shafique, Muhammad Ali, et al.
Pubblicazione: (2026)
di: Shafique, Muhammad Ali, et al.
Pubblicazione: (2026)
Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation
di: Resck, Lucas, et al.
Pubblicazione: (2026)
di: Resck, Lucas, et al.
Pubblicazione: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
di: Fadli, Samih
Pubblicazione: (2025)
di: Fadli, Samih
Pubblicazione: (2025)
Towards Alignment-Centric Paradigm: A Survey of Instruction Tuning in Large Language Models
di: Han, Xudong, et al.
Pubblicazione: (2025)
di: Han, Xudong, et al.
Pubblicazione: (2025)
D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models
di: Ubukata, Shunsuke
Pubblicazione: (2026)
di: Ubukata, Shunsuke
Pubblicazione: (2026)
MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models
di: Zhang, Luyan
Pubblicazione: (2025)
di: Zhang, Luyan
Pubblicazione: (2025)
Context-Aware Clustering using Large Language Models
di: Tipirneni, Sindhu, et al.
Pubblicazione: (2024)
di: Tipirneni, Sindhu, et al.
Pubblicazione: (2024)
Bridging the Gap: An Intermediate Language for Enhanced and Cost-Effective Grapheme-to-Phoneme Conversion with Homographs with Multiple Pronunciations Disambiguation
di: Bertina, Abbas, et al.
Pubblicazione: (2025)
di: Bertina, Abbas, et al.
Pubblicazione: (2025)
TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation
di: Du, Bangde, et al.
Pubblicazione: (2025)
di: Du, Bangde, et al.
Pubblicazione: (2025)
Character-Level Transformer for Tajik-Persian Transliteration with a Parallel Lexical Corpus
di: Arabov, Mullosharaf K.
Pubblicazione: (2026)
di: Arabov, Mullosharaf K.
Pubblicazione: (2026)
Layer-Aware Embedding Fusion for LLMs in Text Classifications
di: Gwak, Jiho, et al.
Pubblicazione: (2025)
di: Gwak, Jiho, et al.
Pubblicazione: (2025)
On the Influence of Discourse Relations in Persuasive Texts
di: Turk, Nawar, et al.
Pubblicazione: (2025)
di: Turk, Nawar, et al.
Pubblicazione: (2025)
Calibrated Confidence Estimation for Tabular Question Answering
di: Voss, Lukas
Pubblicazione: (2026)
di: Voss, Lukas
Pubblicazione: (2026)
Induce, Align, Predict: Zero-Shot Stance Detection via Cognitive Inductive Reasoning
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
EmoLoom-2B: Fast Base-Model Screening for Emotion Classification and VAD with Lexicon-Weak Supervision and KV-Off Evaluation
di: Li, Zilin, et al.
Pubblicazione: (2026)
di: Li, Zilin, et al.
Pubblicazione: (2026)
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
Mixup Model Merge: Enhancing Model Merging Performance through Randomized Linear Interpolation
di: Zhou, Yue, et al.
Pubblicazione: (2025)
di: Zhou, Yue, et al.
Pubblicazione: (2025)
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
di: Hashemi, Helia, et al.
Pubblicazione: (2024)
di: Hashemi, Helia, et al.
Pubblicazione: (2024)
Semantic Delta: An Interpretable Signal Differentiating Human and LLMs Dialogue
di: Scantamburlo, Riccardo, et al.
Pubblicazione: (2026)
di: Scantamburlo, Riccardo, et al.
Pubblicazione: (2026)
APP: Accelerated Path Patching with Task-Specific Pruning
di: Andersen, Frauke, et al.
Pubblicazione: (2025)
di: Andersen, Frauke, et al.
Pubblicazione: (2025)
propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale
di: Idahl, Maximilian, et al.
Pubblicazione: (2026)
di: Idahl, Maximilian, et al.
Pubblicazione: (2026)
IFMTBench: A Comprehensive Benchmark for Multilingual Translation Instruction Following
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
di: Sun, Mingrui, et al.
Pubblicazione: (2026)
RMGAP: Benchmarking the Generalization of Reward Models across Diverse Preferences
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
di: Zhou, Yangyang, et al.
Pubblicazione: (2026)
BoAT v2 -- A Web-Based Dependency Annotation Tool with Focus on Agglutinative Languages
di: Akkurt, Salih Furkan, et al.
Pubblicazione: (2022)
di: Akkurt, Salih Furkan, et al.
Pubblicazione: (2022)
OCRR: A Benchmark for Online Correction Recovery under Distribution Shift
di: Grassi, Adrian
Pubblicazione: (2026)
di: Grassi, Adrian
Pubblicazione: (2026)
Can AI Read Between The Lines? Benchmarking LLMs On Financial Nuance
di: Kubica, Dominick, et al.
Pubblicazione: (2025)
di: Kubica, Dominick, et al.
Pubblicazione: (2025)
Computational Economics in Large Language Models: Exploring Model Behavior and Incentive Design under Resource Constraints
di: Reddy, Sandeep, et al.
Pubblicazione: (2025)
di: Reddy, Sandeep, et al.
Pubblicazione: (2025)
Merge-Bench: Resolve Merge Conflicts with Large Language Models
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
di: Schesch, Benedikt, et al.
Pubblicazione: (2026)
Sarcasm Detection in a Less-Resourced Language
di: Đoković, Lazar, et al.
Pubblicazione: (2024)
di: Đoković, Lazar, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Morpheme Induction for Emergent Language
di: Boldt, Brendon, et al.
Pubblicazione: (2025) -
ELCC: the Emergent Language Corpus Collection
di: Boldt, Brendon, et al.
Pubblicazione: (2024) -
Searching for the Most Human-like Emergent Language
di: Boldt, Brendon, et al.
Pubblicazione: (2025) -
A Review of the Applications of Deep Learning-Based Emergent Communication
di: Boldt, Brendon, et al.
Pubblicazione: (2024) -
Transformers Boost the Performance of Decision Trees on Tabular Data across Sample Sizes
di: Jayawardhana, Mayuka, et al.
Pubblicazione: (2025)