Enregistré dans:
| Auteurs principaux: | González, Sergio Gómez, Domingo, Miguel, Casacuberta, Francisco |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.19583 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Comparative Evaluation of Machine Translation Systems on Images with Text
par: Puchol, Blai, et autres
Publié: (2026)
par: Puchol, Blai, et autres
Publié: (2026)
Two Spelling Normalization Approaches Based on Large Language Models
par: Domingo, Miguel, et autres
Publié: (2025)
par: Domingo, Miguel, et autres
Publié: (2025)
Segment-Based Interactive Machine Translation for Pre-trained Models
par: Navarro, Angel, et autres
Publié: (2024)
par: Navarro, Angel, et autres
Publié: (2024)
Efficient Continual Learning in Neural Machine Translation: A Low-Rank Adaptation Approach
par: Carrión, Salvador, et autres
Publié: (2025)
par: Carrión, Salvador, et autres
Publié: (2025)
DEEP: Edge-based Dataflow Processing with Hybrid Docker Hub and Regional Registries
par: Mehran, Narges, et autres
Publié: (2025)
par: Mehran, Narges, et autres
Publié: (2025)
Large-Scale Terminal Agentic Trajectory Generation from Dockerized Environments
par: Wu, Siwei, et autres
Publié: (2026)
par: Wu, Siwei, et autres
Publié: (2026)
SWE-World: Building Software Engineering Agents in Docker-Free Environments
par: Sun, Shuang, et autres
Publié: (2026)
par: Sun, Shuang, et autres
Publié: (2026)
OneKE: A Dockerized Schema-Guided LLM Agent-based Knowledge Extraction System
par: Luo, Yujie, et autres
Publié: (2024)
par: Luo, Yujie, et autres
Publié: (2024)
Evaluation of Oncotimia: An LLM based system for supporting tumour boards
par: Lorenzo, Luis, et autres
Publié: (2026)
par: Lorenzo, Luis, et autres
Publié: (2026)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
par: Yang, Jian, et autres
Publié: (2024)
par: Yang, Jian, et autres
Publié: (2024)
Detecting Errors through Ensembling Prompts (DEEP): An End-to-End LLM Framework for Detecting Factual Errors
par: Chandler, Alex, et autres
Publié: (2024)
par: Chandler, Alex, et autres
Publié: (2024)
L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution
par: Sun, Simeng, et autres
Publié: (2025)
par: Sun, Simeng, et autres
Publié: (2025)
Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
par: Chiang, Wei-Lin, et autres
Publié: (2024)
par: Chiang, Wei-Lin, et autres
Publié: (2024)
From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agents
par: Ludwig, Nikolai, et autres
Publié: (2026)
par: Ludwig, Nikolai, et autres
Publié: (2026)
Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs
par: Dekoninck, Jasper, et autres
Publié: (2026)
par: Dekoninck, Jasper, et autres
Publié: (2026)
The Story is Not the Science: Execution-Grounded Evaluation of Mechanistic Interpretability Research
par: Bai, Xiaoyan, et autres
Publié: (2026)
par: Bai, Xiaoyan, et autres
Publié: (2026)
CodeScope: An Execution-based Multilingual Multitask Multidimensional Benchmark for Evaluating LLMs on Code Understanding and Generation
par: Yan, Weixiang, et autres
Publié: (2023)
par: Yan, Weixiang, et autres
Publié: (2023)
UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs
par: He, Chaoqun, et autres
Publié: (2024)
par: He, Chaoqun, et autres
Publié: (2024)
EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
par: Hu, Xavier, et autres
Publié: (2026)
par: Hu, Xavier, et autres
Publié: (2026)
Execution-Based Evaluation of Natural Language to Bash and PowerShell for Incident Remediation
par: Vo, Ngoc Phuoc An, et autres
Publié: (2024)
par: Vo, Ngoc Phuoc An, et autres
Publié: (2024)
VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents
par: Lee, Sam Yu-Te, et autres
Publié: (2025)
par: Lee, Sam Yu-Te, et autres
Publié: (2025)
Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models
par: de Curtò, J., et autres
Publié: (2025)
par: de Curtò, J., et autres
Publié: (2025)
Reinforcement Learning Problem Solving with Large Language Models
par: Gholamian, Sina, et autres
Publié: (2024)
par: Gholamian, Sina, et autres
Publié: (2024)
Jackal: A Real-World Execution-Based Benchmark Evaluating Large Language Models on Text-to-JQL Tasks
par: Frank, Kevin, et autres
Publié: (2025)
par: Frank, Kevin, et autres
Publié: (2025)
MRAG-Suite: A Diagnostic Evaluation Platform for Visual Retrieval-Augmented Generation
par: Ji, Yuelyu, et autres
Publié: (2025)
par: Ji, Yuelyu, et autres
Publié: (2025)
Towards Personalized Evaluation of Large Language Models with An Anonymous Crowd-Sourcing Platform
par: Cheng, Mingyue, et autres
Publié: (2024)
par: Cheng, Mingyue, et autres
Publié: (2024)
Resource Management Schemes for Cloud-Native Platforms with Computing Containers of Docker and Kubernetes
par: Mao, Ying, et autres
Publié: (2020)
par: Mao, Ying, et autres
Publié: (2020)
ASPERA: A Simulated Environment to Evaluate Planning for Complex Action Execution
par: Coca, Alexandru, et autres
Publié: (2025)
par: Coca, Alexandru, et autres
Publié: (2025)
Large Language Model Critics for Execution-Free Evaluation of Code Changes
par: Yadavally, Aashish, et autres
Publié: (2025)
par: Yadavally, Aashish, et autres
Publié: (2025)
The Self-Execution Benchmark: Measuring LLMs' Attempts to Overcome Their Lack of Self-Execution
par: Ezra, Elon, et autres
Publié: (2025)
par: Ezra, Elon, et autres
Publié: (2025)
QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies
par: Khoroshilov, Alexey, et autres
Publié: (2026)
par: Khoroshilov, Alexey, et autres
Publié: (2026)
CodeHalu: Investigating Code Hallucinations in LLMs via Execution-based Verification
par: Tian, Yuchen, et autres
Publié: (2024)
par: Tian, Yuchen, et autres
Publié: (2024)
CodeBenchGen: Creating Scalable Execution-based Code Generation Benchmarks
par: Xie, Yiqing, et autres
Publié: (2024)
par: Xie, Yiqing, et autres
Publié: (2024)
MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents
par: Wang, Xuehui, et autres
Publié: (2025)
par: Wang, Xuehui, et autres
Publié: (2025)
Query and Conquer: Execution-Guided SQL Generation
par: Borchmann, Łukasz, et autres
Publié: (2025)
par: Borchmann, Łukasz, et autres
Publié: (2025)
SPEED: Speculative Pipelined Execution for Efficient Decoding
par: Hooper, Coleman, et autres
Publié: (2023)
par: Hooper, Coleman, et autres
Publié: (2023)
SUPER: Evaluating Agents on Setting Up and Executing Tasks from Research Repositories
par: Bogin, Ben, et autres
Publié: (2024)
par: Bogin, Ben, et autres
Publié: (2024)
Deflanderization for Game Dialogue: Balancing Character Authenticity with Task Execution in LLM-based NPCs
par: Buakhaw, Pasin, et autres
Publié: (2025)
par: Buakhaw, Pasin, et autres
Publié: (2025)
MGTEVAL: An Interactive Platform for Systemtic Evaluation of Machine-Generated Text Detectors
par: Li, Yuanfan, et autres
Publié: (2026)
par: Li, Yuanfan, et autres
Publié: (2026)
OpenCompass: A Universal Evaluation Platform for Large Language Models
par: Cao, Maosong, et autres
Publié: (2026)
par: Cao, Maosong, et autres
Publié: (2026)
Documents similaires
-
Comparative Evaluation of Machine Translation Systems on Images with Text
par: Puchol, Blai, et autres
Publié: (2026) -
Two Spelling Normalization Approaches Based on Large Language Models
par: Domingo, Miguel, et autres
Publié: (2025) -
Segment-Based Interactive Machine Translation for Pre-trained Models
par: Navarro, Angel, et autres
Publié: (2024) -
Efficient Continual Learning in Neural Machine Translation: A Low-Rank Adaptation Approach
par: Carrión, Salvador, et autres
Publié: (2025) -
DEEP: Edge-based Dataflow Processing with Hybrid Docker Hub and Regional Registries
par: Mehran, Narges, et autres
Publié: (2025)