Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
Fuente:
arXiv
Saved in:
| Main Authors: | Noever, David, McKee, Forrest |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Alpha Excel Benchmark
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Transparency Attacks: How Imperceptible Image Layers Can Fool AI Perception
by: McKee, Forrest, et al.
Published: (2024)
by: McKee, Forrest, et al.
Published: (2024)
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
AirTag, You're It: Reverse Logistics and Last Mile Dynamics
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Moravec's Paradox: Towards an Auditory Turing Test
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
by: Zheng, Yicong, et al.
Published: (2025)
by: Zheng, Yicong, et al.
Published: (2025)
Can AI-Generated Text be Reliably Detected?
by: Sadasivan, Vinu Sankar, et al.
Published: (2023)
by: Sadasivan, Vinu Sankar, et al.
Published: (2023)
Novel AI Camera Camouflage: Face Cloaking Without Full Disguise
by: Noever, David, et al.
Published: (2024)
by: Noever, David, et al.
Published: (2024)
Diffusion Language Models Can Perform Many Tasks with Scaling and Instruction-Finetuning
by: Ye, Jiasheng, et al.
Published: (2023)
by: Ye, Jiasheng, et al.
Published: (2023)
Multi-Task GRPO: Reliable LLM Reasoning Across Tasks
by: Ramesh, Shyam Sundhar, et al.
Published: (2026)
by: Ramesh, Shyam Sundhar, et al.
Published: (2026)
Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies
by: Tang, Zirui, et al.
Published: (2026)
by: Tang, Zirui, et al.
Published: (2026)
Uncovering Competency Gaps in Large Language Models and Their Benchmarks
by: Bohacek, Maty, et al.
Published: (2025)
by: Bohacek, Maty, et al.
Published: (2025)
Reliable Evaluation and Benchmarks for Statement Autoformalization
by: Poiroux, Auguste, et al.
Published: (2024)
by: Poiroux, Auguste, et al.
Published: (2024)
Humor in AI: Massive Scale Crowd-Sourced Preferences and Benchmarks for Cartoon Captioning
by: Zhang, Jifan, et al.
Published: (2024)
by: Zhang, Jifan, et al.
Published: (2024)
Predicting Task Performance with Context-aware Scaling Laws
by: Montgomery, Kyle, et al.
Published: (2025)
by: Montgomery, Kyle, et al.
Published: (2025)
Beyond No: Quantifying AI Over-Refusal and Emotional Attachment Boundaries
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Gradients Must Earn Their Influence: Unifying SFT with Generalized Entropic Objectives
by: Wang, Zecheng, et al.
Published: (2026)
by: Wang, Zecheng, et al.
Published: (2026)
Infecting Generative AI With Viruses
by: Noever, David, et al.
Published: (2025)
by: Noever, David, et al.
Published: (2025)
Stop Listening to Me! How Multi-turn Conversations Can Degrade LLM Reliability
by: Guo, Kevin H., et al.
Published: (2026)
by: Guo, Kevin H., et al.
Published: (2026)
Can Language Models Discover Scaling Laws?
by: Lin, Haowei, et al.
Published: (2025)
by: Lin, Haowei, et al.
Published: (2025)
Generation Constraint Scaling Can Mitigate Hallucination
by: Kollias, Georgios, et al.
Published: (2024)
by: Kollias, Georgios, et al.
Published: (2024)
BEExAI: Benchmark to Evaluate Explainable AI
by: Sithakoul, Samuel, et al.
Published: (2024)
by: Sithakoul, Samuel, et al.
Published: (2024)
Can Generative AI Solve Your In-Context Learning Problem? A Martingale Perspective
by: Jesson, Andrew, et al.
Published: (2024)
by: Jesson, Andrew, et al.
Published: (2024)
MiMIC: Multi-Modal Indian Earnings Calls Dataset to Predict Stock Prices
by: Ghosh, Sohom, et al.
Published: (2025)
by: Ghosh, Sohom, et al.
Published: (2025)
Large Language Models Can Self-Improve At Web Agent Tasks
by: Patel, Ajay, et al.
Published: (2024)
by: Patel, Ajay, et al.
Published: (2024)
Learning from Relevant Subgoals in Successful Dialogs using Iterative Training for Task-oriented Dialog Systems
by: Kaiser, Magdalena, et al.
Published: (2024)
by: Kaiser, Magdalena, et al.
Published: (2024)
Can Generative AI Support Patients' & Caregivers' Informational Needs? Towards Task-Centric Evaluation Of AI Systems
by: Rajagopal, Shreya, et al.
Published: (2024)
by: Rajagopal, Shreya, et al.
Published: (2024)
TDBench: A Benchmark for Top-Down Image Understanding with Reliability Analysis of Vision-Language Models
by: Hou, Kaiyuan, et al.
Published: (2025)
by: Hou, Kaiyuan, et al.
Published: (2025)
Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents
by: Miao, Jiacheng, et al.
Published: (2025)
by: Miao, Jiacheng, et al.
Published: (2025)
Can LLMs Reliably Simulate Human Learner Actions? A Simulation Authoring Framework for Open-Ended Learning Environments
by: Mannekote, Amogh, et al.
Published: (2024)
by: Mannekote, Amogh, et al.
Published: (2024)
Beyond Benchmarks: On The False Promise of AI Regulation
by: Stanovsky, Gabriel, et al.
Published: (2025)
by: Stanovsky, Gabriel, et al.
Published: (2025)
Benchmarking the Medical Understanding and Reasoning of Large Language Models in Arabic Healthcare Tasks
by: AlDahoul, Nouar, et al.
Published: (2025)
by: AlDahoul, Nouar, et al.
Published: (2025)
Joint MoE Scaling Laws: Mixture of Experts Can Be Memory Efficient
by: Ludziejewski, Jan, et al.
Published: (2025)
by: Ludziejewski, Jan, et al.
Published: (2025)
Language Control Diffusion: Efficiently Scaling through Space, Time, and Tasks
by: Zhang, Edwin, et al.
Published: (2022)
by: Zhang, Edwin, et al.
Published: (2022)
Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
by: Yang, Bangji, et al.
Published: (2026)
by: Yang, Bangji, et al.
Published: (2026)
Domain-Adapted Small Language Models for Reliable Clinical Triage
by: Aljohani, Manar, et al.
Published: (2026)
by: Aljohani, Manar, et al.
Published: (2026)
Fantastic Bugs and Where to Find Them in AI Benchmarks
by: Truong, Sang, et al.
Published: (2025)
by: Truong, Sang, et al.
Published: (2025)
Similar Items
-
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
by: Noever, David, et al.
Published: (2025) -
Alpha Excel Benchmark
by: Noever, David, et al.
Published: (2025) -
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
by: Noever, David, et al.
Published: (2024) -
Transparency Attacks: How Imperceptible Image Layers Can Fool AI Perception
by: McKee, Forrest, et al.
Published: (2024) -
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
by: Noever, David, et al.
Published: (2024)