Alpha Excel Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Noever, David, McKee, Forrest |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Transparency Attacks: How Imperceptible Image Layers Can Fool AI Perception
por: McKee, Forrest, et al.
Publicado: (2024)
por: McKee, Forrest, et al.
Publicado: (2024)
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Favicon Trojans: Executable Steganography Via Ico Alpha Channel Exploitation
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Novel AI Camera Camouflage: Face Cloaking Without Full Disguise
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Dueling QR Codes: The Hyding of Dr. Jeckyl
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Infecting Generative AI With Viruses
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Moravec's Paradox: Towards an Auditory Turing Test
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
AirTag, You're It: Reverse Logistics and Last Mile Dynamics
por: Noever, David, et al.
Publicado: (2025)
por: Noever, David, et al.
Publicado: (2025)
Hallucinating AI Hijacking Attack: Large Language Models and Malicious Code Recommenders
por: Noever, David, et al.
Publicado: (2024)
por: Noever, David, et al.
Publicado: (2024)
Safeguarding Voice Privacy: Harnessing Near-Ultrasonic Interference To Protect Against Unauthorized Audio Recording
por: McKee, Forrest, et al.
Publicado: (2024)
por: McKee, Forrest, et al.
Publicado: (2024)
Tiny Transformers Excel at Sentence Compression
por: Belcak, Peter, et al.
Publicado: (2024)
por: Belcak, Peter, et al.
Publicado: (2024)
Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks
por: Zheng, Yicong, et al.
Publicado: (2025)
por: Zheng, Yicong, et al.
Publicado: (2025)
DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels
por: Bai, Haolei, et al.
Publicado: (2026)
por: Bai, Haolei, et al.
Publicado: (2026)
A Method of Selective Attention for Reservoir Based Agents
por: McKee, Kevin
Publicado: (2025)
por: McKee, Kevin
Publicado: (2025)
Reservoir Computing for Fast, Simplified Reinforcement Learning on Memory Tasks
por: McKee, Kevin
Publicado: (2024)
por: McKee, Kevin
Publicado: (2024)
AI-Invented Tonal Languages: Preventing a Machine Lingua Franca Beyond Human Understanding
por: Noever, David
Publicado: (2025)
por: Noever, David
Publicado: (2025)
Warmth and competence in human-agent cooperation
por: McKee, Kevin R., et al.
Publicado: (2022)
por: McKee, Kevin R., et al.
Publicado: (2022)
Automatic Macro Mining from Interaction Traces at Scale
por: Huang, Forrest, et al.
Publicado: (2023)
por: Huang, Forrest, et al.
Publicado: (2023)
Confidence-Aware Sub-Structure Beam Search (CABS): Mitigating Hallucination in Structured Data Generation with Large Language Models
por: Wei, Chengwei, et al.
Publicado: (2024)
por: Wei, Chengwei, et al.
Publicado: (2024)
Physically Interpretable AlphaEarth Foundation Model Embeddings Enable LLM-Based Land Surface Intelligence
por: Rahman, Mashrekur
Publicado: (2026)
por: Rahman, Mashrekur
Publicado: (2026)
Interchangeable Token Embeddings for Extendable Vocabulary and Alpha-Equivalence
por: Işık, İlker, et al.
Publicado: (2024)
por: Işık, İlker, et al.
Publicado: (2024)
AlphaApollo: A System for Deep Agentic Reasoning
por: Zhou, Zhanke, et al.
Publicado: (2025)
por: Zhou, Zhanke, et al.
Publicado: (2025)
SAEBench: A Comprehensive Benchmark for Sparse Autoencoders in Language Model Interpretability
por: Karvonen, Adam, et al.
Publicado: (2025)
por: Karvonen, Adam, et al.
Publicado: (2025)
AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization
por: Wu, Junkang, et al.
Publicado: (2024)
por: Wu, Junkang, et al.
Publicado: (2024)
Benchmarking Distilled Language Models: Performance and Efficiency in Resource-Constrained Settings
por: Wani, Sachin Gopal, et al.
Publicado: (2026)
por: Wani, Sachin Gopal, et al.
Publicado: (2026)
PICS: Pipeline for Image Captioning and Search
por: Rosario, Grant, et al.
Publicado: (2024)
por: Rosario, Grant, et al.
Publicado: (2024)
Code Generation with AlphaCodium: From Prompt Engineering to Flow Engineering
por: Ridnik, Tal, et al.
Publicado: (2024)
por: Ridnik, Tal, et al.
Publicado: (2024)
Benchmarking ChatGPT on Algorithmic Reasoning
por: McLeish, Sean, et al.
Publicado: (2024)
por: McLeish, Sean, et al.
Publicado: (2024)
AlphaDecay: Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs
por: He, Di, et al.
Publicado: (2025)
por: He, Di, et al.
Publicado: (2025)
Electrooptical Image Synthesis from SAR Imagery Using Generative Adversarial Networks
por: Rosario, Grant, et al.
Publicado: (2024)
por: Rosario, Grant, et al.
Publicado: (2024)
Benchmarking LLMs' Judgments with No Gold Standard
por: Xu, Shengwei, et al.
Publicado: (2024)
por: Xu, Shengwei, et al.
Publicado: (2024)
Efficacy of Synthetic Data as a Benchmark
por: Maheshwari, Gaurav, et al.
Publicado: (2024)
por: Maheshwari, Gaurav, et al.
Publicado: (2024)
Privacy Evaluation Benchmarks for NLP Models
por: Huang, Wei, et al.
Publicado: (2024)
por: Huang, Wei, et al.
Publicado: (2024)
How Reliable is Language Model Micro-Benchmarking?
por: Yauney, Gregory, et al.
Publicado: (2025)
por: Yauney, Gregory, et al.
Publicado: (2025)
AutoBencher: Towards Declarative Benchmark Construction
por: Li, Xiang Lisa, et al.
Publicado: (2024)
por: Li, Xiang Lisa, et al.
Publicado: (2024)
Benchmarking and Understanding Compositional Relational Reasoning of LLMs
por: Ni, Ruikang, et al.
Publicado: (2024)
por: Ni, Ruikang, et al.
Publicado: (2024)
NLP-ADBench: NLP Anomaly Detection Benchmark
por: Li, Yuangang, et al.
Publicado: (2024)
por: Li, Yuangang, et al.
Publicado: (2024)
Ejemplares similares
-
Can AI Freelancers Compete? Benchmarking Earnings, Reliability, and Task Success at Scale
por: Noever, David, et al.
Publicado: (2025) -
Exploiting Alpha Transparency In Language And Vision-Based AI Systems
por: Noever, David, et al.
Publicado: (2024) -
Forbidden Science: Dual-Use AI Challenge Benchmark and Scientific Refusal Tests
por: Noever, David, et al.
Publicado: (2025) -
Transparency Attacks: How Imperceptible Image Layers Can Fool AI Perception
por: McKee, Forrest, et al.
Publicado: (2024) -
The Impossible Test: A 2024 Unsolvable Dataset and A Chance for an AGI Quiz
por: Noever, David, et al.
Publicado: (2024)