Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Chen, Xu, Ruping, Li, Ruizhe, Cao, Bin, Fan, Jing |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
por: Fan, Zhiting, et al.
Publicado: (2024)
por: Fan, Zhiting, et al.
Publicado: (2024)
BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs
por: Fan, Zhiting, et al.
Publicado: (2024)
por: Fan, Zhiting, et al.
Publicado: (2024)
Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models
por: Cao, Bin, et al.
Publicado: (2026)
por: Cao, Bin, et al.
Publicado: (2026)
BizBench: A Quantitative Reasoning Benchmark for Business and Finance
por: Koncel-Kedziorski, Rik, et al.
Publicado: (2023)
por: Koncel-Kedziorski, Rik, et al.
Publicado: (2023)
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
por: Lu, Guilong, et al.
Publicado: (2025)
por: Lu, Guilong, et al.
Publicado: (2025)
BiasGuard: A Reasoning-enhanced Bias Detection Tool For Large Language Models
por: Fan, Zhiting, et al.
Publicado: (2025)
por: Fan, Zhiting, et al.
Publicado: (2025)
SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures
por: Wang, Jiaming, et al.
Publicado: (2025)
por: Wang, Jiaming, et al.
Publicado: (2025)
FGTR: Fine-Grained Multi-Table Retrieval via Hierarchical LLM Reasoning
por: Sun, Chaojie, et al.
Publicado: (2026)
por: Sun, Chaojie, et al.
Publicado: (2026)
RuleArena: A Benchmark for Rule-Guided Reasoning with LLMs in Real-World Scenarios
por: Zhou, Ruiwen, et al.
Publicado: (2024)
por: Zhou, Ruiwen, et al.
Publicado: (2024)
DIF: A Framework for Benchmarking and Verifying Implicit Bias in LLMs
por: Yin, Lake, et al.
Publicado: (2025)
por: Yin, Lake, et al.
Publicado: (2025)
On Higher Order Busy Beaver Function
por: Cao, Zining
Publicado: (2025)
por: Cao, Zining
Publicado: (2025)
Beyond IVR: Benchmarking Customer Support LLM Agents for Business-Adherence
por: Balaji, Sumanth, et al.
Publicado: (2026)
por: Balaji, Sumanth, et al.
Publicado: (2026)
DABL: Detecting Semantic Anomalies in Business Processes Using Large Language Models
por: Guan, Wei, et al.
Publicado: (2024)
por: Guan, Wei, et al.
Publicado: (2024)
Business Logic-Driven Text-to-SQL Data Synthesis for Business Intelligence
por: Liu, Jinhui, et al.
Publicado: (2026)
por: Liu, Jinhui, et al.
Publicado: (2026)
Towards a Benchmark for Large Language Models for Business Process Management Tasks
por: Busch, Kiran, et al.
Publicado: (2024)
por: Busch, Kiran, et al.
Publicado: (2024)
Hybrid LLM/Rule-based Approaches to Business Insights Generation from Structured Data
por: Vertsel, Aliaksei, et al.
Publicado: (2024)
por: Vertsel, Aliaksei, et al.
Publicado: (2024)
Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain
por: Li, Yue, et al.
Publicado: (2025)
por: Li, Yue, et al.
Publicado: (2025)
LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models
por: Li, Haitao, et al.
Publicado: (2024)
por: Li, Haitao, et al.
Publicado: (2024)
DataLab: A Unified Platform for LLM-Powered Business Intelligence
por: Weng, Luoxuan, et al.
Publicado: (2024)
por: Weng, Luoxuan, et al.
Publicado: (2024)
FairSteer: Inference Time Debiasing for LLMs with Dynamic Activation Steering
por: Li, Yichen, et al.
Publicado: (2025)
por: Li, Yichen, et al.
Publicado: (2025)
Simulation to Rules: A Dual-VLM Framework for Formal Visual Planning
por: Hao, Yilun, et al.
Publicado: (2025)
por: Hao, Yilun, et al.
Publicado: (2025)
Complete Evidence Extraction with Model Ensembles: A Case Study on Medical Coding
por: Beckh, Katharina, et al.
Publicado: (2025)
por: Beckh, Katharina, et al.
Publicado: (2025)
CFBench: A Comprehensive Constraints-Following Benchmark for LLMs
por: Zhang, Tao, et al.
Publicado: (2024)
por: Zhang, Tao, et al.
Publicado: (2024)
LLMs for Explainable Business Decision-Making: A Reinforcement Learning Fine-Tuning Approach
por: Cheng, Xiang, et al.
Publicado: (2025)
por: Cheng, Xiang, et al.
Publicado: (2025)
FB-Bench: A Fine-Grained Multi-Task Benchmark for Evaluating LLMs' Responsiveness to Human Feedback
por: Li, Youquan, et al.
Publicado: (2024)
por: Li, Youquan, et al.
Publicado: (2024)
A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research
por: Ludwig, Stephan, et al.
Publicado: (2026)
por: Ludwig, Stephan, et al.
Publicado: (2026)
BiasFilter: An Inference-Time Debiasing Framework for Large Language Models
por: Cheng, Xiaoqing, et al.
Publicado: (2025)
por: Cheng, Xiaoqing, et al.
Publicado: (2025)
A Framework for Processing Textual Descriptions of Business Processes using a Constrained Language -- Technical Report
por: Burattin, Andrea, et al.
Publicado: (2025)
por: Burattin, Andrea, et al.
Publicado: (2025)
LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts
por: Chen, Junhao, et al.
Publicado: (2025)
por: Chen, Junhao, et al.
Publicado: (2025)
Text Prompt Injection of Vision Language Models
por: Zhu, Ruizhe
Publicado: (2025)
por: Zhu, Ruizhe
Publicado: (2025)
SGR: A Stepwise Reasoning Framework for LLMs with External Subgraph Generation
por: Zhang, Xin, et al.
Publicado: (2026)
por: Zhang, Xin, et al.
Publicado: (2026)
Culturally-Aware Conversations: A Framework & Benchmark for LLMs
por: Havaldar, Shreya, et al.
Publicado: (2025)
por: Havaldar, Shreya, et al.
Publicado: (2025)
CRMWeaver: Building Powerful Business Agent via Agentic RL and Shared Memories
por: Lai, Yilong, et al.
Publicado: (2025)
por: Lai, Yilong, et al.
Publicado: (2025)
A Survey on Large Language Model Benchmarks
por: Ni, Shiwen, et al.
Publicado: (2025)
por: Ni, Shiwen, et al.
Publicado: (2025)
Data-adaptive Safety Rules for Training Reward Models
por: Li, Xiaomin, et al.
Publicado: (2025)
por: Li, Xiaomin, et al.
Publicado: (2025)
MetaRuleGPT: Recursive Numerical Reasoning of Language Models Trained with Simple Rules
por: Chen, Kejie, et al.
Publicado: (2024)
por: Chen, Kejie, et al.
Publicado: (2024)
FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability
por: Xia, Congying, et al.
Publicado: (2024)
por: Xia, Congying, et al.
Publicado: (2024)
DECIDER: A Dual-System Rule-Controllable Decoding Framework for Language Generation
por: Xu, Chen, et al.
Publicado: (2024)
por: Xu, Chen, et al.
Publicado: (2024)
Revisiting Backdoor Attacks on LLMs: A Stealthy and Practical Poisoning Framework via Harmless Inputs
por: Kong, Jiawei, et al.
Publicado: (2025)
por: Kong, Jiawei, et al.
Publicado: (2025)
BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses
por: Xu, Xin, et al.
Publicado: (2025)
por: Xu, Xin, et al.
Publicado: (2025)
Ejemplares similares
-
FairMT-Bench: Benchmarking Fairness for Multi-turn Dialogue in Conversational LLMs
por: Fan, Zhiting, et al.
Publicado: (2024) -
BiasAlert: A Plug-and-play Tool for Social Bias Detection in LLMs
por: Fan, Zhiting, et al.
Publicado: (2024) -
Orthogonal Hierarchical Decomposition for Structure-Aware Table Understanding with Large Language Models
por: Cao, Bin, et al.
Publicado: (2026) -
BizBench: A Quantitative Reasoning Benchmark for Business and Finance
por: Koncel-Kedziorski, Rik, et al.
Publicado: (2023) -
BizFinBench: A Business-Driven Real-World Financial Benchmark for Evaluating LLMs
por: Lu, Guilong, et al.
Publicado: (2025)