SalesSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators
Fuente:
arXiv
Salvato in:
| Autori principali: | Pruksachatkun, Yada, Wan, Elaine, Chen, Lyanna, Chang, Kai-Wei, Wu, Chien-Sheng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation
di: Li, Yu, et al.
Pubblicazione: (2026)
di: Li, Yu, et al.
Pubblicazione: (2026)
The Need for a Socially-Grounded Persona Framework for User Simulation
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2026)
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2026)
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
di: Wan, Yixin, et al.
Pubblicazione: (2025)
di: Wan, Yixin, et al.
Pubblicazione: (2025)
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
di: Wan, Yixin, et al.
Pubblicazione: (2024)
di: Wan, Yixin, et al.
Pubblicazione: (2024)
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
di: Duan, Feiyu, et al.
Pubblicazione: (2026)
di: Duan, Feiyu, et al.
Pubblicazione: (2026)
AI-Slop to AI-Polish? Aligning Language Models through Edit-Based Writing Rewards and Test-time Computation
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
di: Chakrabarty, Tuhin, et al.
Pubblicazione: (2025)
DuetSim: Building User Simulator with Dual Large Language Models for Task-Oriented Dialogues
di: Luo, Xiang, et al.
Pubblicazione: (2024)
di: Luo, Xiang, et al.
Pubblicazione: (2024)
SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
di: Hu, Tiancheng, et al.
Pubblicazione: (2025)
UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
di: Peng, Xiangyu, et al.
Pubblicazione: (2025)
DeepThink: Aligning Language Models with Domain-Specific User Intents
di: Li, Yang, et al.
Pubblicazione: (2025)
di: Li, Yang, et al.
Pubblicazione: (2025)
SummExecEdit: A Factual Consistency Benchmark in Summarization with Executable Edits
di: Thorat, Onkar, et al.
Pubblicazione: (2024)
di: Thorat, Onkar, et al.
Pubblicazione: (2024)
User Willingness-aware Sales Talk Dataset
di: Hentona, Asahi, et al.
Pubblicazione: (2024)
di: Hentona, Asahi, et al.
Pubblicazione: (2024)
ElectionSim: Massive Population Election Simulation Powered by Large Language Model Driven Agents
di: Zhang, Xinnong, et al.
Pubblicazione: (2024)
di: Zhang, Xinnong, et al.
Pubblicazione: (2024)
Mixture-of-Instructions: Aligning Large Language Models via Mixture Prompting
di: Xu, Bowen, et al.
Pubblicazione: (2024)
di: Xu, Bowen, et al.
Pubblicazione: (2024)
Aligning Large Language Models with Implicit Preferences from User-Generated Content
di: Tan, Zhaoxuan, et al.
Pubblicazione: (2025)
di: Tan, Zhaoxuan, et al.
Pubblicazione: (2025)
What Makes a Sale? Rethinking End-to-End Seller--Buyer Retail Dynamics with LLM Agents
di: Choi, Jeonghwan, et al.
Pubblicazione: (2026)
di: Choi, Jeonghwan, et al.
Pubblicazione: (2026)
The Factuality Tax of Diversity-Intervened Text-to-Image Generation: Benchmark and Fact-Augmented Intervention
di: Wan, Yixin, et al.
Pubblicazione: (2024)
di: Wan, Yixin, et al.
Pubblicazione: (2024)
PAARS: Persona Aligned Agentic Retail Shoppers
di: Mansour, Saab, et al.
Pubblicazione: (2025)
di: Mansour, Saab, et al.
Pubblicazione: (2025)
MACAROON: Training Vision-Language Models To Be Your Engaged Partners
di: Wu, Shujin, et al.
Pubblicazione: (2024)
di: Wu, Shujin, et al.
Pubblicazione: (2024)
The Root Shapes the Fruit: On the Persistence of Gender-Exclusive Harms in Aligned Language Models
di: Ovalle, Anaelia, et al.
Pubblicazione: (2024)
di: Ovalle, Anaelia, et al.
Pubblicazione: (2024)
SimSUM: Simulated Benchmark with Structured and Unstructured Medical Records
di: Rabaey, Paloma, et al.
Pubblicazione: (2024)
di: Rabaey, Paloma, et al.
Pubblicazione: (2024)
AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception
di: Huang, Yipo, et al.
Pubblicazione: (2024)
di: Huang, Yipo, et al.
Pubblicazione: (2024)
An Analysis of Large Language Models for Simulating User Responses in Surveys
di: Yu, Ziyun, et al.
Pubblicazione: (2025)
di: Yu, Ziyun, et al.
Pubblicazione: (2025)
Aligning Language Models from User Interactions
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2026)
di: Buening, Thomas Kleine, et al.
Pubblicazione: (2026)
Mitigating Over-Refusal in Aligned Large Language Models via Inference-Time Activation Energy
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
di: Jiang, Eric Hanchen, et al.
Pubblicazione: (2025)
ProPerSim: Developing Proactive and Personalized AI Assistants through User-Assistant Simulation
di: Kim, Jiho, et al.
Pubblicazione: (2025)
di: Kim, Jiho, et al.
Pubblicazione: (2025)
SocialSim: Towards Socialized Simulation of Emotional Support Conversation
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
di: Chen, Zhuang, et al.
Pubblicazione: (2025)
Safer-Instruct: Aligning Language Models with Automated Preference Data
di: Shi, Taiwei, et al.
Pubblicazione: (2023)
di: Shi, Taiwei, et al.
Pubblicazione: (2023)
Aligning Large Language Models with Searcher Preferences
di: Wu, Wei, et al.
Pubblicazione: (2026)
di: Wu, Wei, et al.
Pubblicazione: (2026)
CIEGAD: Cluster-Conditioned Interpolative and Extrapolative Framework for Geometry-Aware and Domain-Aligned Data Augmentation
di: Inoshita, Keito, et al.
Pubblicazione: (2025)
di: Inoshita, Keito, et al.
Pubblicazione: (2025)
Medical Vision-Language Pre-Training for Brain Abnormalities
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
di: Monajatipoor, Masoud, et al.
Pubblicazione: (2024)
News Recommendation with Category Description by a Large Language Model
di: Yada, Yuki, et al.
Pubblicazione: (2024)
di: Yada, Yuki, et al.
Pubblicazione: (2024)
Pre-trained Language Models for Keyphrase Generation: A Thorough Empirical Study
di: Wu, Di, et al.
Pubblicazione: (2022)
di: Wu, Di, et al.
Pubblicazione: (2022)
On Leveraging Encoder-only Pre-trained Language Models for Effective Keyphrase Generation
di: Wu, Di, et al.
Pubblicazione: (2024)
di: Wu, Di, et al.
Pubblicazione: (2024)
Enterprise Benchmarks for Large Language Model Evaluation
di: Zhang, Bing, et al.
Pubblicazione: (2024)
di: Zhang, Bing, et al.
Pubblicazione: (2024)
Not Every Token Needs Forgetting: Selective Unlearning to Limit Change in Utility in Large Language Model Unlearning
di: Wan, Yixin, et al.
Pubblicazione: (2025)
di: Wan, Yixin, et al.
Pubblicazione: (2025)
Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents
di: Bei, Yuanchen, et al.
Pubblicazione: (2026)
di: Bei, Yuanchen, et al.
Pubblicazione: (2026)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
AI Hospital: Benchmarking Large Language Models in a Multi-agent Medical Interaction Simulator
di: Fan, Zhihao, et al.
Pubblicazione: (2024)
di: Fan, Zhihao, et al.
Pubblicazione: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
Documenti analoghi
-
InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation
di: Li, Yu, et al.
Pubblicazione: (2026) -
The Need for a Socially-Grounded Persona Framework for User Simulation
di: Venkit, Pranav Narayanan, et al.
Pubblicazione: (2026) -
CompAlign: Improving Compositional Text-to-Image Generation with a Complex Benchmark and Fine-Grained Feedback
di: Wan, Yixin, et al.
Pubblicazione: (2025) -
White Men Lead, Black Women Help? Benchmarking and Mitigating Language Agency Social Biases in LLMs
di: Wan, Yixin, et al.
Pubblicazione: (2024) -
LifeSim: Long-Horizon User Life Simulator for Personalized Assistant Evaluation
di: Duan, Feiyu, et al.
Pubblicazione: (2026)