Ostrakon-VL: Towards Domain-Expert MLLM for Food-Service and Retail Stores
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Shen, Zhiyong, Zhao, Gongpeng, Zhou, Jun, Yu, Li, Kou, Guandong, Li, Jichen, Dong, Chuanlei, Li, Zuncheng, Li, Kaimao, Wei, Bingkun, Hu, Shicheng, Xia, Wei, Duan, Wenguo |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Expert Kernel Generation Network Driven by Contextual Mapping for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
Layout Control and Semantic Guidance with Attention Loss Backward for T2I Diffusion Model
par: Li, Guandong
Publié: (2024)
par: Li, Guandong
Publié: (2024)
Training-Free Style Consistent Image Synthesis with Condition and Mask Guidance in E-Commerce
par: Li, Guandong
Publié: (2024)
par: Li, Guandong
Publié: (2024)
E-Commerce Inpainting with Mask Guidance in Controlnet for Reducing Overcompletion
par: Li, Guandong
Publié: (2024)
par: Li, Guandong
Publié: (2024)
Dual-Channel Attention Guidance for Training-Free Image Editing Control in Diffusion Transformers
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
FastUSP: A Multi-Level Collaborative Acceleration Framework for Distributed Diffusion Model Inference
par: Li, Guandong
Publié: (2026)
par: Li, Guandong
Publié: (2026)
Growth of Omnichannel Grocery Retailing and Food Prices
par: Xiangwen Kong, et autres
Publié: (2025)
par: Xiangwen Kong, et autres
Publié: (2025)
SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Multi‐Technological Solutions for In‐Store Smart Retailing
par: Xinxin Qiu, et autres
Publié: (2024)
par: Xinxin Qiu, et autres
Publié: (2024)
Expert-Guided Extinction of Toxic Tokens for Debiased Generation
par: Sun, Xueyao, et autres
Publié: (2024)
par: Sun, Xueyao, et autres
Publié: (2024)
Changes in Alcohol Retail Laws and Foot Traffic at Liquor Stores
par: Nathan Palardy, et autres
Publié: (2025)
par: Nathan Palardy, et autres
Publié: (2025)
Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
par: Zhao, Wei, et autres
Publié: (2025)
par: Zhao, Wei, et autres
Publié: (2025)
Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective
par: Lian, Puwei, et autres
Publié: (2025)
par: Lian, Puwei, et autres
Publié: (2025)
EditIDv2: Editable ID Customization with Data-Lubricated ID Feature Integration for Text-to-Image Generation
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
MVNet: Hyperspectral Remote Sensing Image Classification Based on Hybrid Mamba-Transformer Vision Backbone Architecture
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
Inject Where It Matters: Training-Free Spatially-Adaptive Identity Preservation for Text-to-Image Personalization
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
Intelligent Parsing: An Automated Parsing Framework for Extracting Design Semantics from E-commerce Creatives
par: Li, Guandong, et autres
Publié: (2023)
par: Li, Guandong, et autres
Publié: (2023)
Hyperspectral Image Classification via Transformer-based Spectral-Spatial Attention Decoupling and Adaptive Gating
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
Two-stage dynamic creative optimization under sparse ambiguous samples for e-commerce advertising
par: Li, Guandong, et autres
Publié: (2023)
par: Li, Guandong, et autres
Publié: (2023)
PhysEdit: Physically-Consistent Region-Aware Image Editing via Adaptive Spatio-Temporal Reasoning
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
Edit Fidelity Field: Semantics-Aware Region Isolation for Training-Free Scene Text Editing
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
FlexID: Training-Free Flexible Identity Injection via Intent-Aware Modulation for Text-to-Image Generation
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
Edit Spillover as a Probe: Do Image Editing Models Implicitly Understand World Relations?
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
AdaEdit: Adaptive Temporal and Channel Modulation for Flow-Based Image Editing
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
Efficient Dynamic Attention 3D Convolution for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
Spatial-Geometry Enhanced 3D Dynamic Snake Convolutional Neural Network for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
3D Wavelet Convolutions with Extended Receptive Fields for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
Dynamic 3D KAN Convolution with Adaptive Grid Optimization for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
EditID: Training-Free Editable ID Customization for Text-to-Image Generation
par: Li, Guandong, et autres
Publié: (2025)
par: Li, Guandong, et autres
Publié: (2025)
GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI
par: Li, Tianbin, et autres
Publié: (2024)
par: Li, Tianbin, et autres
Publié: (2024)
Discovering and Analyzing Stochastic Processes to Reduce Waste in Food Retail
par: Kalenkova, Anna, et autres
Publié: (2025)
par: Kalenkova, Anna, et autres
Publié: (2025)
The Walls Have Ears: Unveiling Cross-Chain Sandwich Attacks in DeFi
par: Li, Chuanlei, et autres
Publié: (2025)
par: Li, Chuanlei, et autres
Publié: (2025)
Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
par: Dong, Daxiang, et autres
Publié: (2025)
par: Dong, Daxiang, et autres
Publié: (2025)
SNS-Bench-VL: Benchmarking Multimodal Large Language Models in Social Networking Services
par: Guo, Hongcheng, et autres
Publié: (2025)
par: Guo, Hongcheng, et autres
Publié: (2025)
Mask Wearing Fosters Relaxation and Store Engagement in an Offline‐Retail Context
par: Lu Yang, et autres
Publié: (2024)
par: Lu Yang, et autres
Publié: (2024)
Innovation in Retail Process: From Consumers' Experience to Immersive Store Design
par: Eleonora Pantano
Publié: (2012)
par: Eleonora Pantano
Publié: (2012)
Documents similaires
-
Expert Kernel Generation Network Driven by Contextual Mapping for Hyperspectral Image Classification
par: Li, Guandong, et autres
Publié: (2025) -
LayerCache: Exploiting Layer-wise Velocity Heterogeneity for Efficient Flow Matching Inference
par: Li, Guandong
Publié: (2026) -
Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers
par: Li, Guandong
Publié: (2026) -
Layout Control and Semantic Guidance with Attention Loss Backward for T2I Diffusion Model
par: Li, Guandong
Publié: (2024) -
Training-Free Style Consistent Image Synthesis with Condition and Mask Guidance in E-Commerce
par: Li, Guandong
Publié: (2024)