Feature Coding in the Era of Large Models: Dataset, Test Conditions, and Benchmark
Fuente:
arXiv
Salvato in:
| Autori principali: | Gao, Changsheng, Ma, Yifan, Chen, Qiaoxi, Xu, Yenan, Liu, Dong, Lin, Weisi |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
di: Gao, Changsheng, et al.
Pubblicazione: (2025)
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
di: Li, Lin, et al.
Pubblicazione: (2024)
di: Li, Lin, et al.
Pubblicazione: (2024)
PC-JND: Subjective Study and Dataset on Just Noticeable Difference for Point Clouds in 6DoF Virtual Reality
di: Fan, Chunling, et al.
Pubblicazione: (2025)
di: Fan, Chunling, et al.
Pubblicazione: (2025)
Multi-task Just Recognizable Difference for Video Coding for Machines: Database, Model, and Coding Application
di: Liu, Junqi, et al.
Pubblicazione: (2026)
di: Liu, Junqi, et al.
Pubblicazione: (2026)
TPIFM: A Task-Aware Model for Evaluating Perceptual Interaction Fluency in Remote AR Collaboration
di: Song, Jiarun, et al.
Pubblicazione: (2026)
di: Song, Jiarun, et al.
Pubblicazione: (2026)
Physics-Aware Novel-View Acoustic Synthesis with Vision-Language Priors and 3D Acoustic Environment Modeling
di: Fan, Congyi, et al.
Pubblicazione: (2026)
di: Fan, Congyi, et al.
Pubblicazione: (2026)
SCI-Reason: A Dataset with Chain-of-Thought Rationales for Complex Multimodal Reasoning in Academic Areas
di: Ma, Chenghao, et al.
Pubblicazione: (2025)
di: Ma, Chenghao, et al.
Pubblicazione: (2025)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
di: Xu, Zitong, et al.
Pubblicazione: (2025)
di: Xu, Zitong, et al.
Pubblicazione: (2025)
Symmetric Entropy-Constrained Video Coding for Machines
di: Sun, Yuxiao, et al.
Pubblicazione: (2025)
di: Sun, Yuxiao, et al.
Pubblicazione: (2025)
A Large-scale Dataset with Behavior, Attributes, and Content of Mobile Short-video Platform
di: Shang, Yu, et al.
Pubblicazione: (2025)
di: Shang, Yu, et al.
Pubblicazione: (2025)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
di: Yang, Renyu, et al.
Pubblicazione: (2026)
di: Yang, Renyu, et al.
Pubblicazione: (2026)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
di: Zhang, Hanlei, et al.
Pubblicazione: (2024)
di: Zhang, Hanlei, et al.
Pubblicazione: (2024)
FinCall-Surprise: A Large Scale Multi-modal Benchmark for Earning Surprise Prediction
di: Shu, Dong, et al.
Pubblicazione: (2025)
di: Shu, Dong, et al.
Pubblicazione: (2025)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
di: Chen, Zehao, et al.
Pubblicazione: (2025)
di: Chen, Zehao, et al.
Pubblicazione: (2025)
FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models
di: Li, Yixuan, et al.
Pubblicazione: (2024)
di: Li, Yixuan, et al.
Pubblicazione: (2024)
Towards Large Model Feature Coding
di: Pang, Youwei, et al.
Pubblicazione: (2026)
di: Pang, Youwei, et al.
Pubblicazione: (2026)
ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Capability for Large Vision-Language Models
di: Liu, Shuo, et al.
Pubblicazione: (2024)
di: Liu, Shuo, et al.
Pubblicazione: (2024)
EEmo-Bench: A Benchmark for Multi-modal Large Language Models on Image Evoked Emotion Assessment
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
di: Gao, Lancheng, et al.
Pubblicazione: (2025)
FineBadminton: A Multi-Level Dataset for Fine-Grained Badminton Video Understanding
di: He, Xusheng, et al.
Pubblicazione: (2025)
di: He, Xusheng, et al.
Pubblicazione: (2025)
CI-ICM: Channel Importance-driven Learned Image Coding for Machines
di: Zhang, Yun, et al.
Pubblicazione: (2026)
di: Zhang, Yun, et al.
Pubblicazione: (2026)
Large Language Models (LLMs): Deployment, Tokenomics and Sustainability
di: Dong, Haiwei, et al.
Pubblicazione: (2024)
di: Dong, Haiwei, et al.
Pubblicazione: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
di: Yin, Zhiyu, et al.
Pubblicazione: (2026)
From Perception to Cognition: How Latency Affects Interaction Fluency and Social Presence in VR Conferencing
di: Song, Jiarun, et al.
Pubblicazione: (2026)
di: Song, Jiarun, et al.
Pubblicazione: (2026)
Images Inpainting Quality Evaluation Using Structural Features and Visual Saliency
di: Shuang Ma, et al.
Pubblicazione: (2024)
di: Shuang Ma, et al.
Pubblicazione: (2024)
Reply with Sticker: New Dataset and Model for Sticker Retrieval
di: Liang, Bin, et al.
Pubblicazione: (2024)
di: Liang, Bin, et al.
Pubblicazione: (2024)
Short-video Propagation Influence Rating: A New Real-world Dataset and A New Large Graph Model
di: Xue, Dizhan, et al.
Pubblicazione: (2025)
di: Xue, Dizhan, et al.
Pubblicazione: (2025)
RoboTron-Mani: All-in-One Multimodal Large Model for Robotic Manipulation
di: Yan, Feng, et al.
Pubblicazione: (2024)
di: Yan, Feng, et al.
Pubblicazione: (2024)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
di: Zhu, Yule, et al.
Pubblicazione: (2025)
di: Zhu, Yule, et al.
Pubblicazione: (2025)
Distilling Implicit Multimodal Knowledge into Large Language Models for Zero-Resource Dialogue Generation
di: Zhang, Bo, et al.
Pubblicazione: (2024)
di: Zhang, Bo, et al.
Pubblicazione: (2024)
LungCURE: Benchmarking Multimodal Real-World Clinical Reasoning for Precision Lung Cancer Diagnosis and Treatment
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
di: Hao, Fangyu, et al.
Pubblicazione: (2026)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
di: Wu, Haoning, et al.
Pubblicazione: (2023)
di: Wu, Haoning, et al.
Pubblicazione: (2023)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
di: Chen, Zixuan, et al.
Pubblicazione: (2026)
Structure-Aware Residual-Center Representation for Self-Supervised Open-Set 3D Cross-Modal Retrieval
di: Xu, Yang, et al.
Pubblicazione: (2024)
di: Xu, Yang, et al.
Pubblicazione: (2024)
When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
di: Zhang, Pingping, et al.
Pubblicazione: (2024)
EMID: An Emotional Aligned Dataset in Audio-Visual Modality
di: Zou, Jialing, et al.
Pubblicazione: (2023)
di: Zou, Jialing, et al.
Pubblicazione: (2023)
Q-Adapt: Adapting LMM for Visual Quality Assessment with Progressive Instruction Tuning
di: Lu, Yiting, et al.
Pubblicazione: (2025)
di: Lu, Yiting, et al.
Pubblicazione: (2025)
DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture
di: Maji, Arijit, et al.
Pubblicazione: (2025)
di: Maji, Arijit, et al.
Pubblicazione: (2025)
A New Dataset and Benchmark for Grounding Multimodal Misinformation
di: Yang, Bingjian, et al.
Pubblicazione: (2025)
di: Yang, Bingjian, et al.
Pubblicazione: (2025)
Multiscale Feature Importance-based Bit Allocation for End-to-End Feature Coding for Machines
di: Liu, Junle, et al.
Pubblicazione: (2025)
di: Liu, Junle, et al.
Pubblicazione: (2025)
Anchoring Trends: Mitigating Social Media Popularity Prediction Drift via Feature Clustering and Expansion
di: Lee, Chia-Ming, et al.
Pubblicazione: (2025)
di: Lee, Chia-Ming, et al.
Pubblicazione: (2025)
Documenti analoghi
-
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
di: Gao, Changsheng, et al.
Pubblicazione: (2025) -
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
di: Li, Lin, et al.
Pubblicazione: (2024) -
PC-JND: Subjective Study and Dataset on Just Noticeable Difference for Point Clouds in 6DoF Virtual Reality
di: Fan, Chunling, et al.
Pubblicazione: (2025) -
Multi-task Just Recognizable Difference for Video Coding for Machines: Database, Model, and Coding Application
di: Liu, Junqi, et al.
Pubblicazione: (2026) -
TPIFM: A Task-Aware Model for Evaluating Perceptual Interaction Fluency in Remote AR Collaboration
di: Song, Jiarun, et al.
Pubblicazione: (2026)