Gespeichert in:
| Hauptverfasser: | Dai, Dawei, Long, Xu, Yutang, Li, Yuanhui, Zhang, Xia, Shuyin |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | https://arxiv.org/abs/2411.03034 |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding
von: Dai, Dawei, et al.
Veröffentlicht: (2024)
von: Dai, Dawei, et al.
Veröffentlicht: (2024)
Modeling Human Responses to Multimodal AI Content
von: Shen, Zhiqi, et al.
Veröffentlicht: (2025)
von: Shen, Zhiqi, et al.
Veröffentlicht: (2025)
Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models
von: Wang, Chen, et al.
Veröffentlicht: (2025)
von: Wang, Chen, et al.
Veröffentlicht: (2025)
AxiomVision: Accuracy-Guaranteed Adaptive Visual Model Selection for Perspective-Aware Video Analytics
von: Dai, Xiangxiang, et al.
Veröffentlicht: (2024)
von: Dai, Xiangxiang, et al.
Veröffentlicht: (2024)
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
von: Tang, Shixiang, et al.
Veröffentlicht: (2025)
von: Tang, Shixiang, et al.
Veröffentlicht: (2025)
Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
von: Zhang, Hang, et al.
Veröffentlicht: (2024)
von: Zhang, Hang, et al.
Veröffentlicht: (2024)
Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model
von: Gong, Tianyi, et al.
Veröffentlicht: (2026)
von: Gong, Tianyi, et al.
Veröffentlicht: (2026)
IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models
von: Rahimi, Hamed, et al.
Veröffentlicht: (2026)
von: Rahimi, Hamed, et al.
Veröffentlicht: (2026)
Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation
von: He, Xiao, et al.
Veröffentlicht: (2025)
von: He, Xiao, et al.
Veröffentlicht: (2025)
HiSC4D: Human-centered interaction and 4D Scene Capture in Large-scale Space Using Wearable IMUs and LiDAR
von: Dai, Yudi, et al.
Veröffentlicht: (2024)
von: Dai, Yudi, et al.
Veröffentlicht: (2024)
Distilling Vision-Language Foundation Models: A Data-Free Approach via Prompt Diversification
von: Xuan, Yunyi, et al.
Veröffentlicht: (2024)
von: Xuan, Yunyi, et al.
Veröffentlicht: (2024)
HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
von: Zhou, Chuhao, et al.
Veröffentlicht: (2025)
von: Zhou, Chuhao, et al.
Veröffentlicht: (2025)
Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
von: Wu, Haoning, et al.
Veröffentlicht: (2023)
CPCLDETECTOR: Knowledge Enhancement and Alignment Selection for Chinese Patronizing and Condescending Language Detection
von: Yang, Jiaxun, et al.
Veröffentlicht: (2025)
von: Yang, Jiaxun, et al.
Veröffentlicht: (2025)
ImageScope: Unifying Language-Guided Image Retrieval via Large Multimodal Model Collective Reasoning
von: Luo, Pengfei, et al.
Veröffentlicht: (2025)
von: Luo, Pengfei, et al.
Veröffentlicht: (2025)
HCVR Scene Generation: High Compatibility Virtual Reality Environment Generation for Extended Redirected Walking
von: Zhang, Yiran, et al.
Veröffentlicht: (2026)
von: Zhang, Yiran, et al.
Veröffentlicht: (2026)
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
von: Yang, Jialiang, et al.
Veröffentlicht: (2026)
von: Yang, Jialiang, et al.
Veröffentlicht: (2026)
Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR
von: Zhang, Yulong, et al.
Veröffentlicht: (2025)
von: Zhang, Yulong, et al.
Veröffentlicht: (2025)
A Survey on Multimodal Benchmarks: In the Era of Large AI Models
von: Li, Lin, et al.
Veröffentlicht: (2024)
von: Li, Lin, et al.
Veröffentlicht: (2024)
Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
von: Zhang, Hanlei, et al.
Veröffentlicht: (2025)
A Survey on Image-text Multimodal Models
von: Guo, Ruifeng, et al.
Veröffentlicht: (2023)
von: Guo, Ruifeng, et al.
Veröffentlicht: (2023)
Human Aesthetic Preference-Based Large Text-to-Image Model Personalization: Kandinsky Generation as an Example
von: Zhou, Aven-Le, et al.
Veröffentlicht: (2024)
von: Zhou, Aven-Le, et al.
Veröffentlicht: (2024)
X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models
von: Sun, Zeyi, et al.
Veröffentlicht: (2024)
von: Sun, Zeyi, et al.
Veröffentlicht: (2024)
LLMER: Crafting Interactive Extended Reality Worlds with JSON Data Generated by Large Language Models
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
von: Chen, Jiangong, et al.
Veröffentlicht: (2025)
Smart Transfer: Leveraging Vision Foundation Model for Rapid Building Damage Mapping with Post-Earthquake VHR Imagery
von: Li, Hao, et al.
Veröffentlicht: (2026)
von: Li, Hao, et al.
Veröffentlicht: (2026)
Text-Only Data Synthesis for Vision Language Model Training
von: Yu, Xiaomin, et al.
Veröffentlicht: (2025)
von: Yu, Xiaomin, et al.
Veröffentlicht: (2025)
ELF: A Family of Encoder-Free ECG-Language Models
von: Han, William, et al.
Veröffentlicht: (2026)
von: Han, William, et al.
Veröffentlicht: (2026)
FISHER: A Foundation Model for Multi-Modal Industrial Signal Comprehensive Representation
von: Fan, Pingyi, et al.
Veröffentlicht: (2025)
von: Fan, Pingyi, et al.
Veröffentlicht: (2025)
A Survey of Foundation Models for Music Understanding
von: Li, Wenjun, et al.
Veröffentlicht: (2024)
von: Li, Wenjun, et al.
Veröffentlicht: (2024)
A Multimedia Analytics Model for the Foundation Model Era
von: Worring, Marcel, et al.
Veröffentlicht: (2025)
von: Worring, Marcel, et al.
Veröffentlicht: (2025)
Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models
von: Lin, Yuxiang, et al.
Veröffentlicht: (2025)
von: Lin, Yuxiang, et al.
Veröffentlicht: (2025)
Let the Model Learn to Feel: Mode-Guided Tonality Injection for Symbolic Music Emotion Recognition
von: Xia, Haiying, et al.
Veröffentlicht: (2025)
von: Xia, Haiying, et al.
Veröffentlicht: (2025)
YuE: Scaling Open Foundation Models for Long-Form Music Generation
von: Yuan, Ruibin, et al.
Veröffentlicht: (2025)
von: Yuan, Ruibin, et al.
Veröffentlicht: (2025)
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
von: Cai, Dongnuan, et al.
Veröffentlicht: (2026)
von: Cai, Dongnuan, et al.
Veröffentlicht: (2026)
POLYCHARTQA: Benchmarking Large Vision-Language Models with Multilingual Chart Question Answering
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
von: Xu, Yichen, et al.
Veröffentlicht: (2025)
PanMatch: Unleashing the Potential of Large Vision Models for Unified Matching Models
von: Zhang, Yongjian, et al.
Veröffentlicht: (2025)
von: Zhang, Yongjian, et al.
Veröffentlicht: (2025)
PaveBench: A Versatile Benchmark for Pavement Distress Perception and Interactive Vision-Language Analysis
von: Li, Dexiang, et al.
Veröffentlicht: (2026)
von: Li, Dexiang, et al.
Veröffentlicht: (2026)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
von: Qu, Qiang, et al.
Veröffentlicht: (2025)
von: Qu, Qiang, et al.
Veröffentlicht: (2025)
Unsupervised Multimodal Clustering for Semantics Discovery in Multimodal Utterances
von: Zhang, Hanlei, et al.
Veröffentlicht: (2024)
von: Zhang, Hanlei, et al.
Veröffentlicht: (2024)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
von: Zhang, Yue, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
PA-LLaVA: A Large Language-Vision Assistant for Human Pathology Image Understanding
von: Dai, Dawei, et al.
Veröffentlicht: (2024) -
Modeling Human Responses to Multimodal AI Content
von: Shen, Zhiqi, et al.
Veröffentlicht: (2025) -
Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models
von: Wang, Chen, et al.
Veröffentlicht: (2025) -
AxiomVision: Accuracy-Guaranteed Adaptive Visual Model Selection for Perspective-Aware Video Analytics
von: Dai, Xiangxiang, et al.
Veröffentlicht: (2024) -
Human-Centric Foundation Models: Perception, Generation and Agentic Modeling
von: Tang, Shixiang, et al.
Veröffentlicht: (2025)