ZeroNLG: Aligning and Autoencoding Domains for Zero-Shot Multimodal and Multilingual Natural Language Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Bang, Liu, Fenglin, Zou, Yuexian, Wu, Xian, Wang, Yaowei, Clifton, David A. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
di: Hu, Jinyi, et al.
Pubblicazione: (2023)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
di: Gu, Zishan, et al.
Pubblicazione: (2024)
di: Gu, Zishan, et al.
Pubblicazione: (2024)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
di: Elhenawy, Mohammed, et al.
Pubblicazione: (2025)
di: Elhenawy, Mohammed, et al.
Pubblicazione: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
di: Xu, Jiacong, et al.
Pubblicazione: (2025)
Commonsense for Zero-Shot Natural Language Video Localization
di: Holla, Meghana, et al.
Pubblicazione: (2023)
di: Holla, Meghana, et al.
Pubblicazione: (2023)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
di: Li, Zhangpu, et al.
Pubblicazione: (2024)
di: Li, Zhangpu, et al.
Pubblicazione: (2024)
Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2025)
di: Dipta, Shubhashis Roy, et al.
Pubblicazione: (2025)
Zero-Shot Action Recognition in Surveillance Videos
di: Pereira, Joao, et al.
Pubblicazione: (2024)
di: Pereira, Joao, et al.
Pubblicazione: (2024)
Image-Caption Encoding for Improving Zero-Shot Generalization
di: Yu, Eric Yang, et al.
Pubblicazione: (2024)
di: Yu, Eric Yang, et al.
Pubblicazione: (2024)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
di: Belouadi, Jonas, et al.
Pubblicazione: (2025)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
di: Kelly, Chris, et al.
Pubblicazione: (2024)
di: Kelly, Chris, et al.
Pubblicazione: (2024)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
di: Han, Bin, et al.
Pubblicazione: (2024)
di: Han, Bin, et al.
Pubblicazione: (2024)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
di: Jiang, Ruixiang, et al.
Pubblicazione: (2025)
Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning
di: Yang, Bang, et al.
Pubblicazione: (2024)
di: Yang, Bang, et al.
Pubblicazione: (2024)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
di: Chen, Zhanpeng, et al.
Pubblicazione: (2025)
di: Chen, Zhanpeng, et al.
Pubblicazione: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
di: Taguchi, Shun, et al.
Pubblicazione: (2025)
Data Alignment for Zero-Shot Concept Generation in Dermatology AI
di: Gadgil, Soham, et al.
Pubblicazione: (2024)
di: Gadgil, Soham, et al.
Pubblicazione: (2024)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
di: Weng, Charles, et al.
Pubblicazione: (2026)
di: Weng, Charles, et al.
Pubblicazione: (2026)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
di: Tanaka, Ryota, et al.
Pubblicazione: (2024)
Retrieval-Augmented and Knowledge-Grounded Language Models for Faithful Clinical Medicine
di: Liu, Fenglin, et al.
Pubblicazione: (2022)
di: Liu, Fenglin, et al.
Pubblicazione: (2022)
Evaluating Zero-Shot Multilingual Aspect-Based Sentiment Analysis with Large Language Models
di: Wu, Chengyan, et al.
Pubblicazione: (2024)
di: Wu, Chengyan, et al.
Pubblicazione: (2024)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
di: Udandarao, Vishaal, et al.
Pubblicazione: (2024)
di: Udandarao, Vishaal, et al.
Pubblicazione: (2024)
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
di: Wang, Chenguang, et al.
Pubblicazione: (2024)
di: Wang, Chenguang, et al.
Pubblicazione: (2024)
Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
di: Gkanatsios, Nikolaos, et al.
Pubblicazione: (2023)
Languages Transferred Within the Encoder: On Representation Transfer in Zero-Shot Multilingual Translation
di: Qu, Zhi, et al.
Pubblicazione: (2024)
di: Qu, Zhi, et al.
Pubblicazione: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
di: Awal, Rabiul, et al.
Pubblicazione: (2023)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
di: Hong, Susung, et al.
Pubblicazione: (2023)
di: Hong, Susung, et al.
Pubblicazione: (2023)
D3G: Diverse Demographic Data Generation Increases Zero-Shot Image Classification Accuracy within Multimodal Models
di: Hickmon, Javon
Pubblicazione: (2025)
di: Hickmon, Javon
Pubblicazione: (2025)
Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering
di: Beliaev, Mark, et al.
Pubblicazione: (2025)
di: Beliaev, Mark, et al.
Pubblicazione: (2025)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
di: Park, Jonggwon, et al.
Pubblicazione: (2025)
G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
di: Li, Hongxiang, et al.
Pubblicazione: (2023)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
di: Zhao, Wei, et al.
Pubblicazione: (2025)
di: Zhao, Wei, et al.
Pubblicazione: (2025)
TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning
di: Feinglass, Joshua, et al.
Pubblicazione: (2024)
di: Feinglass, Joshua, et al.
Pubblicazione: (2024)
Kinship in Speech: Leveraging Linguistic Relatedness for Zero-Shot TTS in Indian Languages
di: Pathak, Utkarsh, et al.
Pubblicazione: (2025)
di: Pathak, Utkarsh, et al.
Pubblicazione: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
di: Nagar, Aishik, et al.
Pubblicazione: (2024)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
di: Xu, Wenhao, et al.
Pubblicazione: (2023)
di: Xu, Wenhao, et al.
Pubblicazione: (2023)
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
di: Rahman, Hanif
Pubblicazione: (2026)
di: Rahman, Hanif
Pubblicazione: (2026)
LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models
di: Liusie, Adian, et al.
Pubblicazione: (2023)
di: Liusie, Adian, et al.
Pubblicazione: (2023)
Fusing Domain-Specific Content from Large Language Models into Knowledge Graphs for Enhanced Zero Shot Object State Classification
di: Gouidis, Filippos, et al.
Pubblicazione: (2024)
di: Gouidis, Filippos, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
di: Hu, Jinyi, et al.
Pubblicazione: (2023) -
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
di: Gu, Zishan, et al.
Pubblicazione: (2024) -
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
di: Elhenawy, Mohammed, et al.
Pubblicazione: (2025) -
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
di: Xu, Jiacong, et al.
Pubblicazione: (2025) -
Commonsense for Zero-Shot Natural Language Video Localization
di: Holla, Meghana, et al.
Pubblicazione: (2023)