ZeroNLG: Aligning and Autoencoding Domains for Zero-Shot Multimodal and Multilingual Natural Language Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Bang, Liu, Fenglin, Zou, Yuexian, Wu, Xian, Wang, Yaowei, Clifton, David A. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
por: Hu, Jinyi, et al.
Publicado: (2023)
por: Hu, Jinyi, et al.
Publicado: (2023)
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
por: Gu, Zishan, et al.
Publicado: (2024)
por: Gu, Zishan, et al.
Publicado: (2024)
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
por: Elhenawy, Mohammed, et al.
Publicado: (2025)
por: Elhenawy, Mohammed, et al.
Publicado: (2025)
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
por: Xu, Jiacong, et al.
Publicado: (2025)
por: Xu, Jiacong, et al.
Publicado: (2025)
Commonsense for Zero-Shot Natural Language Video Localization
por: Holla, Meghana, et al.
Publicado: (2023)
por: Holla, Meghana, et al.
Publicado: (2023)
ZALM3: Zero-Shot Enhancement of Vision-Language Alignment via In-Context Information in Multi-Turn Multimodal Medical Dialogue
por: Li, Zhangpu, et al.
Publicado: (2024)
por: Li, Zhangpu, et al.
Publicado: (2024)
Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval
por: Dipta, Shubhashis Roy, et al.
Publicado: (2025)
por: Dipta, Shubhashis Roy, et al.
Publicado: (2025)
Zero-Shot Action Recognition in Surveillance Videos
por: Pereira, Joao, et al.
Publicado: (2024)
por: Pereira, Joao, et al.
Publicado: (2024)
Image-Caption Encoding for Improving Zero-Shot Generalization
por: Yu, Eric Yang, et al.
Publicado: (2024)
por: Yu, Eric Yang, et al.
Publicado: (2024)
TikZero: Zero-Shot Text-Guided Graphics Program Synthesis
por: Belouadi, Jonas, et al.
Publicado: (2025)
por: Belouadi, Jonas, et al.
Publicado: (2025)
VisionGPT-3D: A Generalized Multimodal Agent for Enhanced 3D Vision Understanding
por: Kelly, Chris, et al.
Publicado: (2024)
por: Kelly, Chris, et al.
Publicado: (2024)
Towards Zero-Shot Annotation of the Built Environment with Vision-Language Models (Vision Paper)
por: Han, Bin, et al.
Publicado: (2024)
por: Han, Bin, et al.
Publicado: (2024)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025)
por: Jiang, Ruixiang, et al.
Publicado: (2025)
Embracing Language Inclusivity and Diversity in CLIP through Continual Language Learning
por: Yang, Bang, et al.
Publicado: (2024)
por: Yang, Bang, et al.
Publicado: (2024)
Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding
por: Chen, Zhanpeng, et al.
Publicado: (2025)
por: Chen, Zhanpeng, et al.
Publicado: (2025)
SpatialPrompting: Keyframe-driven Zero-Shot Spatial Reasoning with Off-the-Shelf Multimodal Large Language Models
por: Taguchi, Shun, et al.
Publicado: (2025)
por: Taguchi, Shun, et al.
Publicado: (2025)
Data Alignment for Zero-Shot Concept Generation in Dermatology AI
por: Gadgil, Soham, et al.
Publicado: (2024)
por: Gadgil, Soham, et al.
Publicado: (2024)
Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification
por: Weng, Charles, et al.
Publicado: (2026)
por: Weng, Charles, et al.
Publicado: (2026)
InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions
por: Tanaka, Ryota, et al.
Publicado: (2024)
por: Tanaka, Ryota, et al.
Publicado: (2024)
Retrieval-Augmented and Knowledge-Grounded Language Models for Faithful Clinical Medicine
por: Liu, Fenglin, et al.
Publicado: (2022)
por: Liu, Fenglin, et al.
Publicado: (2022)
Evaluating Zero-Shot Multilingual Aspect-Based Sentiment Analysis with Large Language Models
por: Wu, Chengyan, et al.
Publicado: (2024)
por: Wu, Chengyan, et al.
Publicado: (2024)
No "Zero-Shot" Without Exponential Data: Pretraining Concept Frequency Determines Multimodal Model Performance
por: Udandarao, Vishaal, et al.
Publicado: (2024)
por: Udandarao, Vishaal, et al.
Publicado: (2024)
Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study
por: Wang, Chenguang, et al.
Publicado: (2024)
por: Wang, Chenguang, et al.
Publicado: (2024)
Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement
por: Gkanatsios, Nikolaos, et al.
Publicado: (2023)
por: Gkanatsios, Nikolaos, et al.
Publicado: (2023)
Languages Transferred Within the Encoder: On Representation Transfer in Zero-Shot Multilingual Translation
por: Qu, Zhi, et al.
Publicado: (2024)
por: Qu, Zhi, et al.
Publicado: (2024)
Investigating Prompting Techniques for Zero- and Few-Shot Visual Question Answering
por: Awal, Rabiul, et al.
Publicado: (2023)
por: Awal, Rabiul, et al.
Publicado: (2023)
Open-Source Image Editing Models Are Zero-Shot Vision Learners
por: Liu, Wei, et al.
Publicado: (2026)
por: Liu, Wei, et al.
Publicado: (2026)
DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation
por: Hong, Susung, et al.
Publicado: (2023)
por: Hong, Susung, et al.
Publicado: (2023)
D3G: Diverse Demographic Data Generation Increases Zero-Shot Image Classification Accuracy within Multimodal Models
por: Hickmon, Javon
Publicado: (2025)
por: Hickmon, Javon
Publicado: (2025)
Optimizing GPT for Video Understanding: Zero-Shot Performance and Prompt Engineering
por: Beliaev, Mark, et al.
Publicado: (2025)
por: Beliaev, Mark, et al.
Publicado: (2025)
RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability
por: Park, Jonggwon, et al.
Publicado: (2025)
por: Park, Jonggwon, et al.
Publicado: (2025)
G2L: Semantically Aligned and Uniform Video Grounding via Geodesic and Game Theory
por: Li, Hongxiang, et al.
Publicado: (2023)
por: Li, Hongxiang, et al.
Publicado: (2023)
Zero-Shot Defense Against Toxic Images via Inherent Multimodal Alignment in LVLMs
por: Zhao, Wei, et al.
Publicado: (2025)
por: Zhao, Wei, et al.
Publicado: (2025)
TROPE: TRaining-Free Object-Part Enhancement for Seamlessly Improving Fine-Grained Zero-Shot Image Captioning
por: Feinglass, Joshua, et al.
Publicado: (2024)
por: Feinglass, Joshua, et al.
Publicado: (2024)
Kinship in Speech: Leveraging Linguistic Relatedness for Zero-Shot TTS in Indian Languages
por: Pathak, Utkarsh, et al.
Publicado: (2025)
por: Pathak, Utkarsh, et al.
Publicado: (2025)
Zero-Shot Visual Reasoning by Vision-Language Models: Benchmarking and Analysis
por: Nagar, Aishik, et al.
Publicado: (2024)
por: Nagar, Aishik, et al.
Publicado: (2024)
Spectral Prompt Tuning:Unveiling Unseen Classes for Zero-Shot Semantic Segmentation
por: Xu, Wenhao, et al.
Publicado: (2023)
por: Xu, Wenhao, et al.
Publicado: (2023)
Benchmarking Multilingual Speech Models on Pashto: Zero-Shot ASR, Script Failure, and Cross-Domain Evaluation
por: Rahman, Hanif
Publicado: (2026)
por: Rahman, Hanif
Publicado: (2026)
LLM Comparative Assessment: Zero-shot NLG Evaluation through Pairwise Comparisons using Large Language Models
por: Liusie, Adian, et al.
Publicado: (2023)
por: Liusie, Adian, et al.
Publicado: (2023)
Fusing Domain-Specific Content from Large Language Models into Knowledge Graphs for Enhanced Zero Shot Object State Classification
por: Gouidis, Filippos, et al.
Publicado: (2024)
por: Gouidis, Filippos, et al.
Publicado: (2024)
Ejemplares similares
-
Large Multilingual Models Pivot Zero-Shot Multimodal Learning across Languages
por: Hu, Jinyi, et al.
Publicado: (2023) -
Inquire, Interact, and Integrate: A Proactive Agent Collaborative Framework for Zero-Shot Multimodal Medical Reasoning
por: Gu, Zishan, et al.
Publicado: (2024) -
Zero-Shot Scene Understanding with Multimodal Large Language Models for Automated Vehicles
por: Elhenawy, Mohammed, et al.
Publicado: (2025) -
Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models
por: Xu, Jiacong, et al.
Publicado: (2025) -
Commonsense for Zero-Shot Natural Language Video Localization
por: Holla, Meghana, et al.
Publicado: (2023)