Enregistré dans:
| Auteurs principaux: | Alishzade, Nigar, Hasanov, Jamaladdin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2411.12865 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Sign Language Recognition and Translation for Low-Resource Languages: Challenges and Pathways Forward
par: Alishzade, Nigar, et autres
Publié: (2026)
par: Alishzade, Nigar, et autres
Publié: (2026)
A Comparative Analysis of Recurrent and Attention Architectures for Isolated Sign Language Recognition
par: Alishzade, Nigar, et autres
Publié: (2025)
par: Alishzade, Nigar, et autres
Publié: (2025)
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
par: Ma, Chong, et autres
Publié: (2024)
par: Ma, Chong, et autres
Publié: (2024)
Seeing The Words: Evaluating AI-generated Biblical Art
par: Makimei, Hidde, et autres
Publié: (2025)
par: Makimei, Hidde, et autres
Publié: (2025)
CerberusDet: Unified Multi-Dataset Object Detection
par: Tolstykh, Irina, et autres
Publié: (2024)
par: Tolstykh, Irina, et autres
Publié: (2024)
SRUM: Fine-Grained Self-Rewarding for Unified Multimodal Models
par: Jin, Weiyang, et autres
Publié: (2025)
par: Jin, Weiyang, et autres
Publié: (2025)
Rip Current Segmentation: A Novel Benchmark and YOLOv8 Baseline Results
par: Dumitriu, Andrei, et autres
Publié: (2025)
par: Dumitriu, Andrei, et autres
Publié: (2025)
Synthetic Photography Detection: A Visual Guidance for Identifying Synthetic Images Created by AI
par: Mathys, Melanie, et autres
Publié: (2024)
par: Mathys, Melanie, et autres
Publié: (2024)
Detecting Effects of AI-Mediated Communication on Language Complexity and Sentiment
par: Sussman, Kristen, et autres
Publié: (2025)
par: Sussman, Kristen, et autres
Publié: (2025)
Diffusion Lens: Interpreting Text Encoders in Text-to-Image Pipelines
par: Toker, Michael, et autres
Publié: (2024)
par: Toker, Michael, et autres
Publié: (2024)
Synthetic Image Generation in Cyber Influence Operations: An Emergent Threat?
par: Mathys, Melanie, et autres
Publié: (2024)
par: Mathys, Melanie, et autres
Publié: (2024)
COLORA: Efficient Fine-Tuning for Convolutional Models with a Study Case on Optical Coherence Tomography Image Classification
par: Rivera, Mariano, et autres
Publié: (2025)
par: Rivera, Mariano, et autres
Publié: (2025)
Threats and Opportunities in AI-generated Images for Armed Forces
par: Meier, Raphael
Publié: (2025)
par: Meier, Raphael
Publié: (2025)
The Language Labyrinth: Constructive Critique on the Terminology Used in the AI Discourse
par: Rehak, Rainer
Publié: (2023)
par: Rehak, Rainer
Publié: (2023)
Making High-Level AI Design Decisions Explicit Using a Binary Stream System-Designation Approach
par: Mossbridge, Julia
Publié: (2024)
par: Mossbridge, Julia
Publié: (2024)
Event-based Solutions for Human-centered Applications: A Comprehensive Review
par: Adra, Mira, et autres
Publié: (2025)
par: Adra, Mira, et autres
Publié: (2025)
High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models
par: He, Mengqi, et autres
Publié: (2025)
par: He, Mengqi, et autres
Publié: (2025)
Efficient Diffusion Training through Parallelization with Truncated Karhunen-Loève Expansion
par: Ren, Yumeng, et autres
Publié: (2025)
par: Ren, Yumeng, et autres
Publié: (2025)
Proto-FG3D: Prototype-based Interpretable Fine-Grained 3D Shape Classification
par: Ma, Shuxian, et autres
Publié: (2025)
par: Ma, Shuxian, et autres
Publié: (2025)
A Big Data Approach to Understand Sub-national Determinants of FDI in Africa
par: Colladon, A. Fronzetti, et autres
Publié: (2024)
par: Colladon, A. Fronzetti, et autres
Publié: (2024)
Grandes modelos de lenguaje: de la predicción de palabras a la comprensión?
par: Gómez-Rodríguez, Carlos
Publié: (2025)
par: Gómez-Rodríguez, Carlos
Publié: (2025)
What's Not on the Plate? Rethinking Food Computing through Indigenous Indian Datasets
par: Gogoi, Pamir, et autres
Publié: (2025)
par: Gogoi, Pamir, et autres
Publié: (2025)
Designing UNICORN: a Unified Benchmark for Imaging in Computational Pathology, Radiology, and Natural Language
par: Stegeman, Michelle, et autres
Publié: (2026)
par: Stegeman, Michelle, et autres
Publié: (2026)
A Review of Pseudo-Labeling for Computer Vision
par: Kage, Patrick, et autres
Publié: (2024)
par: Kage, Patrick, et autres
Publié: (2024)
Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint Detection
par: Maity, Subhajit, et autres
Publié: (2025)
par: Maity, Subhajit, et autres
Publié: (2025)
Few-Class Arena: A Benchmark for Efficient Selection of Vision Models and Dataset Difficulty Measurement
par: Cao, Bryan Bo, et autres
Publié: (2024)
par: Cao, Bryan Bo, et autres
Publié: (2024)
StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos
par: Zhao, Sijie, et autres
Publié: (2024)
par: Zhao, Sijie, et autres
Publié: (2024)
ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2024)
par: Ramakrishnan, Aashish Anantha, et autres
Publié: (2024)
STRICT: Stress Test of Rendering Images Containing Text
par: Zhang, Tianyu, et autres
Publié: (2025)
par: Zhang, Tianyu, et autres
Publié: (2025)
LightMover: Generative Light Movement with Color and Intensity Controls
par: Zhou, Gengze, et autres
Publié: (2026)
par: Zhou, Gengze, et autres
Publié: (2026)
Benchmarking Vision Language Models on German Factual Data
par: Peinl, René, et autres
Publié: (2025)
par: Peinl, René, et autres
Publié: (2025)
Investigating the Capabilities and Limitations of Machine Learning for Identifying Bias in English Language Data with Information and Heritage Professionals
par: Havens, Lucy, et autres
Publié: (2025)
par: Havens, Lucy, et autres
Publié: (2025)
Context-Aware Full Body Anonymization using Text-to-Image Diffusion Models
par: Zwick, Pascal, et autres
Publié: (2024)
par: Zwick, Pascal, et autres
Publié: (2024)
Goal-conditioned reinforcement learning for ultrasound navigation guidance
par: Amadou, Abdoul Aziz, et autres
Publié: (2024)
par: Amadou, Abdoul Aziz, et autres
Publié: (2024)
Multi-Objective Optimization for Synthetic-to-Real Style Transfer
par: Chigot, Estelle, et autres
Publié: (2026)
par: Chigot, Estelle, et autres
Publié: (2026)
Foreground Focus: Enhancing Coherence and Fidelity in Camouflaged Image Generation
par: Chen, Pei-Chi, et autres
Publié: (2025)
par: Chen, Pei-Chi, et autres
Publié: (2025)
Unified Local and Global Attention Interaction Modeling for Vision Transformers
par: Nguyen, Tan, et autres
Publié: (2024)
par: Nguyen, Tan, et autres
Publié: (2024)
Beyond Specialization: Assessing the Capabilities of MLLMs in Age and Gender Estimation
par: Kuprashevich, Maksim, et autres
Publié: (2024)
par: Kuprashevich, Maksim, et autres
Publié: (2024)
BEMTrace: Visualization-driven approach for deriving Building Energy Models from BIM
par: Walch, Andreas, et autres
Publié: (2024)
par: Walch, Andreas, et autres
Publié: (2024)
The role of media memorability in facilitating startups' access to venture capital funding
par: Toschi, L., et autres
Publié: (2025)
par: Toschi, L., et autres
Publié: (2025)
Documents similaires
-
Sign Language Recognition and Translation for Low-Resource Languages: Challenges and Pathways Forward
par: Alishzade, Nigar, et autres
Publié: (2026) -
A Comparative Analysis of Recurrent and Attention Architectures for Isolated Sign Language Recognition
par: Alishzade, Nigar, et autres
Publié: (2025) -
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
par: Ma, Chong, et autres
Publié: (2024) -
Seeing The Words: Evaluating AI-generated Biblical Art
par: Makimei, Hidde, et autres
Publié: (2025) -
CerberusDet: Unified Multi-Dataset Object Detection
par: Tolstykh, Irina, et autres
Publié: (2024)