110 datasets found

Organizations: DemIA Marketplace

Filter Results
  • facebook/wav2vec2-base-960h

    El modelo Wav2Vec2-base-960h es un modelo de reconocimiento automático del habla basado en arquitectura Wav2Vec2 (codificador convolucional más transformer con objetivo CTC),...
  • openai/whisper-small

    El modelo Whisper-small es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), que ofrece mayor calidad...
  • openai/whisper-base

    El modelo Whisper-base es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), que ofrece mejor precisión...
  • openai/whisper-tiny

    El modelo Whisper-tiny es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), especializado en...
  • microsoft/trocr-base-printed

    El modelo TrOCR-base-printed es un modelo de reconocimiento óptico de caracteres (OCR) basado en arquitectura vision-encoder-decoder, especializado en transcribir texto impreso...
  • nlpconnect/vit-gpt2-image-captioning

    El modelo ViT-GPT2-image-captioning es un modelo de generación de descripciones de imágenes basado en arquitectura vision-encoder-decoder, que combina un codificador Vision...
  • microsoft/git-base-coco

    El modelo GIT-base-COCO es un modelo de generación de texto a partir de imágenes basado en arquitectura GIT (GenerativeImage2Text), que condiciona la generación a la imagen de...
  • Salesforce/blip-image-captioning-base

    El modelo BLIP-image-captioning-base es un modelo de generación de descripciones de imágenes (image captioning) basado en arquitectura de visión-lenguaje, que produce...
  • openai/clip-vit-base-patch32

    El modelo CLIP (ViT-base-patch32) es un modelo de embeddings conjuntos de imagen y texto basado en una arquitectura de doble codificador (Vision Transformer + transformer de...
  • Intel/dpt-large

    El modelo DPT-Large es un modelo de estimación de profundidad monocular basado en arquitectura Dense Prediction Transformer, que infiere un mapa de profundidad a partir de una...
  • facebook/mask2former-swin-small-coco-instance

    El modelo Mask2Former (Swin-small, COCO instance) es un modelo de segmentación de instancias basado en arquitectura de atención enmascarada con backbone Swin-small. Ha sido...
  • nvidia/segformer-b0-finetuned-ade-512-512

    El modelo SegFormer-B0 (ADE 512×512) es un modelo de segmentación semántica basado en arquitectura transformer jerárquica (SegFormer), que asigna una clase a cada píxel de la...
  • hustvl/yolos-tiny

    El modelo YOLOS-tiny es un modelo de detección de objetos basado en arquitectura Vision Transformer (ViT), en su variante ligera. Ha sido entrenado sobre el dataset de...
  • facebook/detr-resnet-50

    El modelo DETR-ResNet-50 es un modelo de detección de objetos basado en arquitectura DETR (DEtection TRansformer), que combina un backbone convolucional ResNet-50 con un...
  • google/mobilenet_v2_1.0_224

    El modelo MobileNetV2 (1.0, 224) es un modelo de clasificación de imágenes basado en arquitectura de red convolucional ligera, diseñado para inferencia en dispositivos de borde...
  • facebook/convnext-base-224

    El modelo ConvNeXt-base-224 es un modelo de clasificación de imágenes basado en arquitectura de red neuronal convolucional moderna (ConvNeXt), que alcanza una precisión...
  • microsoft/resnet-50

    El modelo ResNet-50 es un modelo de clasificación de imágenes basado en arquitectura de red neuronal convolucional con conexiones residuales, un clásico de la visión por...
  • google/vit-base-patch16-224

    El modelo ViT-base-patch16-224 es un modelo de clasificación de imágenes basado en arquitectura Vision Transformer, que divide la imagen en parches de 16×16 píxeles y los...
  • mrm8488/bert2bert_shared-spanish-finetuned-summarization

    El modelo bert2bert_shared-spanish-finetuned-summarization es un modelo de generación de texto basado en arquitectura encoder-decoder de tipo BERT2BERT, especializado en tareas...
  • facebook/bart-large-cnn

    El modelo BART-large-CNN es un modelo de generación de texto basado en arquitectura sequence-to-sequence (BART), especializado en tareas de resumen abstractivo en inglés. Ha...
You can also access this registry using the API (see API Docs).