-
facebook/wav2vec2-base-960h
El modelo Wav2Vec2-base-960h es un modelo de reconocimiento automático del habla basado en arquitectura Wav2Vec2 (codificador convolucional más transformer con objetivo CTC),... -
openai/whisper-small
El modelo Whisper-small es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), que ofrece mayor calidad... -
openai/whisper-base
El modelo Whisper-base es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), que ofrece mejor precisión... -
openai/whisper-tiny
El modelo Whisper-tiny es un modelo de reconocimiento automático del habla basado en arquitectura transformer encoder-decoder (sequence-to-sequence), especializado en... -
microsoft/trocr-base-printed
El modelo TrOCR-base-printed es un modelo de reconocimiento óptico de caracteres (OCR) basado en arquitectura vision-encoder-decoder, especializado en transcribir texto impreso... -
nlpconnect/vit-gpt2-image-captioning
El modelo ViT-GPT2-image-captioning es un modelo de generación de descripciones de imágenes basado en arquitectura vision-encoder-decoder, que combina un codificador Vision... -
microsoft/git-base-coco
El modelo GIT-base-COCO es un modelo de generación de texto a partir de imágenes basado en arquitectura GIT (GenerativeImage2Text), que condiciona la generación a la imagen de... -
Salesforce/blip-image-captioning-base
El modelo BLIP-image-captioning-base es un modelo de generación de descripciones de imágenes (image captioning) basado en arquitectura de visión-lenguaje, que produce... -
openai/clip-vit-base-patch32
El modelo CLIP (ViT-base-patch32) es un modelo de embeddings conjuntos de imagen y texto basado en una arquitectura de doble codificador (Vision Transformer + transformer de... -
Intel/dpt-large
El modelo DPT-Large es un modelo de estimación de profundidad monocular basado en arquitectura Dense Prediction Transformer, que infiere un mapa de profundidad a partir de una... -
facebook/mask2former-swin-small-coco-instance
El modelo Mask2Former (Swin-small, COCO instance) es un modelo de segmentación de instancias basado en arquitectura de atención enmascarada con backbone Swin-small. Ha sido... -
nvidia/segformer-b0-finetuned-ade-512-512
El modelo SegFormer-B0 (ADE 512×512) es un modelo de segmentación semántica basado en arquitectura transformer jerárquica (SegFormer), que asigna una clase a cada píxel de la... -
hustvl/yolos-tiny
El modelo YOLOS-tiny es un modelo de detección de objetos basado en arquitectura Vision Transformer (ViT), en su variante ligera. Ha sido entrenado sobre el dataset de... -
facebook/detr-resnet-50
El modelo DETR-ResNet-50 es un modelo de detección de objetos basado en arquitectura DETR (DEtection TRansformer), que combina un backbone convolucional ResNet-50 con un... -
google/mobilenet_v2_1.0_224
El modelo MobileNetV2 (1.0, 224) es un modelo de clasificación de imágenes basado en arquitectura de red convolucional ligera, diseñado para inferencia en dispositivos de borde... -
facebook/convnext-base-224
El modelo ConvNeXt-base-224 es un modelo de clasificación de imágenes basado en arquitectura de red neuronal convolucional moderna (ConvNeXt), que alcanza una precisión... -
microsoft/resnet-50
El modelo ResNet-50 es un modelo de clasificación de imágenes basado en arquitectura de red neuronal convolucional con conexiones residuales, un clásico de la visión por... -
google/vit-base-patch16-224
El modelo ViT-base-patch16-224 es un modelo de clasificación de imágenes basado en arquitectura Vision Transformer, que divide la imagen en parches de 16×16 píxeles y los... -
mrm8488/bert2bert_shared-spanish-finetuned-summarization
El modelo bert2bert_shared-spanish-finetuned-summarization es un modelo de generación de texto basado en arquitectura encoder-decoder de tipo BERT2BERT, especializado en tareas... -
facebook/bart-large-cnn
El modelo BART-large-CNN es un modelo de generación de texto basado en arquitectura sequence-to-sequence (BART), especializado en tareas de resumen abstractivo en inglés. Ha...