Ponte en Contacto
 Duración 21 horas

Temario del curso

Introducción a la IA Multimodal y Ollama

  • Resumen del aprendizaje multimodal.
  • Principales desafíos en la integración de visión y lenguaje.
  • Capacidades y arquitectura de Ollama.

Configuración del Entorno de Ollama

  • Instalación y configuración de Ollama.
  • Trabajo con la implementación de modelos locales.
  • Integración de Ollama con Python y Jupyter.

Trabajo con Entradas Multimodales

  • Integración de texto e imágenes.
  • Incorporación de audio y datos estructurados.
  • Diseño de flujos de trabajo de preprocesamiento.

Aplicaciones de Comprensión de Documentos

  • Extracción de información estructurada de PDF e imágenes.
  • Combinación de OCR con modelos de lenguaje.
  • Construcción de flujos de trabajo inteligentes de análisis de documentos.

Respuesta Visual a Preguntas (VQA)

  • Configuración de conjuntos de datos y benchmarks de VQA.
  • Entrenamiento y evaluación de modelos multimodales.
  • Construcción de aplicaciones interactivas de VQA.

Diseño de Agentes Multimodales

  • Principios de diseño de agentes con razonamiento multimodal.
  • Combinación de percepción, lenguaje y acción.
  • Implementación de agentes para casos de uso en el mundo real.

Integración Avanzada y Optimización

  • Afinación (fine-tuning) de modelos multimodales con Ollama.
  • Optimización del rendimiento de inferencia.
  • Consideraciones sobre escalabilidad e implementación.

Resumen y Próximos Pasos

Requerimientos

  • Comprensión sólida de los conceptos de aprendizaje automático (machine learning).
  • Experiencia con marcos de aprendizaje profundo (deep learning) como PyTorch o TensorFlow.
  • Familiaridad con el procesamiento de lenguaje natural y la visión por computadora.

Público objetivo

  • Ingenieros de aprendizaje automático.
  • Investigadores de IA.
  • Desarrolladores de productos que integran flujos de trabajo de visión y texto.

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas