
Este artículo está basado en el video de Nate Gentile sobre “Lo que no te contaron de DEEPSEEK: La IA China” reformulado en forma de preguntas y respuestas cortas.
High Flyer fue fundada por Liang We Feng, un ex estudiante de ingeniería. La empresa se dedicaba al quant trading, utilizando modelos computacionales automatizados para la compra y venta de activos financieros. Esta incursión temprana en el uso de modelos complejos y la gestión de grandes cantidades de datos financieros proporcionó la experiencia y el capital semilla que eventualmente llevarían a la fundación de DeepSeek.
La principal motivación de Liang We Feng para fundar DeepSeek fue su sueño de aplicar la inteligencia artificial, particularmente el machine learning, a los mercados financieros de una manera más avanzada de lo que permitía el quant trading tradicional. El hito más significativo de DeepSeek a finales de 2024 fue el lanzamiento de modelos de lenguaje grandes (LLMs) como DeepSeek V3 y R1, los cuales demostraron un rendimiento superior en ciertas pruebas comparativas con algunos de los modelos líderes de empresas estadounidenses como OpenAI y Google, en áreas como conocimiento general, razonamiento lógico y comprensión avanzada.
A diferencia de OpenAI o Google, que tienen estructuras de propiedad más complejas que involucran inversión de riesgo y en el caso de Google, una gran corporación matriz, DeepSeek se fundó con capital privado proveniente de la firma de inversión de Liang We Feng, High Flyer. Si bien el gobierno chino fomenta activamente el desarrollo de la inteligencia artificial a través de diversos proyectos e incentivos a largo plazo (como la construcción de centros de datos y el apoyo a la IA en universidades), DeepSeek no tiene una afiliación directa o propiedad gubernamental demostrada, operando más bien como una empresa privada con un modelo capitalista similar al de las empresas tecnológicas estadounidenses.
DeepSeek V3 y R1 son modelos de lenguaje grandes (LLMs) capaces de generar texto, al igual que ChatGPT, Claude o Gemini. En diversas pruebas de rendimiento, DeepSeek V3 ha demostrado ser competitivo e incluso superior en algunas áreas como conocimiento general, razonamiento lógico y comprensión avanzada. Su propuesta de valor diferencial radica principalmente en dos aspectos: el costo de su API, que es significativamente más bajo (aproximadamente diez veces menor por millón de tokens de salida en comparación con GPT-4), y la disponibilidad de sus modelos, ya que DeepSeek liberó V3 y R1 de forma open source y gratuita. Esto permite a los usuarios descargar y ejecutar los modelos en su propia infraestructura, una característica no ofrecida por modelos propietarios como ChatGPT o Gemini.
La liberación open source y gratuita de DeepSeek V3 y R1 ha generado un gran impacto en la industria de la IA al democratizar el acceso a modelos de lenguaje de alto rendimiento. Permite a investigadores, desarrolladores y empresas utilizar, estudiar, modificar y adaptar estos modelos sin incurrir en costos de licencia, fomentando la innovación y la competencia. Aunque representa una potencial amenaza para el modelo de negocio basado en APIs de otras empresas, también posiciona a DeepSeek como un contribuyente clave al avance de la IA y le permite ganar visibilidad y la colaboración de la comunidad para mejorar sus modelos.
La arquitectura “Mixture of Experts” (MoE) es una técnica donde un modelo de IA grande se compone de múltiples submodelos más pequeños, llamados “expertos,” cada uno especializado en diferentes áreas de conocimiento o tipos de tareas. Un “enrutador” dentro del modelo analiza la entrada (pregunta o instrucción) y decide qué experto o combinación de expertos es el más adecuado para procesarla, activando solo una parte del modelo en cada interacción. DeepSeek implementa un gran número de estos expertos, lo que permite una especialización más granular. Esta arquitectura mejora la eficiencia al reducir la cantidad de cómputo necesario para cada consulta, ya que no se activa la totalidad del modelo, lo que se traduce en menores costos de operación y la posibilidad de ejecutar modelos más grandes con menos recursos.
Entrenar modelos de IA utilizando formatos de precisión numérica más baja como FP8 ofrece varias ventajas significativas: reduce el espacio de memoria requerido para almacenar los parámetros del modelo, lo que permite modelos más grandes o la ejecución de modelos existentes con menos hardware; y acelera el tiempo de entrenamiento, ya que las operaciones con números de menor precisión son más rápidas. Sin embargo, una menor precisión puede llevar a una pérdida de rendimiento del modelo. Para mitigar esto, DeepSeek implementó un “mixed precision framework” (marco de trabajo de precisión mixta), utilizando diferentes precisiones numéricas en distintas partes del modelo. Esto permite aprovechar los beneficios de FP8 en términos de eficiencia y velocidad en las partes del modelo donde la precisión no es crítica, mientras se mantiene una mayor precisión (como FP16 o FP32) en las capas o parámetros donde es esencial para el rendimiento del modelo.
Ante la restricción de no poder acceder libremente a las GPUs NVIDIA H100, DeepSeek utilizó una cantidad significativa (2048 unidades) de la versión ligeramente menos potente y con menor ancho de banda de memoria, la H800. Para superar las limitaciones en la velocidad de comunicación entre las GPUs H800, DeepSeek desarrolló un software de comunicación entre GPUs altamente optimizado desde cero, utilizando el lenguaje de bajo nivel PTX de NVIDIA. Este software implementó técnicas como la compresión de datos y la gestión eficiente del ancho de banda disponible, permitiendo a las GPUs comunicarse de manera más rápida y eficiente de lo que sería posible con las herramientas estándar como CUDA. Al optimizar el software para el hardware disponible, DeepSeek logró un rendimiento de entrenamiento de sus modelos comparable al que se podría esperar con hardware más avanzado, demostrando la importancia de la optimización de software en el desarrollo de la IA a gran escala.
La siguiente línea de tiempo muestra el desarrollo del texto basado en las fechas en las que aparecen los elementos cruciales en la aparición de Deep Seek
/ hablemos /
Define tus objetivos y las áreas donde la tecnología puede aportar valor a tu negocio. Nosotros ponemos el equipo.
Contáctanos