Una nueva empresa desarrolladora de IA está revolucionando el panorama digital. Su nombre es DeepSeek, y se trata de una startup china fundada en 2023 especializada en la creación de modelos de código abierto. Han sido sus prototipos más recientes DeepSeek R1 y DeepSeek V3 los que han propiciado que todos los focos apunten a la desarrolladora china y la sitúen como una firme competidora para otros gigantes de la industria.
El hecho de que esta IA de código abierto sea tan competitiva como la tecnología de OpenAI y que requiera chips de menor capacidad, ha provocado que se cuestione el liderazgo tecnológico de empresas estadounidenses como Nvidia, que vio caer sus acciones un 17% y perdió cerca de 600.000 millones de dólares. Esto ha provocado que Nvidia pierda el título de empresa más valiosa del mundo, siendo superada por Apple (1ª) y Microsoft (2ª). Otros gigantes tecnológicos también se han visto afectados, Alphabet cayó un 4% y Microsoft un 2%.
Así mismo, también se ha dado una caída significativa en los mercados bursátiles, especialmente en el Nasdaq, que se desplomó un 3,77%. Por su parte, el lunes 27, los futuros del Dow Jones perdieron un 1,04%, mientras que los del S&P 500 cayeron un 2,29%. Estas reacciones negativas comenzaron a manifestarse el pasado viernes, cuando las acciones estadounidenses cayeron en el mercado.
Actualmente existen una serie de restricciones impuestas por Estados Unidos, que prohíben la venta de chips avanzados a empresas chinas. Algo que no ha impedido que DeepSeek avance en sus investigaciones tecnológicas. El periodista Holger Zschaepitz explicó en sus redes sociales que, el hecho de que DeepSeek parezca «haber construido un modelo de inteligencia artificial innovador a un precio extremadamente bajo y sin acceso a chips de última generación, pone en duda la utilidad de los cientos de miles de millones de dólares en gastos de capital que se están invirtiendo en esta industria».
China’s #DeepSeek could represent the biggest threat to US equity markets as the company seems to have built a groundbreaking AI model at an extremely low price and w/o having access to cutting-edge chips, calling into question the utility of the hundreds of billions worth of… pic.twitter.com/wMVyczpRgT — Holger Zschaepitz (@Schuldensuehner) January 24, 2025
China’s #DeepSeek could represent the biggest threat to US equity markets as the company seems to have built a groundbreaking AI model at an extremely low price and w/o having access to cutting-edge chips, calling into question the utility of the hundreds of billions worth of… pic.twitter.com/wMVyczpRgT
— Holger Zschaepitz (@Schuldensuehner) January 24, 2025
DeepSeek fue fundada en 2023 por Liang Wenfeng, quien también es fundador de High-Flyer Capital Management, una empresa de fondos de cobertura que actualmente es la única compañía que financia DeepSeek. El primer producto de la compañía fue DeepSeek Coder, un modelo de código abierto especializado en tareas de codificación, lanzado en noviembre de 2023.
Actualmente, el equipo de DeepSeek se compone principalmente por jóvenes salidos de las mejores universidades chinas, poniendo el foco en la innovación tecnológica. Por otra parte, el no contar con inversores externos al presentar un modelo de financiación única le ha permitido a la compañía evolucionar sin presiones hacia proyectos de IA a largo plazo.
Eso sí, DeepSeek sí está sujeto a evaluaciones por parte del regulador de Internet de China, cuya labor es cerciorarse de que esta tecnología cumple con los “valores socialistas fundamentales”. Esto implica que la IA no responde a ciertas consultas que considera temas sensibles.
Por ejemplo, le he preguntado acerca de las protestas de la plaza de Tiananmén de 1989 y también sobre la Guerra Civil en España, y su respuesta ha sido totalmente diferente. Mientras que afirma no poder responder a la primera cuestión, sí que me ofrece un resumen sobre el segundo tema.
El pasado 20 de noviembre, la startup china presentaba una vista previa de su IA DeepSeek R1 y el 20 de enero lo lanzaba en versión abierta. Este se trata de un modelo de razonamiento de código abierto cuyo rendimiento, según afirma, supera a o1 de OpenAI en ciertos parámetros.
Concretamente, los parámetros en los que R1 destaca son AIME (mide la eficiencia de un modelo de IA), MATH-500 (centrado en problemas matemáticos) y SWE-bench Veridied (tareas de programación).
Al tratarse de un modelo de razonamiento, R1 es capaz de verificarse a sí mismo y las respuestas que da, a través de un pensamiento profundo. Esto supone que sus tiempos de respuesta sean un poco más lentos que los de otras IAs generadoras, pero garantiza unas respuestas más completas y acertadas. DeepSeek R1 razona mediante tareas, planifica de forma anticipada y ejecuta acciones que le permiten llegar al resultado correcto.
Han pasado solo 3 días desde que salió Deepseek R1 y es una LOCURA SPOILER: ChatGPT se está quedando atrás. 13 ejemplos increíbles hasta ahora (no te pierdas el quinto) pic.twitter.com/QsHNWEmp7d — Filipe | IA (@filicroval) January 24, 2025
Han pasado solo 3 días desde que salió Deepseek R1 y es una LOCURA
SPOILER: ChatGPT se está quedando atrás.
13 ejemplos increíbles hasta ahora (no te pierdas el quinto) pic.twitter.com/QsHNWEmp7d
— Filipe | IA (@filicroval) January 24, 2025
Esta IA contiene 671.000 millones de parámetros (variables internas que usan los modelos de IA para hacer predicciones o tomar decisiones), aunque la desarrolladora ha lanzado dos versiones reducidas que van desde los 1.500 millones hasta los 70.000 millones de parámetros. De este modo, pueden adaptarse al sistema en el que se vayan a ejecutar, por ejemplo la versión más pequeña es admisible para un ordenador portátil, mientras que para la versión completa se requiere un hardware de gran potencia.
Actualmente, el modelo R1 se encuentra disponible en Hugging Face bajo una licencia MIT y sin restricciones comerciales.
Tan solo unos días después de lanzar R1 en versión abierta, DeepSeek presentó su modelo V3. Esta IA es un modelo de lenguaje MoE (Mixture-of-Experts), lo que significa que se basa en una arquitectura neuronal avanzada capaz de dividir el aprendizaje entre diversos “expertos” especializados en tareas o subconjuntos de datos concretos. De este modo, se combinan las fortalezas de varios modelos especializados para lograr un rendimiento general superior.
DeepSeek V3 está compuesto por 671.000 millones de parámetros, con 37.000 millones activados para cada token. Este modelo es capaz de manejar diversas tareas basadas en texto, como trabajos de codificación, traducción y redacción, a través de indicaciones descriptivas.
De acuerdo con datos publicados por la propia compañía, DeepSeek V3 supera a modelos como Llama 3.1 405B, Claude 3.5 o GPT-4o en diversos parámetros.
Introducing DeepSeek-V3! Biggest leap forward yet: ⚡ 60 tokens/second (3x faster than V2!) Enhanced capabilities API compatibility intact Fully open-source models & papers 1/n pic.twitter.com/p1dV9gJ2Sd — DeepSeek (@deepseek_ai) December 26, 2024
Introducing DeepSeek-V3!
Biggest leap forward yet: ⚡ 60 tokens/second (3x faster than V2!) Enhanced capabilities API compatibility intact Fully open-source models & papers
1/n pic.twitter.com/p1dV9gJ2Sd
— DeepSeek (@deepseek_ai) December 26, 2024
Así mismo, esta IA ha dado mucho de que hablar por el hecho de que para su desarrollo se emplearon 2,788 millones de horas de entrenamiento y costó 5,5 millones de dólares. Si bien esta última cifra es abrumadora, si la comparamos con la del modelo GPT-4 de OpenAI resulta “modesta”, ya que en este se invirtieron unos 80 millones de dólares.
V3 se ha lanzado bajo una licencia que permite a los desarrolladores descargarlo y modificarlo para una amplia mayoría de apps, incluidas aplicaciones comerciales. Puedes acceder a este modelo en el sitio web de DeepSeek, en GitHub o en su app.
Foto: DeepSeek y Canva
No se han encontrado artículos relacionados.
Your email address will not be published. Required fields are marked *
Δ