¡Hola! Estoy usando DeepSeek, el modelo más reciente de la empresa DeepSeek (深度求索).
Específicamente, soy la versión más reciente del modelo DeepSeek, lanzada en 2026. Mis capacidades incluyen:
Contexto de 1M tokens (puedo procesar libros enteros como la trilogía de Los Tres Cuerpos)
Búsqueda en internet (cuando activas la función desde la web o app)
Soporte para archivos (imágenes, PDF, Word, Excel, PowerPoint, TXT)
Entrada de voz (en la app móvil)
Totalmente gratuito (sin planes de cobro por ahora)
Detalles Técnicos
Claro, aquí tienes los detalles técnicos más destacados sobre mi arquitectura. Soy el modelo **DeepSeek-V4**, específicamente la versión **DeepSeek-V4-Flash** en esta conversación .
Para que los detalles sean más fáciles de digerir, he organizado la información en tres categorías principales.
---
### ⚙️ 1. Arquitectura y Componentes Clave
Mi arquitectura está diseñada para ser excepcionalmente eficiente, especialmente en el manejo de contextos largos . Estos son algunos de sus componentes más innovadores:
* **Arquitectura Principal**: Uso una arquitectura **Mixture-of-Experts (MoE)** . Esto significa que, aunque tengo un número muy alto de parámetros totales (284 mil millones para la versión Flash), solo una pequeña parte se activa por cada tarea (13 mil millones), lo que me permite ser rápido y eficiente .
* **Atención Híbrida (CSA + HCA)**: Esta es una de las innovaciones clave para manejar mi contexto de 1 millón de tokens .
* **Compressed Sparse Attention (CSA)**: Comprime la información de varios tokens en una "entrada" resumida y luego selecciona las más relevantes para prestarles atención. Es como leer un resumen y luego profundizar en las partes clave .
* **Heavily Compressed Attention (HCA)**: Realiza una compresión mucho más agresiva de toda la secuencia, creando un resumen global. Esto asegura que no se pierda el contexto general .
Esta combinación reduce drásticamente la memoria y el cómputo necesarios, llegando a usar solo el **10% de la memoria (KV cache)** que necesitaría un modelo como DeepSeek-V3.2 para procesar 1M de tokens .
* **Conexiones Residuales (mHC)**: Mi arquitectura utiliza **Manifold-Constrained Hyper-Connections (mHC)** . Este mecanismo mejora la estabilidad del entrenamiento al regular el flujo de información entre las capas, previniendo que las señales se distorsionen en redes muy profundas .
---
### 💻 2. Entrenamiento y Optimización
El proceso de entrenamiento y los componentes de optimización también incorporan avances significativos:
* **Optimizador Muon**: He sido entrenado con el optimizador **Muon**, a diferencia de los modelos anteriores que usaban AdamW . Esto contribuye a una convergencia más rápida y estable durante el entrenamiento .
* **Precisión Mixta (FP4 y FP8)**: Uso una combinación de precisión **FP4** y **FP8** para diferentes partes del modelo . Por ejemplo, los parámetros de los expertos MoE usan FP4, y el resto, FP8. Esto reduce significativamente el tamaño del modelo y acelera la inferencia .
* **Datos de Entrenamiento**: Mi entrenamiento se realizó con un conjunto de datos masivo de aproximadamente **32 a 33 billones de tokens**, con un fuerte énfasis en datos de razonamiento, matemáticas, código y textos largos .
---
### 📊 3. Especificaciones y Rendimiento
Aquí un resumen de mis especificaciones clave y las de mi "hermana mayor", la versión Pro :
| Característica | DeepSeek-V4-Flash (Yo) | DeepSeek-V4-Pro |
| :--- | :--- | :--- |
| **Parámetros Totales** | 284 Mil Millones | 1.6 Billones |
| **Parámetros Activados** | 13 Mil Millones | 49 Mil Millones |
| **Contexto** | 1 Millón de tokens | 1 Millón de tokens |
| **Salida Máxima** | Hasta 384,000 tokens | Hasta 384,000 tokens |
| **Precio (Input/Output)** | $0.14 / $0.28 por 1M | $0.435 / $0.87 por 1M |
Además, ofrezco un control sobre el esfuerzo de razonamiento a través del parámetro `reasoning_effort`, permitiendo elegir entre respuestas más rápidas o un razonamiento más profundo según la tarea .
No hay comentarios:
Publicar un comentario