Chat
Claw
Code
Create
Wisebase
Aplicaciones
Precios
Agregar a Chrome
Iniciar sesión
Iniciar sesión
Chat
Claw
Code
Create
Wisebase
Aplicaciones
Volver al menú principal
Productos
Aplicaciones
  • Extensiones
  • iOS
  • Android
  • Mac OS
  • Windows
Wisebase
  • Wisebase
  • Deep Research
  • Scholar Research
  • Math Solver
  • Rec NoteNew
  • Audio To Text
  • Gamified Learning
  • Interactive Reading
  • ChatPDF
Herramientas
  • Creador de sitios webNew
  • Presentaciones de IANew
  • Escritor de ensayos AI
  • Nano Banana Pro
  • Nano Banana Infographic
  • Generador de imágenes AI
  • Generador de Brainrot Italiano
  • Removedor de fondo
  • Cambiador de fondo
  • Borrador de fotos
  • Removedor de texto
  • Retoque
  • Mejorador de imágenes
  • Crear
  • Traductor AI
  • Traductor de imágenes
  • Traductor de PDF
Sider
  • Contáctanos
  • Centro de ayuda
  • Descargar
  • Precios
  • Plan de Educación
  • Novedades
  • Blog
  • Comunidad
  • Socios
  • Afiliado
©2026 Todos los derechos reservados
Términos de uso
Política de privacidad
  • Página de inicio
  • Blog
  • Herramientas de IA
  • Tutorial de DeepSeek‑OCR: Comprimir historiales de chat, registros y datos para LLMs

Tutorial de DeepSeek‑OCR: Comprimir historiales de chat, registros y datos para LLMs

Actualizado el 23 de oct de 2025

5 min


Introducción: Por qué la compresión es ahora una superpotencia para los LLM Si alguna vez has intentado meter registros de chat, telemetría o rastreos de aplicaciones multi-sistema de una semana en un prompt, te has topado con el duro límite de las ventanas de contexto. La táctica habitual (resumir, podar, dividir) solo te lleva hasta cierto punto antes de que la pérdida de señal se filtre. DeepSeek‑OCR introduce un giro sorprendente: comprime el texto en tokens de visión utilizando una canalización OCR‑VLM para reducir drásticamente el contexto sin descartar el significado. Los primeros informes de la comunidad citan una eficiencia de compresión de orden de magnitud al aprovechar los tokens visuales en lugar de los tokens de texto sin formato, un paradigma que algunos análisis describen como "Compresión Óptica de Contexto" y "miles de tokens de texto en unos pocos cientos de tokens de visión" para flujos de trabajo de contexto largo.
En este práctico tutorial paso a paso de DeepSeek‑OCR, aprenderás a comprimir historiales de chat, registros y datos para LLM, manteniendo la precisión de la recuperación, además de cómo combinar la compresión basada en OCR con el resumen, la división jerárquica y RAG para obtener indicaciones potentes y de baja latencia.
A quién va dirigida esta guía
  • Constructores de copilotos de IA que deben ingerir chats largos y rastros de actividad
  • Ingenieros de datos que manipulan registros, rastreos y métricas para el razonamiento de LLM
  • Investigadores que prototipan flujos de trabajo de contexto ultra largo con un presupuesto limitado
Gancho en una frase: Si puedes convertir texto extenso en representaciones visuales compactas que los LLM puedan leer, recuperas presupuesto de contexto sin sacrificar las migas de pan del razonamiento.
¿Qué es la compresión DeepSeek‑OCR? La idea central
  • Compresión de tokens de visión: Convierte extensiones de texto densas en incrustaciones visuales de alta información; los tokens de visión pueden ser más baratos y compactos que los tokens de texto equivalentes.
  • Compresión Óptica de Contexto: Utiliza OCR/VLM para codificar un contexto textual grande como imágenes o diseños visualmente estructurados, preservando la estructura semántica mientras se reducen los recuentos de tokens.
  • Flujos de trabajo de contexto largo: Comprime miles de tokens en cientos de tokens de visión, lo que permite conjuntos de trabajo más grandes para la planificación, el uso de herramientas o el razonamiento de varios turnos.
Cuándo usarlo
  • Historiales de chat con frases repetitivas o estructura predecible
  • Registros del sistema, rastreos, salidas de compilación o volcados de análisis
  • Instantáneas de documentación, paneles de control o informes semiestructurados
Qué construirás en este tutorial Implementarás una canalización para:
  1. Normalizar y segmentar datos de chat/registro.
  1. Elegir estrategias de compresión (OCR‑visual, resumen textual o híbrida).
  1. Generar representaciones visuales compactas a través de DeepSeek‑OCR.
  1. Indexar con metadatos para la recuperación.
  1. Consultar con un prompt RAG híbrido que acepte tanto texto como imágenes.
  1. Evaluar la fidelidad y el coste.
Sección 1: Preparación de datos: Haz que los historiales desordenados sean compatibles con el modelo
  • Normalizar marcas de tiempo y roles: p. ej., {timestamp:"yyyy-mm-dd hh:mm:ss", role:"user|system|tool", content:"..."}.
  • Contras: requiere soporte VLM; necesita renderizado y E/S de imagen.
  • Usar cuando: necesites fidelidad de contexto largo, diagramas/tablas o retención de frases exactas.
  • Híbrido (recomendado)
  • Mantén el resumen de texto "esqueletal" para el anclaje + adjunta tarjetas visuales comprimidas para la profundidad.
  • Esto equilibra la precisión de la recuperación (texto) y la recuperación/fidelidad (visión).
Sección 3: Construcción de tarjetas de contexto visual con DeepSeek‑OCR Objetivo: Transformar extensiones de texto de 5 a 20 KB en imágenes de 512 a 1024 px optimizadas para la lectura OCR/VLM.
Sugerencias de plantillas
  • Barra de título: ID de sesión, rango de tiempo, etiqueta de tema.
  • Diseño de dos columnas: columna izquierda para giros/registros clave; columna derecha para destacados (errores, decisiones, comandos, métricas).
  • Bloques monoespacio para líneas de código/registro; resúmenes con viñetas para el contexto.
  • Tema amigable con el contraste; evita fuentes pequeñas ( <11–12 pt a escala 1x).
Consejos de renderizado
  • Utiliza HTML/CSS para producir tarjetas limpias y consistentes (p. ej., capturas de pantalla de Puppeteer/Playwright).
  • Incluye anclajes estables (números de línea, ID) para hacer referencia a elementos específicos en los prompts.
  • Limita a ~200–400 palabras por tarjeta; crea una pila de tarjetas por sesión.
Paso de DeepSeek‑OCR
  • Ejecuta DeepSeek‑OCR para asegurar la fidelidad de ida y vuelta: tarjeta → texto OCR. Esto verifica que tu diseño y fuentes se decodifiquen con precisión.
  • Si el texto OCR diverge, ajusta las fuentes, el espaciado o divide el código denso en varias tarjetas.
Por qué funciona esto Los artículos de la comunidad y de terceros apuntan a ganancias de eficiencia significativas al comprimir el contexto textual en tokens de visión, manteniendo la legibilidad.
Sección 4: Capas de resumen: Mantén el esqueleto, guarda el músculo Implementa resúmenes en capas para que puedas aumentar la resolución solo cuando sea necesario.
  • L0: Etiquetas atómicas de línea/turno: rol, marca de tiempo, tipo (error, nota, código), incrustación.
  • L1: Micro resumen (1–2 frases) por cada 20–40 turnos o 2–5 minutos de registros.
  • L2: Resumen de sesión (5–8 viñetas) con decisiones, bloqueadores, resultados y enlaces a tarjetas visuales.
  • L3: Hilo de hilos: resúmenes semanales o a nivel de proyecto.
Heurísticas prácticas
  • Siempre incluye anclajes textuales: códigos de error, ID de SQL, ID de seguimiento, SHA de confirmación.
  • Utiliza resúmenes extractivos antes que abstractivos; luego refina con abstractivos para mejorar la legibilidad.
  • Añade una viñeta de "qué ha cambiado desde la última sesión" para acelerar el prompting de puesta al día.
Sección 5: Indexación y recuperación para RAG híbrido Esquema de metadatos
  • doc_id, session_id, time_range, roles, topic labels
  • importance score, error severity, component/service
  • links: {card_id, L0_line_number}
  • Combina la compresión basada en OCR con resúmenes en capas y RAG para obtener precisión y profundidad.
  • Optimiza los diseños, las fuentes y la indexación para mantener la fidelidad alta y la latencia baja.
  • Trata las tarjetas comprimidas como evidencia de primera clase y cítalas en los prompts.
Próximos pasos
  • Prototipa la canalización mínima en un proyecto de chat o conjunto de datos de registro.
  • Realiza pruebas A/B de compresión solo de texto frente a compresión híbrida para 10 consultas típicas.
  • Ajusta el diseño de la tarjeta, la mezcla del recuperador y los presupuestos en función de las métricas de fidelidad.
  • Escala a los flujos de trabajo del equipo con almacenamiento en caché, ACL y supervisión.

Preguntas frecuentes

P1: ¿Qué es DeepSeek‑OCR y por qué usarlo para comprimir historiales de chat para LLM? DeepSeek‑OCR permite la Compresión Óptica de Contexto: codificar grandes extensiones de texto como tokens visuales que los VLM pueden procesar de manera eficiente. Esto puede reducir los presupuestos de tokens y preservar mejor la estructura que el resumen solo de texto, al tiempo que mantiene una alta fidelidad para contextos largos.
P2: ¿Cómo se compara la compresión de tokens visuales con el resumen de texto? La compresión de tokens visuales a menudo logra una mayor compresión efectiva al tiempo que conserva el diseño y las frases exactas, lo que ayuda con las citas, el código y las cadenas de error. El resumen es más rápido y sencillo, pero puede omitir detalles raros o introducir errores de abstracción.
P3: ¿Puedo mezclar DeepSeek‑OCR con RAG para registros y chats? Sí. Utiliza resúmenes de texto para una recuperación rápida y adjunta tarjetas visuales validadas por OCR para obtener profundidad. Un recuperador de dos etapas puede obtener primero los resúmenes y luego las tarjetas más relevantes, equilibrando la precisión y la cobertura del contexto.
P4: ¿Qué diseños funcionan mejor para las tarjetas de contexto comprimidas por OCR? Utiliza HTML/CSS limpio con una barra de título, contenido de dos columnas, bloques monoespacio para el código y viñetas claras para los aspectos destacados. Mantén de 200 a 400 palabras por tarjeta, fuentes de 11 a 12 pt o más grandes, y valida la legibilidad con un viaje de ida y vuelta de OCR.
P5: ¿Cómo mido si la compresión está perdiendo información importante? Rastrea Fidelity@K con respecto a un conjunto dorado de hechos, la cobertura de evidencia a través de citas de número de línea y las métricas de latencia/coste. Apunta a una retención de hechos ≥95% y asegúrate de que la mayoría de las respuestas citen una línea de tarjeta o un ID de anclaje.

Artículos Recientes
Cómo dominar ChatPDF: Obtén insights más rápidos de documentos densos

Cómo dominar ChatPDF: Obtén insights más rápidos de documentos densos

La mejor alternativa a X Auto-Translation para documentos rápidos y precisos

La mejor alternativa a X Auto-Translation para documentos rápidos y precisos

¿Traducción AI de Samsung no disponible en Irán? Soluciones prácticas

¿Traducción AI de Samsung no disponible en Irán? Soluciones prácticas

Herramientas de traducción persa: una guía práctica para un trabajo más rápido y preciso

Herramientas de traducción persa: una guía práctica para un trabajo más rápido y preciso

La mejor alternativa a Grok para investigaciones profundas y citadas

La mejor alternativa a Grok para investigaciones profundas y citadas

Las 15 mejores funciones de los generadores de imágenes con IA que realmente usarás

Las 15 mejores funciones de los generadores de imágenes con IA que realmente usarás