Skip to main content
La API Text Parser extrae texto de un documento sin ejecutar inferencia del modelo. Úsala cuando tu aplicación necesite inspeccionar, almacenar, indexar o reutilizar el contenido de un documento antes de enviarlo a un modelo. Los formatos de entrada compatibles incluyen archivos PDF, DOCX, PPTX, XLSX y de texto sin formato de hasta 25 MB.

Analiza un documento

Sube el archivo como multipart/form-data:
El formato de respuesta predeterminado json devuelve el texto extraído y su recuento de tokens. Usa response_format=text cuando solo necesites el texto extraído.

¿Text Parser o entrada de archivo en el chat?

Ambas funciones extraen el contenido del documento, pero sirven para flujos de trabajo distintos:

Flujo típico

1

Analiza el archivo

Sube el documento fuente y solicita una respuesta JSON.
2

Inspecciona la salida

Compara el recuento de tokens con la ventana de contexto del modelo de destino. Recorta o divide los documentos grandes antes de la inferencia.
3

Utiliza el texto

Agrégalo a un prompt de chat, genera embeddings para recuperación o guárdalo en tu propio almacén de datos.
El análisis se ejecuta en memoria sin retención de datos. Venice procesa el documento subido y lo descarta de inmediato, sin almacenar ni registrar su contenido.
La API Text Parser es experimental. El formato de sus solicitudes y respuestas puede cambiar sin previo aviso.

Convierte el texto en registros

El texto extraído es un punto de partida, no un resultado. Extracción de datos estructurados de documentos continúa desde aquí: fija la salida a un esquema JSON para que cada documento produzca los mismos campos, y cambia a un modelo de visión cuando el analizador informa que un archivo no tiene texto que extraer.

Recursos relacionados