DATA CRED DESCARGOS DE RESPONSABILIDAD DE OCR, LIMITACIONES DEL PROCESAMIENTO DE DOCUMENTOS Y DIVULGACIONES DE RIESGOS DE INGESTIÓN
AVISO CRÍTICO: ESTE DOCUMENTO CONTIENE DIVULGACIONES COMPLETAS SOBRE LAS LIMITACIONES, INEXACTITUDES Y RIESGOS DE LA TECNOLOGÍA DE RECONOCIMIENTO ÓPTICO DE CARACTERES (OCR) Y DEL PROCESAMIENTO AUTOMATIZADO DE DOCUMENTOS. LOS ERRORES DE OCR SON COMUNES, ESPERADOS E INHERENTES A LA TECNOLOGÍA. POR FAVOR, LEA ESTE DOCUMENTO DETENIDAMENTE.
1. DESCRIPCIÓN GENERAL DE LA TECNOLOGÍA OCR
1.1 Qué es el OCR
El Reconocimiento Óptico de Caracteres (OCR) es una tecnología que convierte imágenes de texto, incluyendo documentos escaneados, fotografías, capturas de pantalla y PDF, en texto legible por máquina y datos estructurados. DataCred utiliza sistemas OCR mejorados con IA para extraer información de imágenes de documentos financieros, recibos, facturas, estados de cuenta bancarios, confirmaciones de transferencias, documentos de identificación y otros materiales enviados por los usuarios.
1.2 Qué No es el OCR
EL OCR NO ES UN SERVICIO DE TRANSCRIPCIÓN CERTIFICADA. EL OCR NO ES UN REGISTRO GARANTIZADAMENTE PRECISO DEL CONTENIDO DE NINGÚN DOCUMENTO. LAS SALIDAS DE OCR SON APROXIMACIONES, ESTIMACIONES E INTERPRETACIONES GENERADAS POR SISTEMAS AUTOMATIZADOS FALLIBLES. LAS SALIDAS DE OCR NUNCA DEBEN PRESUMIRSE COMO PRECISAS, COMPLETAS O FIELES AL DOCUMENTO ORIGINAL.
2. LIMITACIONES INHERENTES DEL OCR
2.1 Tasas de Error de Reconocimiento de Caracteres
Todos los sistemas OCR, incluyendo el de DataCred, tienen tasas de error de caracteres y palabras distintas de cero. Las tasas de error varían significativamente según la calidad del documento, el idioma, la escritura, la fuente, el diseño y otros factores. En condiciones óptimas (imágenes de alta resolución, limpias, bien iluminadas de texto impreso en fuentes comunes), la precisión a nivel de caracteres puede aproximarse al 99 %. En condiciones subóptimas (baja resolución, escritura a mano, diseños complejos, mala iluminación, fuentes no estándar, artefactos de compresión de imagen), las tasas de error pueden ser sustancialmente más altas, 10 %, 20 % o más.
2.2 Factores que Afectan la Precisión del OCR
#### 2.2.1 Factores de Calidad de Imagen
(a) Resolución: Las imágenes de baja resolución (por debajo de 200 DPI) degradan significativamente la precisión del OCR. Las capturas de pantalla de dispositivos móviles, que típicamente son de 72-150 DPI, se encuentran en el límite inferior de calidad aceptable.
(b) Enfoque y Nitidez: Las imágenes borrosas, desenfocadas o con desenfoque de movimiento producen tasas de error más altas.
(c) Iluminación: La iluminación desigual, sombras, destellos, sobreexposición y subexposición degradan la precisión del OCR. Las capturas de pantalla de pantallas retroiluminadas son particularmente problemáticas.
(d) Contraste: El texto de bajo contraste (texto gris claro sobre fondos blancos, o texto oscuro sobre fondos oscuros) puede no ser reconocido.
(e) Inclinación y Perspectiva: Los documentos fotografiados en ángulo (en lugar de planos y perpendiculares a la cámara) producen distorsión geométrica que degrada la precisión del OCR.
(f) Artefactos de Compresión: La compresión JPEG, la compresión de capturas de pantalla y la compresión de imágenes de aplicaciones de mensajería introducen artefactos que pueden interferir con el reconocimiento de caracteres.
(g) Ruido: El ruido del sensor de imagen, particularmente en condiciones de poca luz, puede crear detecciones de caracteres falsas u ocultar caracteres reales.
#### 2.2.2 Factores del Contenido del Documento
(a) Escritura a Mano: El texto manuscrito (incluyendo estilos cursivos, impresos y mixtos) tiene tasas de error significativamente más altas que el texto impreso. Algunas escrituras a mano pueden ser completamente ilegibles para los sistemas OCR.
(b) Fuentes No Estándar: Las fuentes decorativas, de estilo caligráfico o poco comunes reducen la precisión del OCR.
(c) Idiomas Mixtos: Los documentos que contienen texto en múltiples idiomas, o que contienen texto en una mezcla de escrituras latinas y no latinas, aumentan las tasas de error.
(d) Caracteres Especiales: Los símbolos de moneda (Bs., $, €, £, ¥, etc.), la notación matemática y los caracteres no alfanuméricos pueden ser mal reconocidos u omitidos.
(e) Cadenas Numéricas: Las cadenas numéricas largas (números de cuenta, números de referencia de transacciones, montos con decimales) son particularmente propensas a errores. Un error de un solo dígito en un monto puede cambiar $1.000 a $10.000, o Bs. 1.500,00 a Bs. 15.000,00.
(f) Fechas: Los formatos de fecha varían ampliamente entre países y documentos. El OCR puede malinterpretar las fechas, particularmente cuando el orden día/mes/año es ambiguo.
#### 2.2.3 Factores de Diseño del Documento
(a) Diseños Complejos: Los diseños de múltiples columnas, tablas, encabezados, pies de página, barras laterales y otros diseños complejos aumentan el riesgo de errores de extracción (por ejemplo, extraer texto de la columna equivocada, mezclar texto a través de los límites del diseño).
(b) Tablas: Los datos tabulares (incluyendo estados de cuenta bancarios, facturas y recibos formateados como tablas) son particularmente desafiantes para el OCR. La alineación de columnas, la separación de filas y los límites de las celdas pueden no identificarse correctamente.
(c) Marcas de Agua y Fondos: Las marcas de agua, los patrones de seguridad, las imágenes de fondo y los elementos decorativos pueden interferir con el reconocimiento de texto.
(d) Elementos Superpuestos: El texto que se superpone con sellos, firmas, logotipos u otros elementos gráficos puede ser parcial o totalmente ilegible.
(e) Texto Pequeño: Las letras pequeñas, notas al pie, términos y condiciones, y otros textos de tamaño reducido pueden no ser reconocidos.
(f) Orientaciones No Estándar: Los documentos en orientación horizontal, los documentos con texto rotado o los documentos que contienen múltiples orientaciones de texto aumentan las tasas de error.
2.3 Limitaciones de Idioma y Escritura
Los sistemas OCR de DataCred están optimizados principalmente para texto en inglés y español en escritura latina. El rendimiento del OCR para:
(a) Español: Bueno, pero con problemas documentados para caracteres acentuados (á, é, í, ó, ú, ü, ñ), signos de puntuación invertidos (¿, ¡) y abreviaturas y convenciones específicas del español.
(b) Inglés: Mejor rendimiento, particularmente para documentos en inglés comercial estándar.
(c) Portugués: Rendimiento moderado, con problemas para caracteres específicos del portugués (ã, õ, ç, ê, ô) y terminología y abreviaturas financieras específicas de Brasil.
(d) Otros idiomas con escritura latina: Rendimiento variable. El francés, italiano, alemán, neerlandés e idiomas similares se reconocen generalmente, pero con tasas de error mayores para caracteres y convenciones específicas de cada idioma.
(e) Escrituras no latinas (árabe, chino, japonés, coreano, cirílico, hindi, tailandés, etc.): Rendimiento significativamente degradado. Pueden ser completamente ilegibles en muchos casos.
2.4 Distinción entre Documento Digital y Fotografía
(a) Los documentos de origen digital (PDF generados directamente desde software de contabilidad, descargas de sitios web bancarios, facturas digitales, etc.) generalmente producen mejores resultados de OCR que las fotografías o capturas de pantalla.
(b) Las capturas de pantalla de aplicaciones de banca móvil, confirmaciones de Pago Móvil, confirmaciones de Zelle, pantallas de transacciones de Binance y contenido similar están sujetas a todas las limitaciones de calidad descritas anteriormente (resolución, compresión, destellos de pantalla, elementos de interfaz que se superponen al texto, etc.).
(c) Las fotografías de documentos físicos (recibos en papel, facturas impresas, estados de cuenta bancarios en papel, etc.) introducen desafíos adicionales: ángulo de cámara, condiciones de iluminación, curvatura del papel, daños físicos al documento y otros factores.
3. LIMITACIONES DEL OCR ESPECÍFICAS DE DOCUMENTOS
3.1 OCR de Documentos Financieros
#### 3.1.1 Estados de Cuenta Bancarios
- Las tablas de transacciones son difíciles de analizar correctamente
- Los saldos corrientes pueden no asociarse correctamente con las transacciones
- Las convenciones de las columnas de débito/crédito varían según el banco y el país
- Las cuentas en múltiples monedas pueden no manejarse correctamente
- La información del encabezado del estado de cuenta (nombre del titular, número de cuenta, período del estado de cuenta) puede extraerse incorrectamente
#### 3.1.2 Facturas
- Los números de factura, fechas, montos y partidas pueden transponerse
- Los números de identificación fiscal (RIF en Venezuela, EIN/SSN en EE. UU., números de IVA en la UE) pueden leerse incorrectamente
- Es posible que no se procesen todas las páginas de las facturas de varias páginas
- Las facturas manuscritas tienen tasas de error muy altas
#### 3.1.3 Recibos
- Los recibos en papel térmico se desvanecen con el tiempo, volviéndose ilegibles para el OCR
- El texto pequeño y comprimido en los recibos es difícil de leer
- Los recibos detallados con múltiples partidas son propensos a errores
- Las propinas o notas manuscritas en los recibos pueden no leerse
- Los montos en los recibos en moneda extranjera pueden leerse incorrectamente
#### 3.1.4 Confirmaciones de Pago Móvil
- La calidad de la captura de pantalla varía significativamente según el dispositivo y la aplicación del banco
- La interfaz de Pago Móvil cambia con el tiempo a medida que los bancos actualizan sus aplicaciones
- Los datos clave (remitente, destinatario, monto, número de referencia, fecha) pueden estar posicionados de manera diferente en las diferentes aplicaciones bancarias
- Los mensajes de confirmación de los diferentes bancos venezolanos tienen formatos diferentes
- Los números de referencia de Pago Móvil son críticos y un error de un solo dígito invalida la referencia
#### 3.1.5 Confirmaciones de Zelle
- Las pantallas de confirmación de Zelle varían según el banco participante
- Los nombres del remitente/destinatario pueden estar truncados o abreviados
- Los campos de memo/nota pueden cortarse
- La captura de pantalla de las confirmaciones de Zelle a menudo incluye elementos de la barra de notificaciones que interfieren con el OCR
#### 3.1.6 Registros de Transacciones de Binance
- La interfaz de Binance cambia con frecuencia, causando obsolescencia del modelo OCR
- Los montos de criptomonedas tienen muchos decimales, un error de un solo dígito puede representar una diferencia de valor masiva
- Los hash de transacciones (TXID) son cadenas alfanuméricas largas que se leen incorrectamente con frecuencia
- Las interfaces Spot, Futures, Earn y P2P tienen diseños diferentes
- Las pantallas de transacciones P2P incluyen elementos de chat y detalles de la contraparte en diseños no estándar
3.2 OCR de Documentos de Identidad
- MRZ (Zona de Lectura Mecánica) en pasaportes: Precisión generalmente alta para MRZ conforme a la OACI, pero puede fallar para documentos dañados, desgastados o no estándar
- Tarjetas de identificación nacionales: Los formatos varían significativamente según el país; el formato de la cédula de identidad venezolana difiere de otras tarjetas de identidad LATAM
- Licencias de conducir: El formato varía según el estado de EE. UU. y según el país; el análisis del código de barras y PDF417 puede fallar
- Escrituras no latinas en documentos de identidad: Tasas de error más altas
4. PUNTUACIONES DE CONFIANZA DEL OCR
4.1 Definición de la Puntuación de Confianza
Cuando DataCred proporciona puntuaciones de confianza asociadas con las salidas de OCR, estas puntuaciones indican la estimación interna del sistema OCR de la probabilidad de que un carácter, palabra, campo o documento en particular haya sido correctamente reconocido. Las puntuaciones de confianza NO son garantías de precisión. Una puntuación de confianza alta no significa que la salida sea correcta. Una puntuación de confianza baja no significa que la salida sea incorrecta.
4.2 Interpretación de la Puntuación de Confianza
Las puntuaciones de confianza del OCR son estimaciones estadísticas generadas por el propio sistema OCR, no evaluaciones de precisión verificadas de forma independiente. Se sabe que los sistemas OCR son sobreconfiados (asignando alta confianza a salidas incorrectas) y subconfiados (asignando baja confianza a salidas correctas). Las puntuaciones de confianza deben tratarse como indicadores aproximados, no como métricas fiables.
5. OBLIGACIONES DEL USUARIO Y REQUISITOS DE VERIFICACIÓN
5.1 Verificación Independiente Requerida
USTED ES ÚNICA Y EXCLUSIVAMENTE RESPONSABLE DE VERIFICAR DE FORMA INDEPENDIENTE TODAS LAS SALIDAS DE OCR. LAS SALIDAS DE OCR DEBEN TRATARSE COMO APROXIMACIONES PROVISIONALES NO VERIFICADAS. ANTES DE CONFIAR EN CUALQUIER SALIDA DE OCR PARA CUALQUIER PROPÓSITO, USTED DEBE:
(a) Comparar la salida de OCR con la imagen del documento original;
(b) Verificar que todos los campos críticos (nombres, montos, fechas, números de cuenta, números de referencia) hayan sido extraídos correctamente;
(c) Corregir manualmente cualquier error que identifique;
(d) Reconocer y entender que incluso después de su revisión, pueden permanecer errores no detectados; y
(e) NO confiar en las salidas de OCR para ninguna decisión con consecuencias financieras, legales o personales materiales.
5.2 Obligaciones de Calidad de Imagen
Usted es responsable de enviar imágenes de calidad suficiente para el procesamiento de OCR. Usted debe:
(a) Asegurarse de que los documentos estén bien iluminados, enfocados y libres de destellos, sombras y obstrucciones;
(b) Capturar los documentos planos y perpendiculares a la cámara, no en ángulo;
(c) Asegurarse de que todo el documento sea visible en el encuadre (sin recortar bordes, texto o datos);
(d) Utilizar la resolución más alta disponible en su dispositivo;
(e) Evitar la compresión o recompresión de imágenes antes del envío; y
(f) Revisar las imágenes antes del envío para confirmar que sean claras y legibles.
DataCred no será responsable por errores de OCR resultantes de la mala calidad de la imagen.
6. SIN RESPONSABILIDAD POR ERRORES DE OCR
EN LA MÁXIMA MEDIDA PERMITIDA POR LA LEY APLICABLE, DATA CRED NO TENDRÁ RESPONSABILIDAD ALGUNA POR CUALQUIER PÉRDIDA, DAÑO, COSTO O GASTO DERIVADO DE O RELACIONADO CON CUALQUIER ERROR DE OCR, INCLUYENDO, ENTRE OTROS: ERRORES DE RECONOCIMIENTO DE CARACTERES, ERRORES DE EXTRACCIÓN DE CAMPOS, DOCUMENTOS MAL CLASIFICADOS, MONTOS LEÍDOS INCORRECTAMENTE, FECHAS INCORRECTAS, IDENTIFICACIÓN INCORRECTA DE LA CONTRAPARTE, EXTRACCIÓN FALLIDA O INCOMPLETA, DATOS OMITIDOS, VALORES TRANSPUESTOS O CUALQUIER OTRA DEFICIENCIA, INEXACTITUD U OMISIÓN EN CUALQUIER SALIDA DE OCR. USTED RENUNCIA IRREVOCABLEMENTE A CUALQUIER RECLAMACIÓN CONTRA DATA CRED DERIVADA DE O RELACIONADA CON CUALQUIER ERROR DE OCR. USTED ACEPTA INDEMNIZAR, DEFENDER Y MANTENER INDEMNE A LAS PARTES DE DATA CRED DE CUALQUIER PÉRDIDA DERIVADA DE SU CONFIANZA EN LAS SALIDAS DE OCR.
7. RECONOCIMIENTO
AL ENVIAR DOCUMENTOS PARA PROCESAMIENTO DE OCR, USTED RECONOCE QUE HA LEÍDO, COMPRENDIDO Y ACEPTA LAS LIMITACIONES Y DESCARGOS DE RESPONSABILIDAD DEL OCR ESTABLECIDOS EN ESTE DOCUMENTO, QUE ENTIENDE QUE EL OCR ES UNA TECNOLOGÍA INHERENTEMENTE FALLIBLE, Y QUE ACEPTA TODOS LOS RIESGOS ASOCIADOS CON EL PROCESAMIENTO DE OCR.
*© 2026 DataCred. Todos los derechos reservados.*