AVISOS Y LIMITACIONES DE OCR Y EXTRACCIÓN DOCUMENTAL
Versión: CO-2026.10.02-OCR1
Fecha de vigencia: 2 de octubre de 2026
Entidad: DataCred Tech S.A.S.
NIT: 902112751-6
Contacto: app@datacred.org · +57 302 668 4956
1. Objeto
DataCred utiliza OCR y modelos multimodales para extraer información de documentos y capturas.
La extracción automatizada reduce trabajo manual, pero puede equivocarse.
2. Tipos de documento
Según el flujo, DataCred puede procesar:
- estados de cuenta bancarios;
- estados de cuenta de tarjetas;
- capturas financieras;
- documentos KYC;
- comprobantes;
- archivos enviados al asistente.
No todos los formatos están soportados en todos los flujos.
3. Errores comunes
OCR puede confundir:
- 0 y O;
- 1 e I;
- signos negativos;
- puntos y comas decimales;
- monedas;
- fechas;
- números de referencia;
- nombres;
- filas y columnas;
- saldos y pagos mínimos.
4. Calidad
El resultado puede degradarse por:
- baja resolución;
- desenfoque;
- reflejos;
- recortes;
- compresión;
- documento incompleto;
- orientación;
- múltiples columnas;
- tipografía inusual;
- idioma;
- fondo complejo.
5. Gemini y modelos multimodales
El pipeline actual utiliza modelos Gemini en determinados flujos de extracción documental.
El proveedor o modelo puede cambiar mediante configuración.
La salida del modelo se valida y transforma antes de persistirla como información estructurada.
6. Estados de cuenta
Los estados de cuenta subidos pueden pasar por:
- PROCESSING;
- READY_FOR_REVIEW;
- CONFIRMING;
- CONFIRMED;
- REJECTED;
- FAILED.
Una confirmación no debe ejecutarse dos veces por un retry concurrente.
7. Atadura al titular
DataCred puede extraer el nombre del titular y compararlo con la identidad del usuario.
Un bajo nivel de coincidencia puede producir revisión o bloqueo.
La comparación de nombre no es por sí sola una prueba concluyente de fraude.
8. Fingerprints y duplicados
DataCred utiliza:
- fileHash;
- fingerprints semánticos;
- deduplicación por usuario;
- hashes de evidencia;
para reducir reuso y duplicados.
Un archivo editado superficialmente puede conservar señales semánticas que permitan detectar que corresponde a un intento anterior.
9. Confianza
El sistema puede registrar o utilizar niveles de confianza.
Una confianza alta no elimina la posibilidad de error.
Una confianza baja puede requerir revisión, corrección o una nueva carga.
10. Clasificación de datos
Un documento subido por el usuario permanece bajo un nivel de confianza compatible con una fuente controlada por el usuario.
Leer correctamente un PDF no convierte a DataCred en confirmador del banco emisor.
11. Correcciones
Cuando el usuario detecta un error de OCR puede corregir los campos habilitados o presentar una solicitud de rectificación.
Los datos derivados deben actualizarse cuando la corrección sea material.
12. Efectos sobre el score
Un error documental puede afectar eventos y resultados derivados si no se detecta.
Por eso DataCred combina:
- validaciones;
- confianza;
- reglas;
- revisión;
- deduplicación;
- reclamos.
13. Manipulación
Los sistemas pueden buscar señales de:
- edición;
- inconsistencia;
- titular diferente;
- reutilización;
- importes anómalos;
- estructura imposible.
Una señal no equivale automáticamente a fraude confirmado.
14. Retención
Los archivos fuente se conservan únicamente por el período necesario conforme a la política vigente.
Los documentos OCR terminales tienen retención corta.
La información estructurada legítimamente derivada puede conservarse por una finalidad distinta cuando corresponda.
15. Privacidad
El documento debe enviarse únicamente para la finalidad informada.
DataCred no debe utilizar un estado de cuenta para una finalidad incompatible únicamente porque un modelo pueda extraer más información de la visible para el usuario.
16. Ley aplicable
Estos avisos se interpretan conforme a la Ley 1581 de 2012, la Ley 1266 de 2008 cuando corresponda y las políticas de privacidad, corrección y retención de DataCred.
DataCred Tech S.A.S.
NIT 902112751-6