Datos personales

Mi foto
Quito, Ecuador
Ingeniero en Informática / Magíster en Gestión Tecnológica / Máster en Gestión de las TIC

jueves, 7 de junio de 2012

Inteligencia de Negocios - PARTE IV

Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |




Una vez que se ha revisado los conceptos de extracción y transformación, la carga de datos ocurre al emplear las herramientas ETL para colocar los datos conforme lo establece el modelado adoptado.  La carga puede realizarse en los diferentes repositorios que conforman el almacén de datos analítico (siglas en inglés: DWA), lo importante es que se haga una adecuada gestión sobre la calidad de los datos para que los resultados en las herramientas de explotación cumplan las necesidades de los usuarios del Sistema de Inteligencia de Negocios (SIN) y no menos importante resulta también algo que no ve el usuario, esto es que se tomen en cuenta estrategias eficientes al momento de realizar la carga de datos en los repositorios, tomando en cuenta las capacidades y tiempos que los equipos de cómputo disponibles emplearán en las tareas de procesamiento, una estrategia usual es la carga incremental y el seguimiento de un calendario en franjas horarias establecidas como de bajo impacto, esto quiere decir reducir al mínimo los riesgos de llevar al sistema a condiciones de no disponibilidad.

Los problemas de calidad de datos no se tienen siempre en cuenta al principio del proceso ETL, cuando el equipo está centrado más bien en mover una gran cantidad de datos que en pequeños datos individuales que no sean correctos.  Sin embargo, la mala calidad de los datos o la falta de los mismos suponen problemas, ya que la información base que se usa para su explotación es errónea.  Es primordial que los usuarios tengan la seguridad de que los datos e información que están usando son correctos y no tienen ningún tipo de errata o desviación.

Existen muchas causas que no se pueden controlar para que un dato no sea correcto, la experiencia sin embargo determina que las principales causas de falta de calidad en los datos podrían ser:

  • Valores perdidos o incompletos en la fuente de datos
  • Falta de integridad referencial en el sistema origen
  • Errores en datos precalculados
  • Diferentes unidades de medida
  • Datos duplicados
  • Campos divididos
  • Múltiples jerarquías
  • Reglas conflictivas o inconsistentes


La evaluación de la calidad puede llevarse a cabo en diferentes puntos a lo largo del proceso ETL. Puede realizarse sobre la fuente origen de los datos, en el proceso de carga de los datos o cuando los datos están cargados en el DWA.

Lo ideal, es realizar los controles en la propia fuente de los datos, antes de cargarlos. Con esta práctica nos aseguramos que luego se trabajará con datos validados y limpios. Aunque la experiencia ha demostrado, sin embargo, que la corrección de datos en el sistema origen es complicada de realizar debido a dos principales razones:

  • La primera, es que sería el personal operativo el que tendría que asumir la responsabilidad adicional de rastrear y corregir los errores de datos pasados 
  • La segunda, que los datos correctos pueden ser desconocidos, siendo una tarea complicada y tediosa determinar los datos correctos.


Con respecto a quién debe ser el encargado de validar la calidad de los datos, el personal adecuado para esta función ha de ser alguien que conozca el negocio y todos sus procesos a la perfección, ya que así podrá distinguir y predecir aquellos datos que sean erróneos y guiar el proceso de control de la calidad de los mismos.



LA ETAPA DE EXPLOTACIÓN 

Es posible mediante las herramientas de explotación, suena redundante pero el esfuerzo realizado por los proveedores de soluciones en conseguir interfaces cada vez más intuitivas y orientadas a ejecutivos, posibilita el análisis de la información que se haya cargado en el DWA con las diferentes metodologías y  tecnologías.  Este conjunto de herramientas y metodologías actúan en torno a tres ejes fundamentales:

  1. Accesibilidad a la información. Lo primero que deben garantizar este tipo de herramientas y técnicas será el acceso de los usuarios autorizados a los datos con independencia de la procedencia de estos.
  2. Apoyo en la toma de decisiones. Se busca ir más allá en la presentación de la información, de manera que los usuarios tengan acceso a herramientas de análisis que les permitan seleccionar y manipular sólo aquellos datos que les interesen.
  3. Orientación al usuario final. Se busca independencia entre los conocimientos técnicos de los usuarios y su capacidad para utilizar estas herramientas. Para ello dichas herramientas deben basarse en conceptos de negocio familiares para el usuario  con interfaces gráficas de fácil usabilidad.


¿Cómo elegir la herramienta o conjunto de herramientas para la explotación de un SISTEMA DE INTELIGENCIA DE NEGOCIOS?

Cada organización es conocedora de sus necesidades, limitaciones o habilitantes financieras, de personal, culturales y tecnológicas.  Realizar una recomendación genérica resultaría demasiado ambicioso, sin embargo existen referencias a tomar en cuenta al momento de enfrentarse a la tarea de seleccionar una herramienta de Inteligencia de Negocios que apoye efectivamente a las tareas de análisis del negocio. 




CONSULTAR REFERENCIAS DE OPINIÓN

El mundo del software es dinámico, los principios conceptuales permanecen por más tiempo que las herramientas que se presentan a los mercados consumidores, por ello es muy importante estar atento a los analistas o creadores de opinión de reconocido prestigio, que aunque no puedan resultar cien por cien acertados han invertido fondos económicos y tiempo en realizar sus análisis y esto es ya un componente que permite acercarse a información de primera mano para dilucidar una opción.  Un ejemplo de ello son los informes presentados por la consultora GARTNER, mediante su ya famoso cuadrante mágico, que representa la condición del mercado para un producto tecnológico en un momento determinado, presenta para el caso de Inteligencia de Negocios las diferentes empresas proveedoras, clasificadas en zonas donde mediante un punto de color naranja se puede distinguir donde están posicionados sus productos:


http://businessintelligence.info/docs/estudios/Gartner-Business-Intelligence-2011.pdf




Líderes (leaders): aquellos que tienen la mayor puntuación resultante al combinar su habilidad para ejecutar (lo bien que un vendedor vende y ofrece soporte a sus productos y servicios a nivel global) y el alcance de visión, que se refiere a su potencial. 

Aspirantes (challengers): caracterizados por ofrecer buenas funcionalidades y un número considerable de instalaciones del producto, pero sin la visión de los líderes.

Visionarios (visionaries): estos pueden tener todas las capacidades que ha de ofrecer un Sistema de Inteligencia de Negocios, bien pudiera ser mediante alianzas con otros socios, lo cual significa un fuerte impulso a la integración de programas y plataformas así como una habilidad para anticiparse a las necesidades del mercado que ellos no puedan cubrir.

Nichos específicos (niche players): enfocados a determinadas áreas de las tecnologías de Inteligencia de Negocios, pero sin disponer de una suite completa.

Esta información puede orientar una decisión pero no debe ser determinante, pues hay otras cosas que se deben tomar en cuenta, lo que es muy útil de este tipo de análisis son los perfiles de empresas que pueden responder a nuestras necesidades, las herramientas que fabrican y luego a partir de conocer esa información se pueden conocer sus clientes, se les puede contactar, buscar otras empresas de perfil similar, solicitar pruebas piloto, indagar, conocer sus soluciones.  El cuadrante por sí solo no es lo más importante, lo que aporta es usar su información para perfilar el tipo de empresa que puede atender la necesidad del negocio de una organización que busca implementar un SIN.



TOMAR EN CUETA LAS CARACTERÍSTICAS NO FUNCIONALES


Cuando se analiza la adquisición o implementación de un SIN, del cual se espera apoye a la toma de decisiones, es importante comprender que existen dos puntos de vista, el del usuario quien no está interesado en conocer detalles técnicos ni plataformas de desarrollo, ni que el código con el que se programó cumpla estándares, lo único que le interesa que el costo haya sido razonable, que se resuelvan sus problemas y el punto de vista técnico.  

La complejidad en el punto de vista técnico debe evitarse en reuniones ejecutivas de alto nivel, sin embargo debe transmitirse las implicaciones técnicas sin emplear un lenguaje complejo que los directivos no podrán comprender.  

Quizá el servicio de ventas del proveedor tiene un gran enganche con usuarios clave, con personas capaces de tomar decisiones en la organización, entra en ese momento en escena la razón de ser de un departamento TIC, analizando el nivel de integración de  las herramientas que se están proponiendo a la plataforma tecnológica de la organización y considerando otros aspectos que para los usuarios resultan prácticamente invisibles:

  1. La solución resuelve los problemas del usuario en todos los demos y pruebas, sin embargo existe la necesidad de dimensionar y cuantificar: los costos de la configuración de los entornos donde va a operar el sistema, permisos de acceso, servidores necesarios, permisos de red, firewalls, medios físicos de almacenamiento y respaldo de la información, incompatibilidades tecnológicas a resolver con la plataforma informática de la organización, necesidades de integración con otros sistemas, políticas de recuperación de los datos en caso de desastre informático, costos y tiempos de la capacitación a usuarios, costos de mantenimiento, costos y tiempos de formación a personal técnico, mecanismos de ayuda a los usuarios durante la explotación, cronogramas del proyecto, equipo de trabajo del proyecto y tiempo que se le va a dedicar por recurso, los entregables que se espera recibir, las responsabilidades formalizadas en documentos sobre los niveles de  aprobación de usuarios y técnicos sobre los entregables recibidos.
  2. Dimensionar el impacto del volumen de información a procesar sobre la capacidad de cómputo que se dispone para el proyecto del SIN (Sistema de Inteligencia de Negocios), esto puede requerir mayor inversión en Hardware y capacidad de cómputo (servidores, memoria, CPU, almacenamiento).
  3. Definir los niveles de servicio y perfiles de los usuarios del SIN, antes de la implementación y luego afinarlos progresivamente.
  4. Se debe comprometer al proveedor a cubrir un período de mantenimiento y soporte, remoto o en sitio, conforme a los intereses de la organización y en base a un ANS (Acuerdo de Nivel de Servicio). 

Para elegir un motor de datos específicos se requiere conocer el presupuesto de la empresa ante el tema de adquirir licencias, implantación y escalabilidad, considerando la posibilidad de migrar los sistemas a nuevos motores de bases de datos.  Un DWA en sus repositorios deben cubrir al menos las siguientes características:

  • Repositorio de datos analítico centralizado
  • Alto performance en el acceso concurrente
  • Tiempos reducidos de consulta en bases de datos históricas
  • Alta disponibilidad 
  • Permitir la creación y configuración de mecanismos de respaldos y restauración de datos
  • Alto nivel de integración con herramientas de explotación 

Cada empresa debería poder determinar sus estándares en cuanto al acceso y rendimiento.  Se presentan a continuación los  resultados de un estudio realizado como parte de un Máster en Tecnologías de la Información, en la Facultad de Informática de la Universidad de Barcelona – UPC en Septiembre de 2009 cuyo autor es Pol Rojas Bartomeus, se trata de un análisis de las diferentes bases de datos analíticas partiendo de crear un entorno de pruebas que consiste en el montaje de máquinas virtuales con volúmenes de datos de gran tamaño y produciendo niveles de stress que simulan la operación de una empresa en entorno cercano a un caso real, aplicando cinco tipos de consulta que buscaron identificar medidas para comparar de manera cuantitativa, los resultados y la exigencia que el software hace al hardware, esto permite aproximar posibles comportamientos de las aplicaciones, y obviamente ayuda a tomar decisiones.

En el trabajo mencionado se definen cinco tipos de consultas, las cuales se ejecutan en diferentes máquinas virtuales, en cada máquina virtual se ha instalado una solución tecnológica diferente, las soluciones tecnológicas que se comparan son: Oracle, SQL Server, Alterian y QkilkView.

No entraremos en detalle del trabajo en mención, pero resumiremos algunos de sus aspectos destacados, la siguiente tabla muestra el planteamiento de las cinco consultas:   


Medición de resultados, % medio de uso de CPU por consulta y por sistema: 


Medición de resultados, cantidad de memoria virtual utilizada en megabytes por consulta y por sistema:



Medición de resultados, cantidad de memoria RAM utilizada en megabytes por consulta y por sistema:


Medición de resultados, tiempo de respuesta de las consultas en cada sistema:


En conclusión, después de la realización de las pruebas sobre Oracle, SQL Server, Alterian, Qlik View, se obtiene los resultados presentados en la siguiente tabla:


Como se puede apreciar es una forma de comparar, creando escenarios de pruebas.  Se puede solicitar al proveedor una serie de test que permitan determinar el sistema más conveniente.  Claro esto dependerá del tamaño del SIN, del poder de negociación que se tenga, de las dimensiones del proyecto, pues en una etapa de oferta implica recursos del proveedor por los cuales no recibe pago.  La simulación da una idea, lo cual ayuda mucho, pero no será igual que una situación real.  Sin embargo es preferible a no tener referencias.  


TOMAR EN CUENTA LAS CARACTERÍSTICAS MÍNIMAS  A CUMPLIR 

Sea cual sea la opción elegida, el usuario del SIN debe tener a su disposición una herramienta de explotación que incorpore al menos las siguientes características:


  1. Reporting predefinido. Si la herramienta posee reporting, cualquier persona de la compañía que lo requiera para realizar sus funciones podrá acceder a información en línea, con internet como medio de acceso si es posible. Es importante para obtener una visión de cómo se encuentra la empresa de cara a la toma de decisiones.
  2. Drill-down. Se trata de la funcionalidad que permite navegar de los datos generales a los particulares en la información presentada. Es relevante si se desea obtener información sobre un aspecto a nivel inferior.
  3. Análisis avanzado. Consiste en identificar conocimiento que no se puede ver de una forma intuitiva en base a los datos que maneja la empresa. Es importante ya que así se puede analizar por qué se dan una serie de aspectos y tomar decisiones al respecto.
  4. Análisis predictivo. Se trata de la capacidad de las herramientas informáticas para poder realizar análisis sobre los datos del negocio e identificar patrones y tendencias que ayuden a tomar decisiones con respecto al rumbo de la empresa de cara al futuro.
  5. Enriquecerse de datos externos sobre la marcha. La herramienta debe permitir cambios en los reportes generados y en la presentación de los mismos sin una dependencia alta del personal de sistemas 
  6. Capacidad de acceso a grandes volúmenes de datos. Es necesario debido a que la organización maneja generalmente una gran cantidad de datos y el sistema ha de poder trabajar correctamente con las cargas estimadas y luego con las reales.
  7. No dependencia de expertos. Es importante que la herramienta esté orientada al usuario y no haga falta grandes conocimientos técnicos para manejarla debido a que no todas las personas que harán uso de ella tendrán dichas capacidades.


Adicionalmente las herramientas que permiten la explotación de un SIN suelen incorporar cuadros de mando, incluso algunas herramientas presentan diagramas de conjuntos de datos, intersecciones, uniones, en definitiva la finalidad es tener mecanismos gráficos donde la información puede verse en forma resumida por ejemplo un manómetro, esto ayuda mucho a determinar de una sola mirada el estado de los indicadores de la empresa, por ejemplo:



  • Rentabilidad por tipos de clientes
  • Rentabilidad por tipos de productos: internet, telefonía fija y móvil, teléfonos 
  • Índice de abandonos en un período determinado
  • Uso que realizan los clientes de los distintos servicios
  • Nivel de morosidad de clientes



Si se desea profundizar aún más en las tendencias de los comportamientos por ejemplo de clientes puede incorporarse el concepto de Minería de Datos, aunque esto suele en general implicar la intervención de otras herramientas que trabajan por fuera del SIN pero sobre sus bases de datos analíticas, lo que suelen requerir es que se disponga de un repositorio físico para construir las vistas necesarias para realizar análisis de predictibilidad, pero hay que tener cuidado de contar con el personal adecuado en este ámbito ya que el perfil requiere conocimientos avanzados de estadística.

Un ejemplo de tabla comparativa simple que permita acercarnos más a una decisión se refleja a continuación, ya dependerá de cada organización complicarse más, considerar costos, tiempos de implantación y todo aquello que haga falta, o menos, dependerá de sus métodos de selección de tecnología de Inteligencia de Negocios:


  1. Marcar con una "X" si no se cumple el requisito 
  2. Marcar con un "OK" si se cumple el requisito 



En la última entrega revisaremos algunas consideraciones adicionales para proyectos que buscan implementar un Sistema de Inteligencia de Negocios.


Referencias:


Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |

lunes, 14 de mayo de 2012

Inteligencia de Negocios - PARTE III

Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |



TRANSFORMACIÓN

Al realizar la extracción, la identificación de las fuentes de datos puede tener un aspecto parecido al siguiente, en herramientas ETL como TALEND OPEN STUDIO o PENTAHO DATA INTEGRATION.


Extraer consiste en entender las reglas de negocio que regulan la información, para poder
navegar entre las fuentes de datos y mediante facilidades gráficas como: arrastrar y soltar; colocar sobre un lienzo los objetos que representan una conexión específica a la fuente de datos y enlazarlos mediante relaciones o flujos representados por líneas que encierran las  referencias a los datos por extraer.  Identificar el flujo de la información es importante, ello facilita el entendimiento de cada repositorio y su afectación al implementar un SIN.  El enfrentarse a diversas problemáticas de negocio y modelos; permite ir generando las habilidades necesarias para emplear efectivamente las herramientas ETL, de tal manera que las fuentes y los destinos de los datos sean enlazados de forma coherente.

La etapa de transformación ocurre precisamente una vez que se han extraído los datos y colocado en las tablas de destino, siendo la primera actividad verificar que se cumplen las pautas o estructuras que se han definido en el análisis. De no ser así los datos deben ser rechazados o depurados.  Esta fase de transformación aplica una serie de reglas de negocio o funciones sobre los datos extraídos para convertirlos en datos que serán cargados en el DWA, en ese paso intermedio interviene el área de Staging.  El data profiling, es el soporte indispensable de la transformación y consiste en:

  • Emplear métodos analíticos que revisan los datos para obtener una comprensión completa de su contenido, estructura y calidad
  • Identificar inconsistencias, eliminar información "basura" de determinados campos, corregir valores corruptos, revisar errores manualmente para decidir como corregirlos
  • Determinar si el proyecto debe reprogramarse (cambios en el alcance, cambios en cronogramas),  para ello deben detectarse problemas que no se puedan resolver en el corto plazo y analizar la situación caso por caso

No suele ser muy tomado en cuenta, pero no deja de ser importante al tratarse de el transporte de datos; el haber configurado con la suficiente antelación los entornos informáticos donde se desplegará el sistema de Inteligencia de Negocios, el cumplir con las normativas de seguridad organizacionales, el contar con las autorizaciones explicitas para el acceso a la información y cumplir con lo exigido por entes de control superiores (por ejemplo Leyes de Protección de Datos) .


MODELADO

Es parte de la transformación, se trabaja en él desde el inicio de un proyecto para implementar un SIN, con participación de analistas con habilidad en el uso de herramientas informáticas de modelado de bases de datos analíticas, con experiencia en DWA y conocedores del negocio de la organización.  Sin el modelado de datos del DWA no hay Sistema de Inteligencia de Negocios, este paso es requisito indispensable para realizar la extracción y carga. 

Las herramientas más populares para modelado suelen estar incorporadas en los sistemas que permiten la explotación del Sistema de Inteligencia de Negocios, ya que la tendencia actual es conformar entornos o ecosistemas que brindan soluciones integrales, la mayoría de fabricantes con experiencia, dotan a sus clientes de herramientas que les permitan atender cada etapa en un proyecto de Inteligencia de Negocios (Modelado, ETL, Explotación).



Pero, ¿Qué es el modelado?.  Consiste en representar gráficamente lo que se almacena en el repositorio y cómo se gestiona dicho almacén.  Es definir las estructuras de datos en las bases de datos Staging, DWA y Data Mart, de tal forma que se logre organizar gran cantidad de información  proveniente de los sistemas transaccionales, siguiendo las reglas del negocio para que los datos puedan ser presentados por los sistemas de explotación (cuadros de mando, reportes dinámicos, gráficas, informes ejecutivos, análisis en línea, análisis predictivos, minería de datos), como muestra el esquema típico de una solución BI de las partes I o II.

El modelado se divide en dos partes, una independiente de la tecnología denominada Modelado Lógico  (puede hacerse en un procesador de palabras, una hoja electrónica o una simple hoja de papel) y el Modelado Físico que consiste en la implementación mediante software de las estructuras de datos que almacenarán la información, las cuales fueron identificadas en el modelado lógico. 

Para quien ha realizado modelos entidad-relación esto no es ninguna novedad, sin embargo los modelos de datos de un Sistema de Inteligencia de Negocios, guardan sus diferencias respecto a los modelos de datos transaccionales.  Antes de empezar se debe conocer que el modelo contendrá únicamente dos tipos de tablas: las de hechos y las de dimensión.


HECHOS

Son aquello que se desea analizar:

  • Representan medidas del Negocio: Número de expedientes, compras, ventas, etc
  • La identificación de hechos y sus dimensiones asociadas permite controlar diferentes niveles de  granularidad, esto quiere decir que se puede agrupar los datos en intervalos mas grandes o más pequeños conforme a necesidad y darle al  análisis diferentes niveles de vista de la información, por ejemplo: ventas diarias, ventas semanales, ventas mensuales, ventas trimestrales
  • Se implementan mediante muchos registros y pocas columnas
  • Suelen agregar valores numéricos

Para más detalles se puede consultar:  http://es.wikipedia.org/wiki/Tabla_de_hechos



DIMENSIONES

Representan lo que se quiere describir y contienen los datos que permiten restringir y agrupar los datos contenidos en la tabla de Hechos asociada:

  • Se aproximan al concepto de “Datos Maestros” en un sistema operacional
  • Son descriptores del negocio
  • Implementan jerarquías
  • Suelen tener muchas columnas, pocos registros
Un concepto al que está relacionada una tabla de dimensión es la jerarquía, incorpora diferentes columnas que permiten establecer una clasificación específica de los datos de la tabla de Hechos, por ejemplo:

  • Localización geográfica identificada por país, región, provincia, ciudad, barrio
  • Intervalos de tiempo como día, semana, mes, trimestre, semestre, año
  • Categoría de un producto como familia , clase, subclase 

Para más detalles se puede consultar: http://es.wikipedia.org/wiki/Tabla_de_dimensi%C3%B3n



MODELADO LÓGICO

Representa el esquema de lo que se almacena en el repositorio de datos identificando los  elementos de información y su relación con el negocio.  Está formado por los hechos por ejemplo cantidades, totales facturados u otros que son las medidas del negocio, atributos que representan el cuándo, quién, qué; es decir describen el contexto de los hechos y las relaciones entre los atributos.  A tomar en cuenta en un modelo lógico:

  • Representa el esquema de qué se almacena en el repositorio: elementos de información y su relación con el negocio
  • Modelo de datos: definición, características y relaciones
  • Se concibe a nivel de negocio o conceptual
  • Es independiente de la tecnología de almacenamiento
  • Está orientado al usuario final
  • Los componentes del modelo lógico son:

            1. Hechos(facts): medidas de negocio (cantidad, importe, saldo, suma, media, …)
            2. Atributos: describen el contexto del hechos (cuándo, quién, qué, ámbito, …).
            3. Agregaciones (sumas, medias, máximo, mínimo, …)
            4. Relaciones, cardinalidad y jerarquías entre atributos


MODELADO FISICO

Representa el esquema de cómo se almacena la información en el repositorio informacional. El modelo se compone de columnas y tablas. Se trata de la manifestación física del modelo lógico de datos en tablas de bases de datos y claves foráneas. Los esquemas de modelado pueden ser de tres tipos: Modelo en estrella, modelo en copo de nieve y modelo en constelación de estrellas.

EJEMPLOS DE MODELADO

Modelo en Estrella
  •      Una sola tabla de hechos
  •     Una sola tabla para cada dimensión


Modelo en Copo de Nieve
  • Una sola tabla de hechos
  • Varias tablas de dimensiones normalizadas


Modelo en Constelación de Estrellas (modelo mixto)
  • Varias tablas de hechos
  • Comparten dimensiones


MAS EJEMPLOS








IMPLEMENTACIÓN FÍSICA DE MODELOS EN BASES DE DATOS


MOLAP: OLAP Multidimensional
1.      Datos pre-calculados
2.      Almacenados  en cubos de dimensiones



ROLAP: OLAP Relacional.
1.      Funcionalidad similar a MOLAP
2.      Basada en bases de datos relacionales

HOLAP: OLAP Hibrido
1.      Se accede a ROLAP desde MOLAP

CBAT: Column Based Analytical Technology
1.      Datos almacenados en columnas
2.      Cálculos realizados on-line o precalculados








El cambio de paradigma hacia organizar la información en columnas se emplea con la finalidad de reducir considerablemente el tiempo de consulta sobre grandes volúmenes de información y es el resultado que los fabricantes de software analítico innovador dan al problema de costo y rendimiento, al intentar recuperar datos que se encuentran insertos en gigantescos cúmulos de almacenamiento.

En la siguiente entrega se revisaran las herramientas de explotación y se plantearán sugerencias para proyectos de Inteligencia de Negocios.




Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |

domingo, 6 de mayo de 2012

Inteligencia de Negocios - PARTE II

Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |



En un proyecto que pretende implementar un Sistema de Inteligencia de Negocios, cada vez mas se contratan servicios de terceros, la organización o empresa contratante debe formalizar un equipo de trabajo interno asignado, con responsabilidades definidas, con roles claramente establecidos y que sean consideradas las tareas del proyecto como parte de su trabajo cotidiano; de lo contrario frente a la falta de atención el proveedor (sea del software, de los servicios de mantenimiento, de la implementación del SIN) en ocasiones se acoge al silencio administrativo y toma las decisiones apoyándose en las clausulas contractuales para no incurrir en costos y conflictos futuros, pudiendo al final no atender aspectos de mejora o cambios necesarios que hubieran permitido tener una mejor solución, esto es realmente poco recomendable para quien contrata.  El origen de estas acciones suele estar generalmente en un liderazgo interno débil, la falta de experiencia en la gestión de proyectos, falta de participación de usuarios con capacidad de decisión y actitudes de resistencia al cambio.  El proveedor debe ser considerado como un socio tecnológico del que se debe aprender lo mas posible y con quien se pueda contar para el crecimiento y fortalecimiento.




Como ya se mencionó en la primera parte de la serie de artículos de Inteligencia de Negocios, es de gran importancia, antes de pasar a una etapa de ETL o iniciado el proyecto, haber respondido la siguientes preguntas:

  •  ¿ Es prioritario para la organización una inversión para este tipo de sistema en este momento?
  •  ¿ Conoce la organización, o tiene claro, el problema que desea resolver mediante la implementación de un Sistema de Inteligencia de Negocios, sería posible resolverlo de otra manera?
  •  ¿ Si se toma una decisión y se opta por emprender el proyecto se tiene claros quienes serán los responsables por parte del departamento TIC (Tecnologías de la Información y Comunicaciones) y por parte de las áreas usuarias que aportarán horas al proyecto como parte de su trabajo diario?
  •  ¿ Se contratará a terceros y se gestionará el proyecto con un equipo de trabajo interno, o lo hará todo la organización internamente, cuáles son las ventajas y desventajas, económicas, técnicas, de tiempo de las opciones consideradas?
  •  ¿ Cuál será el equipo del proyecto, quién será el sponsor del proyecto, quién está autorizado a decidir o aprobar: cambios, recepciones, entregas de información a contratistas, modificaciones en el alcance, modificaciones en presupuesto, controles del proyecto, firmar actas de entrega recepción, designar responsables funcionales por parte del área usuaria, seleccionar el equipo de trabajo por parte del departamento TIC?
  •  ¿ Se ha especificado al suficiente nivel de detalle la necesidad de la organización de tal manera que al momento de contratar una solución se haga una correcta gestión de cambios, optimizando el presupuesto asignado para evitar caer en escenarios donde se tenga que cambiar más del 20% del alcance del proyecto ORIGINAL?
  • ¿ Se ha dimensionado correctamente el presupuesto del proyecto y se ha calculado un retorno de la inversión, además de los beneficios de implementar un Sistema de Inteligencia de Negocios?
  • ¿ Se ha realizado un análisis de riesgos asociados al proyecto y desarrollado los planes de mitigación respectivos?
  • ¿ Se cuenta con los profesionales capacitados o formados para enfrentar este tipo de proyecto, hará falta además de implantar una solución; un proceso de formación al personal involucrado en la explotación de la solución, quiénes serán los responsables de la explotación de la solución?
  • ¿ Se han evaluado soluciones tecnológicas de acuerdo a la realidad financiera, cultural, estructural de organización, existen conflictos por la propiedad de la información a ser tratada por parte de usuarios que puedan oponerse al cambio?

El proceso ETL, de siglas en ingles para expresar EXTRACCIÓN, TRANSFORMACIÓN Y CARGA, es el conjunto de técnicas que permite a las organizaciones "mover" los datos desde múltiples fuentes, aplicar diversos procesos de conformado, afinamiento, depuración y cargarlos en otras bases de datos, Data Mart o Data Warehouse, para su empleo en los análisis corporativos.

ETL, suele ser la parte más compleja en un proyecto BI, pudiendo consumir su desarrollo alrededor del 50% del tiempo total del proyecto, por ello es importante tener claras las características y priorizar los datos a extraer conforme a los objetivos que se ha propuesto la empresa.

Estructura típica de un SIN (Sistema de Inteligencia de Negocios)


EXTRACCIÓN

La primera parte del proceso ETL consiste en extraer los datos desde las bases de datos de los sistemas de origen, sean estos Sistemas de Planificación de los Recursos de la Empres (ERP), sistemas de comercialización, diseño de campañas y mercadeo (CRM),  sistemas de gestión de las cadenas de suministro (SCM), sistemas de gestión de incidencias, atención al cliente o recepción de reclamaciones  (SGI), todo ello va a depender de los objetivos del proyecto y de lo que se requiere analizar, es decir depende de aquello sobre lo cual se desea hacer Inteligencia de Negocios. 

Para realizar la extracción, es indispensable tres consideraciones fundamentales:

  1. Haber modelado la base de datos analítica conforme a las necesidades de la organización, tanto del punto de vista lógico como físico, empleando además para ello las herramientas tecnológicas necesarias.  En la adquisición de estas herramientas reside un costo importante del proyecto.  Se requiere personal especializado en el modelado de datos, el tiempo que se dedique al modelado está relacionado a la prioridad del proyecto y a la carga de trabajo dependiente de la dimensión y complejidad del proyecto.
  2. Decidir si se desarrollan o se adquieren herramientas tecnológicas para la extracción, transformación y carga de la información en las bases de datos analíticas. Además de haber mapeado previamente cada registro de datos de los sistemas de origen con su objetivo en el destino de almacenamiento.
  3. Contar con uno o varios profesionales, todo depende de las dimensiones del proyecto, especialistas en informática o afines que sean capaces de reconocer las relaciones de los datos de la empresa en los sistemas de origen, y que tengan los conocimientos técnicos necesarios para emplear herramientas tecnológicas que permiten extraer la información y grabarla en las nuevas fuentes de datos del SIN (Sistema de Inteligencia de Negocios).  El contar con personas sin la suficiente experiencia puede causar retrasos considerables.


Se conoce como repositorio informacional o base de datos analítica, al sitio que almacena toda la información extraída de los sistemas origen. Los componentes del repositorio son los siguientes:

  •  ODS (Almacén de datos operativos). Se trata de una réplica de los datos recientes del sistema transaccional, esto evita realizar las consultas para el análisis directamente en las aplicaciones transaccionales evitando molestias a los usuarios operativos y brindando mejores resultados en los tiempos de respuesta a los usuarios analistas que finalmente consultarán lo almacenado en el DWA o en los Data Mart.  Es muy importante considerar que las extracciones y cargas de datos en este repositorio deben ser incrementales y planificadas en horarios que no afecten a los usuarios operativos, para evitar bajones en el rendimiento de los sistemas transaccionales que pudieran afectar en vivo a procesos como ventas, comercialización, compras u otros.
  • Base de datos o área de staging. Consiste en el almacenamiento temporal de datos. Se utiliza para cálculos intermedios, limpieza y preparación de los datos finales a cargar.  Para pasar de esta base de datos a los Data Mart o al DWA debe considerarse períodos planificados y tener en cuenta los tiempos en que los grandes bloques de información pueden tardar en transportarse, esto puede requerir ventanas de tiempo en las cuales los usuarios analistas podrían no tener una respuesta eficiente en sus consultas o reportes.
  • Data Warehouse Analítico (DWA). Es una copia de los datos de los sistemas transaccionales estructurados específicamente para la necesidad de reporte personalizada de un usuario avanzado, el análisis y la divulgación.  Almacenan información integrada, consolidada, homogénea, fiable, histórica, no modificable y detallada.  El DWA debe tener un diseño totalmente independiente de la tecnología, formato y estructura de almacenamiento.  Sus datos provienen de los ODS y el área de Staging. 
  • Data Mart. Se trata de una versión especial de DWA. Consiste en una base de datos departamental, especializada en el almacenamiento de los datos de un área de negocio específica que dispone de una estructura optimizada de datos para acceder y analizar la información al detalle. Sus datos provienen de los ODS y el área de Staging.


Una empresa puede optar por desarrollar sus propias herramientas ETL o por adquirirlas, frente a esta consideración, se puede dar una idea de lo que implica cada elección:

Comparativa de herramientas versus desarrollos propios

Herramientas ETL
Desarrollos propios
Productos probados y ampliamente usados
Emplear tiempo y recursos económicos  en crear herramientas nuevas
Permiten la conexión a diferentes fuentes de datos
Las conexiones a las fuentes de datos deben desarrollarse una a una
Tiempos: Instalar y usar
Tiempos: Desarrollar, probar, instalar y usar
Se requiere personal que sepa mantenerlo y explotarlo
Se requiere personal dedicado al desarrollo, luego al mantenimiento y explotación
Costes por licencia y formación
Costes por tiempo del personal dedicado al desarrollo

Las herramientas, o software para ETL, suelen incorporar interfaces gráficas que muestran los orígenes y los destinos de datos, incluyen métodos de conexión a fuentes de datos heterogéneas, muestran las relaciones y conexiones de diferentes bases de datos, permiten además detectar inconsistencias y realizar procesos de inserción masiva de los datos en los ODS, Staging, DWA, Data Mart, permiten realizar una trazabilidad de los datos  en un Sistema de Inteligencia de Negocios.

Las aplicaciones mas conocidas para realizar procesos ETL son las siguientes, cada una lleva un enlace a una página web donde se podrá averiguar un poco más acerca de su alcance y especificaciones:

·         Talend OpenStudio (TOS)
·          Cognos Data Manager (IBM)


En la siguiente entrega se expondrá la fase de Transformación y Carga, veremos algo de modelado y finalmente pasaremos a revisar herramientas de almacenamiento y análisis...




Visón General | Parte I | Parte II | Parte III | Parte IV | Parte V |