Los cientìficos de Microsoft Research están trabajando en cómo simplificar para el desarrollador el proceso de trasladar su aplicación, escrita para funcionar sobre una pequeña cantidad de datos alojados en una máquina local, hacia grandes centros de datos, y permitir asì que corran sobre HPC clusters o una cloud pública, usando enormes paquetes de datos.
Microsoft ha anunciado que en la actualidad existen tres proyectos en este sentido, asì como varios esfuerzos en innovación, durante su evento TechFair en el campus de Microsoft Research que la compañìa posee en Silicon Valley.
Rick Rashid, vicepresidente senior de Microsoft Research, señaló que la organización está explorando una serie de vìas para conseguir facilitar el trabajo de los cientìficos.
"El campo de la ciencia de computación (...) se está convirtiendo en un importante puntal de todas las demás ciencias", aseguró, explicando que la actual disponibilidad sin precedentes de grandes cantidades de datos y recursos informáticos está cambiando el modo en que los cientìficos idean la resolución de un problema.
Catharine van Ingen, investigadora asociada de eCiencia Group en Microsoft Research, mostró su conformidad con esta afirmación.
Van Ingen señaló que la cantidad de datos accesibles y de herramientas para su análisis suponen una reducción de las barreras que los cientìficos sufren a la hora de entrar en sus campos de investigación, tanto en términos de financiación como de complejidad.
De las tres soluciones de centros de datos mostrados en el evento una de ellas estuvo protagonizada por DryadLINQ, que proporciona una capa de abstracción entre el desarrollador y la infraestructura informática utilizada para implementar la aplicación, proporcionando un entorno de programación para realizar una computación paralela usando grandes conjuntos de datos.
La solución es para aplicaciones basadas en Dryad, el motor de ejecución de Microsoft para la computación distribuida.
En lo que respecta al almacenamiento de la informática de datos intensivos, Microsoft Research ha creado lo que denomina "Un sencillo y Reducido Sistema de Archivos Distribuidos".
Los dos componentes del sistema son: un servidor centralizado, que almacena los metadatos que mapean el flujo de datos a una secuencia de archivos almacenada en el sistema NTFS; y un servicio de Windows para los nodos de almacenamiento que consiste en un conjunto de tareas de mantenimiento.
El servidor central se replica en varias máquinas para garantizar la escalabilidad y la tolerancia a fallos.
El tercer componente de la solución de Microsoft para la computación de datos intensivos es un navegador capaz de analizar y solucionar problemas de rendimiento de los grandes clusters.
Los cuatro módulos del navegador son un registro de recogida y extracción, una base de datos para los datos extraìdos, una herramienta de visualización interactiva y una interfaz plug-in para las herramientas de análisis de datos.
Noticias relacionadas: IBM adquiere Cast Iron para integrar cloud público y data center in-house"