Contenido Exclusivo

HP extiende al Big Data el uso del lenguaje R de programación

HP descubrió una forma para hacer funcionar los programas escritos en lenguaje estadístico R en los conjuntos de datos que se alojan en más de un servidor, preparando el camino hacia el análisis predictivo en tiempo real y a gran escala.

“Historicamente el uso del Big Data se ha focalizado siempre en el pasado”, afirmó Jeff Veis, vicepresidente de Marketing para la unidad de negocio de Big Data en HP. El nuevo software permitiría a las organizaciones “anticiparse a las nuevas tendencias” usando grandes conjuntos de datos, agregó.

En efecto, mientras que varios paquetes comerciales ofrecen diversas maneras de utilizar R en los clúster de computadoras, el nuevo Distributed R de HP es el primero en ofrecer esta capacidad en un paquete de código abierto, según el directivo.

Con millones de usuarios en todo el mundo, la fuente de código abierto R es uno de los lenguajes de programación más extendidos, al ser especialmente diseñado para análisis estadísticos y predictivos, junto a SAS, MatLab, Mathematica y un número de librerías Pynthon. La ejecución de R con grandes conjuntos de datos ha sido, sin embargo, un desafío, ya que funciona como una sola secuencia en las computadoras.

Esta aproximación limita la cantidad de datos que pueden ser analizados. Es por ello que, con frecuencia, los científicos de datos analizan sólo una muestra de los datos, y no la muestra entera, lo que potencialmente reduce la precisión del resultado.

El nuevo paquete de HP incluye un conjunto de algoritmos creados por los Laboratorios HP para la ejecución de R en múltiples computadoras a la vez, permitiendo el análisis de miles de millones de filas de datos. Tal aproximación permite analizar todo el conjunto de datos.

¿En qué consiste la solución?

En primer lugar, HP creó Distributed R para ser ejecutado en el sistema de bases de datos orientados en columnas de Vertica, creado para facilitar el análisis de terabytes de datos.

Distributed R ha sido lanzado bajo la versión 2 de la licencia de código abierto GPL y puede funcionar con otras bases de datos y plataformas de proceso añadidas a Vertica, como Hadoop. Además, es compatible con las herramientas de desarrollo R Studio y R console.

-Joab Jackson, IDG News Service

Lo Más Reciente

Lanzan primera red de intercambio de información sobre delitos financieros basada en el comportamiento

BioCatch lanzó la primera red interbancaria del mundo de...

Presentan guía mundial para utilizar gemelos digitales en ensayos clínicos

El ENRICHMENT Playbook es la "primera guía mundial" dirigida...

Pure Storage lanza GenAI Pod: diseños llave en mano para acelerar la innovación de IA

Pure Storage presentó una solución que proporciona diseños llave...

La digitalización ofrece mejoras en la gestión de casos en el sector público

Los factores macroeconómicos globales y locales que cambian rápidamente,...

Newsletter

Recibe lo último en noticias e información exclusiva.

Lanzan primera red de intercambio de información sobre delitos financieros basada en el comportamiento

BioCatch lanzó la primera red interbancaria del mundo de intercambio de información sobre delitos financieros basada en el comportamiento, denominada BioCatch Trust Network, la...

Presentan guía mundial para utilizar gemelos digitales en ensayos clínicos

El ENRICHMENT Playbook es la "primera guía mundial" dirigida a la industria de dispositivos médicos, que detalla cómo utilizar gemelos virtuales para acelerar los...

Pure Storage lanza GenAI Pod: diseños llave en mano para acelerar la innovación de IA

Pure Storage presentó una solución que proporciona diseños llave en mano construidos en su plataforma de almacenamiento de datos. Se trata de Pure Storage...