Показ дописів із міткою MapReduce. Показати всі дописи
Показ дописів із міткою MapReduce. Показати всі дописи

четвер, 7 серпня 2014 р.

Pig in the Cloud (запускаємо Pig скрипт на AWS)

В попередньому пості я описувала, як порахувати подібність між користувачами  на Pig. Основна перевага використання Pig - MapReduce завдання створяться і виконаються на основі вашого Pig скрипта. Використання технології MapReduce виправдане тільки у випадку розподілених обчислень, тобто потрібно мати або Hadoop кластер з реальних машин, або орендувати хмарний кластер. Сьогодні я опишу як підняти кластер на Amazon Web Services та запустити розподілений обрахунок подібності користувачів.

понеділок, 31 березня 2014 р.

Mahout відмовляється від MapReduce

Apache Mahout  переходить на використання Apache Spark та H20 для побудови масштaбованих алгоритмів машинного навчання.
Apache Spark - система організації паралельної обробки даних, написана на Scala. На відміну від технології MapReduce дані обробляються в оперативній пам"яті.
H20 теж проводить обрахунки в оперативній пам"яті і оптимізований для проведення обчислень над даними, які зберігаються в розподіленій файлові системі HDFS.
Використання Apache Spark та H20 дозволяє значно пришвидшити виконання обчислень , а також використовувати, зокрема, deep learning.
Більше про H20
Більше про Apache Spark
Оригінал новини

четвер, 22 серпня 2013 р.

Підбірка книг з аналізу даних.

Видавництво O'Reilly підібрало  книги для тих, хто хоче займатись Data Science. Тут можна знайти інформацію про очищення даних, алгоритми Machine Learning та MapReduce, інструменти аналізу (R, Python) та візуалізації (D3). На набір з 8-ми книг у електронному вигляді, пропонується знижка 60%, тобто їх можна придбати за $99,99.