В попередньому пості я описувала, як порахувати подібність між користувачами на Pig. Основна перевага використання Pig - MapReduce завдання створяться і виконаються на основі вашого Pig скрипта. Використання технології MapReduce виправдане тільки у випадку розподілених обчислень, тобто потрібно мати або Hadoop кластер з реальних машин, або орендувати хмарний кластер. Сьогодні я опишу як підняти кластер на Amazon Web Services та запустити розподілений обрахунок подібності користувачів.
Показ дописів із міткою MapReduce. Показати всі дописи
Показ дописів із міткою MapReduce. Показати всі дописи
четвер, 7 серпня 2014 р.
четвер, 26 червня 2014 р.
понеділок, 31 березня 2014 р.
Mahout відмовляється від MapReduce
Apache Spark - система організації паралельної обробки даних, написана на Scala. На відміну від технології MapReduce дані обробляються в оперативній пам"яті.
H20 теж проводить обрахунки в оперативній пам"яті і оптимізований для проведення обчислень над даними, які зберігаються в розподіленій файлові системі HDFS.
Більше про Apache Spark
Оригінал новини
четвер, 22 серпня 2013 р.
Підбірка книг з аналізу даних.
Підписатися на:
Дописи (Atom)