В суботу, 16 січня говорили про data science і як з цим жити. Слайди:
А також досліджували злочинність у Сан-Франциско і визначали найбільш небезпечні місця. Код тут.
Показ дописів із міткою data science. Показати всі дописи
Показ дописів із міткою data science. Показати всі дописи
понеділок, 18 січня 2016 р.
вівторок, 29 вересня 2015 р.
Data Manipulation at Scale: Systems and Algorithms
Якщо раніше проблемою було знайти інформацію для навчання, то зараз тяжко зорієнтуватись у величезній кількості онлайн курсів та спеціалізацій. Настала осінь і ресурсів для навчання стало ще більше.
Якщо ви хочете зрозуміти як працюють алгоритми data science та зрозуміти, як їх можна застосовувати для великих об'ємів даних, то спеціалізація Data Manipulation at Scale: Systems and Algorithms від Вашингтонського університету - хороший вибір. Спеціалізація побудована на основі курсу, який пропонувався в 2013 році.
За мету автори ставлять навчити студентів:
Перший курс спеціалізації почався вчора.
За мету автори ставлять навчити студентів:
- Describe common patterns, challenges, and approaches associated with data science projects, and what makes them different from projects in related fields.
- Identify and use the programming models associated with scalable data manipulation, including relational algebra, mapreduce, and other data flow models.
- Use database technology adapted for large-scale analytics, including the concepts driving parallel databases, parallel query processing, and in-database analytics
- Evaluate key-value stores and NoSQL systems, describe their tradeoffs with comparable systems, the details of important examples in the space, and future trends.
- “Think” in MapReduce to effectively write algorithms for systems including Hadoop and Spark. You will understand their limitations, design details, their relationship to databases, and their associated ecosystem of algorithms, extensions, and languages. write programs in Spark
- Describe the landscape of specialized Big Data systems for graphs, arrays, and streams
Перший курс спеціалізації почався вчора.
пʼятниця, 21 листопада 2014 р.
"Остання миля" в Data Science.
При розробці Data Science рішень, важливо пам'ятати, що кінцевим результатом має бути продукт, яким зможуть користуватись звичайні люди.
Саме рішення проходить такі кроки:
Перехід до останнього кроку і є фактично побудовою "останньої милі". Цей термін широко використовується в телекомунікації і означає сполучення клієнтського обладнання з вузлом провайдера. (Більше про "останню милю"). Цей крок дає можливість користувачам використовувати "магію" data science рішення.
За мотивами статті Sean J.Taylor "Putting the Magic in Data Science".
Оригінал статті та презентацію автора на QCon можна знайти тут.
четвер, 16 жовтня 2014 р.
Як я провела літо і трохи осені)
Це літо виявилось настільки багатим на події, що пишу про це аж в жовтні : )
Отже:
Два з data science спеціалізації
І три більш загальних:
Отже:
1. Поміняла роботу
тепер займаюсь data science для healthcare2. Виступила на Lviv IT Arena з розповіддю про Kaggle:
3. Пройшла кілька курсів на Coursera:
Два з data science спеціалізації
- Practical Machine Learning
- Developing Data Products
І три більш загальних:
- Human-Computer Interaction (як розробляти прототипи хорошого продукту)
- Advanced Competitive Strategy (практичний маркетинг)
- Experimentation for Improvement (як правильно виміряти залежність між факторами, які впливають на результат і вибрати оптимальні їх значення)
4. Пройшла навчання в автошколі і отримала права
(кого цікавлять особливості воркфлову - можу поділитись)пʼятниця, 12 вересня 2014 р.
Курси від Coursera цієї осені
Тим, хто цікавиться data science
- рекомендую:
- Algorithmic thinking - 8 тижнів, 7-10 годин на тиждень, почався 25 серпня
- дуже рекомендую:
- Mining massive datasets - 7 тижнів, 8-10 годин на тиждень, старт 29 вересня
- Process mining: Data science in action - 6 тижнів, 4-6 годин на тиждень, старт 12 листопада
середа, 30 липня 2014 р.
Acquire Valued Shoppers Challenge
Змагання на kaggle.com класні тим, що незалежно від вашої поточної робочої області можна працювати над реальними заваданнями будь-якої предметної області. Також з плюсів - великі датасети.
Тут опишу досвід роботи з Acquire Valued Shoppers Challenge.
Завдання: на основі історії покупок, визначити ймовірність, що покупець, який отримав купон на знижку, купить товар повторно.
Тут опишу досвід роботи з Acquire Valued Shoppers Challenge.
Завдання: на основі історії покупок, визначити ймовірність, що покупець, який отримав купон на знижку, купить товар повторно.
вівторок, 22 липня 2014 р.
Agile Data Science. Огляд
Цільова аудиторія - fullstack data science спеціалісти, які не лише проводять дослідження та будують моделі, але й займаються їх імплементацією (тобто поєднують ролі інженера, дослідника, data science спеціаліста та DevOps інженера). 
В якості прикладу використано модель побудови додатку для аналізу електронної пошти в межах Agile підходу. Спочатку створюються базовий додаток з такими кроками:
Загалом цікаво.
Плюси:

В якості прикладу використано модель побудови додатку для аналізу електронної пошти в межах Agile підходу. Спочатку створюються базовий додаток з такими кроками:
- отримати вміст власної Gmail скриньки
- серіалізація на Avro
- аналіз на Pig Latin
- збереження даних в Mongo DB
- використання Elastic Search
- завертання результатів аналізу у веб-додаток використовуючи Python/Flask
Загалом цікаво.
Плюси:
- практичні рецепти побудови, описане середовище можна використовувати для розгортання власних додатків у майбутньому
- приклад Data Science моделі повного циклу (від ідеї до сервісу)
- гарне пояснення як адаптувати класичний Waterfall процес Data Science до Agile методології
- Нових знань з Data Science ви тут не отримаєте, це швидше Data Engineering
- Не всі приклади працюють, як описано в книжці
четвер, 17 липня 2014 р.
Що таке Kaggle?
Kaggle.com - ресурс, де всі, хто займаються data science, можуть позмагатись між собою. Крім психологічного бонусу "бути кращим ніж решта x учасників" можна отримати грошову винагороду (найбільша, що пропонувалась $500 000), роботу в компаніях типу Facebook та Yelp та навички вирішення реальних проблем в різних галузях. Додаткові бонуси - спілкування на форумах змагань.
середа, 16 липня 2014 р.
Practical Machine Learning та Developing Data Products.
Я вже писала, що Coursera має спеціалізацію Data Science. В рамках цієї спеціалізації пропонується 9 курсів + фінальний проект. Оскільки почакові курси багато в чому дублюють Computing for Data Analysis та Data Analysis, як і я вже проходила то проходила два фінальні - Practical Machine Learning та Developing Data Products.
Всі курси спеціалізації мають ще багато відкритих сесій до кінця року. Термін проходження одного курсу - 4 тижні.
Короткий огляд:
Practical Machine Learning - основний акцент на процесі побудови ML моделей. Бібліотека caret для полегшення рутинних процесів - поділ на тренувальний, перевірочний та тестовий набори, тренування моделі, оцінка моделі. В рамках курсу потрібно було побудувати модель для розпізнавання активності людини (http://groupware.les.inf.puc-rio.br/har).
Обов'язкова умова - результати дослідження у вигляді звіту (з використанням knitr для автоматичної побудови звіту з коду) на GitHub. Окрім того, результат має бути відтворюваним.
Developing Data Products - як зробити прототип продукту та презентувати його.
Теми:
Всі курси спеціалізації мають ще багато відкритих сесій до кінця року. Термін проходження одного курсу - 4 тижні.
Короткий огляд:
Practical Machine Learning - основний акцент на процесі побудови ML моделей. Бібліотека caret для полегшення рутинних процесів - поділ на тренувальний, перевірочний та тестовий набори, тренування моделі, оцінка моделі. В рамках курсу потрібно було побудувати модель для розпізнавання активності людини (http://groupware.les.inf.puc-rio.br/har).
Обов'язкова умова - результати дослідження у вигляді звіту (з використанням knitr для автоматичної побудови звіту з коду) на GitHub. Окрім того, результат має бути відтворюваним.
Developing Data Products - як зробити прототип продукту та презентувати його.
Теми:
- побудова R графіків з використанням java-script бібліотек
- Shiny - створення веб-додатків на R та варіанти розміщення цих додатків
- Slidify - бібліотека для створення презентацій на R. Окрім стандартних елементів презентацій можна додати інтерактивні запитання (напр. для самотестування) та java-script графіки.
- Yhat - має досить широку функціональність (більше на сайті), в рамках курсу розглянуто можливість розгорнути предиктивну модель та отримати REST API для комунікації з додатком (послати дані для входу та отримати результат) через json.
вівторок, 17 червня 2014 р.
Doing Data Science. Огляд
"Doing Data Science. Straight talk from frontline."
написана на основі курсу "Introduction to Data Science" в Columbia University. Під час курсу на лекції запрошували експертів, тому це в певній мірі набір впорядкованих статей у різних сферах.
Найбільше сподобались розділи:
Chapter 7 Extracting Meaning from Data (співатвор William Cukierski, data scientist з Kaggle) - власне про Kaggle та методи підбору факторів, які дозволяють зробити правильні прогнози.
Chapter 11 Causality. Багато авторів обов'язково вказують, що наявність кореляції між двома змінними не означає, що один з факторів є причиною іншого (correlation doesn't imply casuation).
Цей розділ якраз про методи віднаходження причинно-наслідкового зв'язку між факторами. Як приклад - медичні експерименти та A/B тестінг.
Chapter 13 Lessons Learned from Data Competitions: Data Leakage and Model Evaluation (cпівавтор Claudia Perlich). Як можна вигравати змагання з data science використовуючи "дірки" які виникли при підготовці даних (наприклад коли id користувача впливає на результат).
Chapter 14 Data Engineering: MapReduce, Pregel, and Hadoop - безпосередньо про зберігання та роботу з даними.
Деякі цитати:
"Example: friend recommendations on Facebook don’t optimize you accepting friends, but rather maximizing the time you spend on Facebook. Look closely: the suggestions are surprisingly highly populated by attractive people of the opposite sex."
"For example, a recent Nature study, “Unique in the Crowd: the privacy bounds of human mobility” by Yves-Alexandre de Montjoye, et al., on a dataset of 1.5 million cell-phone users in Europe showed that just four points of reference were enough to individually identify 95 percent of the people."
"By some estimates, one or two patients died per week in a certain smallish town because of the lack of information flow between the hospital’s emergency room and the nearby mental health clinic."
"The goal of this chapter is to clear up some of the mysteriousness surrounding MapReduce. It’s become such a buzzword, and many data scientist job openings are advertised as saying “must know Hadoop” (the open source implementation of MapReduce). We suspect these ads are written by HR departments who don’t really understand what MapReduce is good for and the fact that not all data science problems require MapReduce."
Одним словом, дуже раджу )
написана на основі курсу "Introduction to Data Science" в Columbia University. Під час курсу на лекції запрошували експертів, тому це в певній мірі набір впорядкованих статей у різних сферах.
Найбільше сподобались розділи:
Chapter 7 Extracting Meaning from Data (співатвор William Cukierski, data scientist з Kaggle) - власне про Kaggle та методи підбору факторів, які дозволяють зробити правильні прогнози.
Chapter 11 Causality. Багато авторів обов'язково вказують, що наявність кореляції між двома змінними не означає, що один з факторів є причиною іншого (correlation doesn't imply casuation).
Цей розділ якраз про методи віднаходження причинно-наслідкового зв'язку між факторами. Як приклад - медичні експерименти та A/B тестінг.
Chapter 13 Lessons Learned from Data Competitions: Data Leakage and Model Evaluation (cпівавтор Claudia Perlich). Як можна вигравати змагання з data science використовуючи "дірки" які виникли при підготовці даних (наприклад коли id користувача впливає на результат).
Chapter 14 Data Engineering: MapReduce, Pregel, and Hadoop - безпосередньо про зберігання та роботу з даними.
Деякі цитати:
"Example: friend recommendations on Facebook don’t optimize you accepting friends, but rather maximizing the time you spend on Facebook. Look closely: the suggestions are surprisingly highly populated by attractive people of the opposite sex."
"For example, a recent Nature study, “Unique in the Crowd: the privacy bounds of human mobility” by Yves-Alexandre de Montjoye, et al., on a dataset of 1.5 million cell-phone users in Europe showed that just four points of reference were enough to individually identify 95 percent of the people."
"By some estimates, one or two patients died per week in a certain smallish town because of the lack of information flow between the hospital’s emergency room and the nearby mental health clinic."
"The goal of this chapter is to clear up some of the mysteriousness surrounding MapReduce. It’s become such a buzzword, and many data scientist job openings are advertised as saying “must know Hadoop” (the open source implementation of MapReduce). We suspect these ads are written by HR departments who don’t really understand what MapReduce is good for and the fact that not all data science problems require MapReduce."
Одним словом, дуже раджу )
понеділок, 9 червня 2014 р.
Introduction to Data Science повертається.
З 30 червня буде повтор курсу Introduction to Data Science на Coursera. Вже можна переглянути лекції. Не пропустіть :)
Враження від попередньої сесії:
Враження від попередньої сесії:
пʼятниця, 11 квітня 2014 р.
Data Science спеціалізація від Coursera
Як ви вже могли помітити, Coursera запустила спеціалізації. Кожна спеціалізація - набір пов'язаних курсів + фінальний проект. Одна з таких спеціалізацій - Data Science. Сюди входить 9 курсів:
- The Data Science Toolbox
- R Programming
- Getting and Cleaning Data
- Exploratory Data Analysis
- Reproducible Research
- Statistical Inference
- Regression Models
- Practical Machine Learning
- Developing Data Products
Перші 3 розпочались 7 квітня, наступні 3 стартують 5 травня, ну і решта - 2 червня. Тривалість кожного курсу - 1 місяць. Підписка на спеціалізацію коштує $499 і передбачає видачу єдиного підтвердженого сертифіката по спеціалізації. В той же час, кожен курс можна проходити незалежно і безкоштовно.
вівторок, 8 квітня 2014 р.
Bad Data Handbook. Огляд
Днями дочитала цю книжку.
Загальна ідея: Дані - це абстрактне поняття, а реальна сутність. "Погані" дані можуть не лише стати причиною побудови моделей з некоректними результатами, а й унеможливити побудову адекватних моделей.
Формат: набір впорядкованих статей від різних авторів.
Розглянуті проблеми: накопичення, обробка, зберігання(формат, місце, ціна) даних, політики приватності.
Кому буде цікаво: всім, чия робота пов"язана з рішеннями, які базуються на даних.
Де купити? amazon.com
Підходить для читання на ніч :)
Особиста оцінка: 8 з 10.
Загальна ідея: Дані - це абстрактне поняття, а реальна сутність. "Погані" дані можуть не лише стати причиною побудови моделей з некоректними результатами, а й унеможливити побудову адекватних моделей.
Формат: набір впорядкованих статей від різних авторів.
Розглянуті проблеми: накопичення, обробка, зберігання(формат, місце, ціна) даних, політики приватності.
Кому буде цікаво: всім, чия робота пов"язана з рішеннями, які базуються на даних.
Де купити? amazon.com
Підходить для читання на ніч :)
Особиста оцінка: 8 з 10.
четвер, 22 серпня 2013 р.
Підбірка книг з аналізу даних.
Підписатися на:
Дописи (Atom)




