Скотт Паттерсон у цій книзі звинувачує у фінансовій кризі 2007 року саме математиків.
Якщо ви уявляєте трейдерів з Уолл-стріт такими як Гордон Гекко - ви помиляєтесь. Насправді останнє мінімум останнє десятиліття у цій сфері успішними є саме математики з їх алгоритмами.
Книга одночасно довідником різних фінансових інструментів та алгоритмів, які використовуються (надзвичайно багато термінології), казкою на зразок Попелюшки про математиків(як використання алгоритмів може принести великі і дуже великі гроші) і попередженням, що буває, якщо алгоритми використовуються без врахування їх обмежень.
Перед цією книгою варто почитати Талеба "Чорний лебідь" та "Одурені випадковістю".
Загалом гарна художня книга про застосування алгоритмічного трейдингу.
Показ дописів із міткою книги. Показати всі дописи
Показ дописів із міткою книги. Показати всі дописи
четвер, 21 серпня 2014 р.
вівторок, 22 липня 2014 р.
Agile Data Science. Огляд
Цільова аудиторія - fullstack data science спеціалісти, які не лише проводять дослідження та будують моделі, але й займаються їх імплементацією (тобто поєднують ролі інженера, дослідника, data science спеціаліста та DevOps інженера). 
В якості прикладу використано модель побудови додатку для аналізу електронної пошти в межах Agile підходу. Спочатку створюються базовий додаток з такими кроками:
Загалом цікаво.
Плюси:

В якості прикладу використано модель побудови додатку для аналізу електронної пошти в межах Agile підходу. Спочатку створюються базовий додаток з такими кроками:
- отримати вміст власної Gmail скриньки
- серіалізація на Avro
- аналіз на Pig Latin
- збереження даних в Mongo DB
- використання Elastic Search
- завертання результатів аналізу у веб-додаток використовуючи Python/Flask
Загалом цікаво.
Плюси:
- практичні рецепти побудови, описане середовище можна використовувати для розгортання власних додатків у майбутньому
- приклад Data Science моделі повного циклу (від ідеї до сервісу)
- гарне пояснення як адаптувати класичний Waterfall процес Data Science до Agile методології
- Нових знань з Data Science ви тут не отримаєте, це швидше Data Engineering
- Не всі приклади працюють, як описано в книжці
вівторок, 17 червня 2014 р.
Doing Data Science. Огляд
"Doing Data Science. Straight talk from frontline."
написана на основі курсу "Introduction to Data Science" в Columbia University. Під час курсу на лекції запрошували експертів, тому це в певній мірі набір впорядкованих статей у різних сферах.
Найбільше сподобались розділи:
Chapter 7 Extracting Meaning from Data (співатвор William Cukierski, data scientist з Kaggle) - власне про Kaggle та методи підбору факторів, які дозволяють зробити правильні прогнози.
Chapter 11 Causality. Багато авторів обов'язково вказують, що наявність кореляції між двома змінними не означає, що один з факторів є причиною іншого (correlation doesn't imply casuation).
Цей розділ якраз про методи віднаходження причинно-наслідкового зв'язку між факторами. Як приклад - медичні експерименти та A/B тестінг.
Chapter 13 Lessons Learned from Data Competitions: Data Leakage and Model Evaluation (cпівавтор Claudia Perlich). Як можна вигравати змагання з data science використовуючи "дірки" які виникли при підготовці даних (наприклад коли id користувача впливає на результат).
Chapter 14 Data Engineering: MapReduce, Pregel, and Hadoop - безпосередньо про зберігання та роботу з даними.
Деякі цитати:
"Example: friend recommendations on Facebook don’t optimize you accepting friends, but rather maximizing the time you spend on Facebook. Look closely: the suggestions are surprisingly highly populated by attractive people of the opposite sex."
"For example, a recent Nature study, “Unique in the Crowd: the privacy bounds of human mobility” by Yves-Alexandre de Montjoye, et al., on a dataset of 1.5 million cell-phone users in Europe showed that just four points of reference were enough to individually identify 95 percent of the people."
"By some estimates, one or two patients died per week in a certain smallish town because of the lack of information flow between the hospital’s emergency room and the nearby mental health clinic."
"The goal of this chapter is to clear up some of the mysteriousness surrounding MapReduce. It’s become such a buzzword, and many data scientist job openings are advertised as saying “must know Hadoop” (the open source implementation of MapReduce). We suspect these ads are written by HR departments who don’t really understand what MapReduce is good for and the fact that not all data science problems require MapReduce."
Одним словом, дуже раджу )
написана на основі курсу "Introduction to Data Science" в Columbia University. Під час курсу на лекції запрошували експертів, тому це в певній мірі набір впорядкованих статей у різних сферах.
Найбільше сподобались розділи:
Chapter 7 Extracting Meaning from Data (співатвор William Cukierski, data scientist з Kaggle) - власне про Kaggle та методи підбору факторів, які дозволяють зробити правильні прогнози.
Chapter 11 Causality. Багато авторів обов'язково вказують, що наявність кореляції між двома змінними не означає, що один з факторів є причиною іншого (correlation doesn't imply casuation).
Цей розділ якраз про методи віднаходження причинно-наслідкового зв'язку між факторами. Як приклад - медичні експерименти та A/B тестінг.
Chapter 13 Lessons Learned from Data Competitions: Data Leakage and Model Evaluation (cпівавтор Claudia Perlich). Як можна вигравати змагання з data science використовуючи "дірки" які виникли при підготовці даних (наприклад коли id користувача впливає на результат).
Chapter 14 Data Engineering: MapReduce, Pregel, and Hadoop - безпосередньо про зберігання та роботу з даними.
Деякі цитати:
"Example: friend recommendations on Facebook don’t optimize you accepting friends, but rather maximizing the time you spend on Facebook. Look closely: the suggestions are surprisingly highly populated by attractive people of the opposite sex."
"For example, a recent Nature study, “Unique in the Crowd: the privacy bounds of human mobility” by Yves-Alexandre de Montjoye, et al., on a dataset of 1.5 million cell-phone users in Europe showed that just four points of reference were enough to individually identify 95 percent of the people."
"By some estimates, one or two patients died per week in a certain smallish town because of the lack of information flow between the hospital’s emergency room and the nearby mental health clinic."
"The goal of this chapter is to clear up some of the mysteriousness surrounding MapReduce. It’s become such a buzzword, and many data scientist job openings are advertised as saying “must know Hadoop” (the open source implementation of MapReduce). We suspect these ads are written by HR departments who don’t really understand what MapReduce is good for and the fact that not all data science problems require MapReduce."
Одним словом, дуже раджу )
четвер, 22 серпня 2013 р.
Підбірка книг з аналізу даних.
неділя, 18 серпня 2013 р.
Як вивчити R? Мій досвід.
- є бібліотеки для роботи з часовими рядами
- широкі можливості для візуалізації
- безкоштовна
- працює під Linux
Яким би прикладним питанням статистики чи аналізу даних ви не займались, є дуже висока ймовірність, що існує R бібліотека, яка значно полегшить вам роботу.
Для прикладу:
- machine learning - e1071, randomForest, повний список тут
- прогнозування часових рядів - zoo, forecast
- інтерактивний дешборд - shiny, rHighcharts, ggplot2
- візуалізація даних - ggplot2, lattice
- трансформація даних - reshape2, plyr
- дослідження текстів (text mining) - tm
- отримання даних з Twitter - twitteR
- пошук оптимального інвестиційного портфеля - fPotfolio
Повний список доступних бібліотек можна переглянути тут.
Основний недолік R - всі дані зберігаються в оперативній пам'яті, тому обробка великих об'ємів даних дуже обмежена. Хоча зараз з'явилась підтримка паралельних обчислень та можливість зберігати частину даних на диску. Детальніше про це можна прочитати в книзі Parallel R.
З чого почати вивчення?Основний недолік R - всі дані зберігаються в оперативній пам'яті, тому обробка великих об'ємів даних дуже обмежена. Хоча зараз з'явилась підтримка паралельних обчислень та можливість зберігати частину даних на диску. Детальніше про це можна прочитати в книзі Parallel R.
Перш за все, підівчити англійську мову принаймі до рівня розуміння текстів, оскільки документація і більшість книг англійською.
Російськомовних ресурсів не так вже й багато:
Статті:
Статті на Habrahabr http://habrahabr.ru/hub/r/
Блоги:
Група у Вконтакті: http://vk.com/club8142131
Якщо рівень англійської дозволяє читати книги й дивитись відео, вивчати R значно простіше і цікавіше. Почати можна з уроків від Code School: http://tryr.codeschool.com/ або серії відео від Google Developers . Курси від Coursera не лише дозволять вивчити R, але й застосовувати для можливості цієї мови для вирішення проблем аналізу в різних сферах:
- Statistics One - курс зі статистики, починається 22 вересня 2013.
- Computing for Data Analysis - застосування R для обробки та візуалізації даних, починається 23 вересня 2013.
- Data Analysis - методи аналізу даних, починається 28 жовтня 2013.
- Introduction to Computational Finance and Financial Econometrics - вступ до фінансової економетрики та обчислювальних фінансів, починається 28 серпня 2013.
Ресурс http://www.r-bloggers.com/ - агрегатор блогів з R різними мовами, при бажанні можна додати свій.
Книг є величезна кількість, почати можна з серії UseR! від Springer і Beginner's Guide to R зокрема.
Також можна підписатись на RSS-потік питань на StackOverflow та CrossValidated і вчитись через допомогу іншим.
вівторок, 15 січня 2013 р.
Одурені випадковістю. Прихована роль шансу в бізнесі та житті.
Ця книга Н. Н. Талеба (трейдера, математика та філософа) сподобалась мені ще більше, ніж "Чорний лебідь. Під знаком непередбачуваності".
Більшість літератури по теорії ймовірності і випадковості написані "згори". Тобто ви абстрактно споглядаєте ситуацію і кажете в нас є 100 куль, з них 10 білих, отже ймовірність вийняти білу кулю 1/10. А тепер припустіть, що ви одна із куль, кількості інших куль ви не знаєте, але якісь точно виймуть. От, приблизно, з такої позиції і написана книга.
Крім роздумів, що таке випадковість, і яку роль відіграє шанс, наведено цікаві факти нераціональної поведінки. Також можна дізнатись більше про будні трейдерів та особливості їхньої діяльності.
Частково ознайомитись з книгою та відгуками можна тут.
понеділок, 14 січня 2013 р.
Sexy little numbers: How to Grow Your Business Using the Data You Already Have.
Саме так в оригіналі називається книга "Ключевые цифры. Как заработать больше, используя данные, которые у вас уже есть". Її автор Dimitry Maex, управляючий директор підрозділу OgilvyOne, підрозділу Ogilvy and Mather. Цікава розповідь про те, як отримати максимальну вигоду з маленьких цифр, які оточують нас всюди.
Цікавою буде також аналітикам: показане застосування алгоритмів data mining в маркетингу.
Кому:
Підкаже маркетологам та власникам бізнесу як використати аналіз даних для збільшення прибутку. Тут є відповідь які алгоритми можна використати, де взяти дані і, навіть, де взяти спеціалістів для виконання цих завдань.Цікавою буде також аналітикам: показане застосування алгоритмів data mining в маркетингу.
Про що:
Книга дасть відповідь на питання:
- Де знайти клієнтів?
- Як збільшити їхню лояльність?
- Як виявити найбільш цінних клієнтів?
- Де взяти дані для аналізу?
- Як використовувати рекламу з більшою ефективністю?
- Як визначити, що буде потрібне клієнтам у майбутньому?
- Скільки витрачати на рекламу?
- Як визначити, які методи ефективні, а які ні?
- Як оптимізувати ваш сайт?
Наведені приклади великих компаній: Cisco, UPS, British Telecom, але підходи можна застосовувати і в малому та середньому бізнесі.
Прочитати кілька розділів та рецензії можна прочитати на сайті видавництва.
Особиста оцінка: 10 з 10.
субота, 1 вересня 2012 р.
Не всі прогнози однаково корисні.
Читаю зараз чудову книгу "Чорний лебідь: вплив надто неймовірного" Нассіма Талеба (The Black Swan: The Impact of the Highly Improbable).
"Чорний лебідь" - подія, яка має дуже низку ймовірність. Однак вплив її величезний. Така подія - "викид". Традиційні методи статистичного аналізу передбачають аналіз типових ситуацій,відкидаючи "викиди". Є сфери де це працює. Але там, де одиничний випадок має великий вплив на розподіл всієї вибірки, стандартні статистичні методи не дають точного прогнозу. Саме тому аналітики не здатні передбачити великі кризи у фінансовій сфері, сказати що дійсно буде після виборів в Україні чи що сервіс Instagram продасться за величезну суму.
Сферу ІТ-стартапів можна віднести до тих, де трапляться "чорні лебеді". Можна аналізувати, які продукти були успішними, але зрозуміло, що їх "клони" дадуть менше прибуток, але порівняно невеликий. Надзвичайно успішними можуть стати компанії, які будуть робити щось нове і корисне. Ілюстрацію цього можна побачити і в моєму дослідженні Crunchbase. На кожному етапі є екстремально великі раунди фінансування та значно менші за обсягами типові суми інвестицій.
Автор критикує стандартні статистичні методи аналізу та закликає більше уваги приділяти не відомим і дослідженим фактам, а наявності невідомого.
Книга буде цікава всім, хто збирається робити прогнози :)
Особиста оцінка: 10 з 10.
понеділок, 5 вересня 2011 р.
Pivot Tables (Зведені таблиці) в Excel 2010.
Зведені таблиці (або ж Pivot Tables) - потужний інструмент для аналізу та візуалізації даних. Їх можна розглядати як спрощення OLAP-куба. Присутні у більшості редакторів електронних таблиць - Microsoft Excel, Google Docs, OpenOffice Calc, LibreOffice Calc. Найбільш потужно реалізовані у Microsoft Excel, зокрема Excel 2010. Використання засобів Excel з використанням надстройки PowerPivot дозволяє виконувати аналіз даних без залучення спеціалізованого програмного забезпечення для бізнес-аналітики (business intelligence). Прикладом потенціалу є інструмент аналітики twitter Analytics for Twitter. Він дозволяє не лише пошук по хештегах, людях, ключових словах і т д, а й визначення тональності висловлювання (позитивні, негативні, нейтральні).
неділя, 7 листопада 2010 р.
Call-центр. Література
http://www.ozon.ru/context/detail/id/1086174/
Більше розглядаються теоретичні питання телефонії. З практичних питань, які стосуються безпосередньо функціонування call-центрів: розрахунок кількості операторів.
Побудова call-центру. Література
Корисна книга при побудові call-центру. Інформація викладена коротко і по суті. Розглянуто такі питання:
- розрахунок к-сті працівників
- сценарії маршрутизації викликів залежно від величини call-центру
- способи прогнозування к-сті викликів
- метрики, за якими варто оцінювати роботу організації
середа, 16 червня 2010 р.
Класна підбірка книжок по data mining
http://www.thearling.com/books.htm а також по візуалізації даних та CRM
неділя, 7 лютого 2010 р.
Підписатися на:
Дописи (Atom)




