Статистика и большие данные

54
Преувеличиваем ли мы важность допущения и оценки модели в эпоху, когда анализ часто проводится неспециалистами?

Итог : чем больше я узнаю о статистике, тем меньше я доверяю опубликованным работам в своей области; Я просто считаю, что исследователи недостаточно хорошо справляются со своей статистикой. Я мирянин, так сказать. Я обучаюсь биологии, но у меня нет формального образования в области статистики или...

54
О важности предположения IID в статистическом обучении

В статистическом обучении, неявно или явно, всегда предполагается, что обучающий набор состоит из наборов ввода / ответа , которые независимо взяты из одного и того же совместного распределения сD ={ X , y }D={X,y}\mathcal{D} = \{ \bf {X}, \bf{y} \}NNNP ( X , y )( Xя, уя)(Xi,yi)({\bf{X}}_i,y_i)...

54
Каково интуитивное объяснение того, как PCA превращается из геометрической задачи (с расстояниями) в задачу линейной алгебры (с собственными векторами)?

Я много читал о PCA, включая различные учебники и вопросы (такие как этот , этот , этот и этот ). Геометрическая проблема, которую пытается оптимизировать PCA, мне ясна: PCA пытается найти первый главный компонент, сводя к минимуму ошибку реконструкции (проекции), которая одновременно максимизирует...

54
Как R и Python дополняют друг друга в науке о данных?

Похоже, что во многих руководствах или руководствах описательная часть R и python сосуществуют как дополнительные компоненты процесса анализа. Однако на мой неподготовленный взгляд кажется, что оба языка делают одно и то же. Поэтому мой вопрос: существуют ли действительно специализированные ниши...

53
Обнаружение периода общего временного ряда

Этот пост является продолжением другого поста, относящегося к универсальному методу обнаружения выбросов во временных рядах . По сути, на данный момент меня интересует надежный способ обнаружить периодичность / сезонность общего временного ряда, на который влияет много шума. С точки зрения...

53
Лучшая практика при анализе схем контроля до лечения

Представьте себе следующий общий дизайн: 100 участников случайным образом распределяются либо на лечение, либо на контрольную группу зависимая переменная является числовой и измеряется до и после обработки Три очевидных варианта для анализа таких данных: Проверьте эффект взаимодействия группы по...

53
Эффективная онлайн линейная регрессия

Я анализирую некоторые данные, в которых я хотел бы выполнить обычную линейную регрессию, однако это невозможно, поскольку я имею дело с настройкой в ​​режиме онлайн с непрерывным потоком входных данных (который быстро станет слишком большим для памяти), и мне необходимо обновить оценки параметров,...

53
Машинное обучение с использованием Python

Я рассматриваю возможность использования библиотек Python для проведения экспериментов по машинному обучению. До сих пор я полагался на WEKA, но в целом был довольно недоволен. Это связано прежде всего с тем, что я обнаружил, что WEKA не так хорошо поддерживается (очень мало примеров, документации...

53
API данных / каналы доступны как пакеты в R

РЕДАКТИРОВАТЬ: Представление задачи « Веб-технологии и службы CRAN» содержит гораздо более полный список источников данных и API-интерфейсов, доступных в R. Вы можете отправить запрос на извлечение на github, если вы хотите добавить пакет в представление задач. Я делаю список различных каналов...

53
Измерение энтропии / информации / паттернов двумерной двоичной матрицы

Я хочу измерить энтропию / плотность информации / подобие шаблона двумерной двоичной матрицы. Позвольте мне показать некоторые фотографии для уточнения: Этот дисплей должен иметь довольно высокую энтропию: A) Это должно иметь среднюю энтропию: B) Эти фотографии, наконец, должны иметь почти нулевую...

53
Бокс-Кокса как преобразование для независимых переменных?

Существует ли преобразование типа Бокса-Кокса для независимых переменных? То есть преобразование, которое оптимизирует переменную так, чтобы она более подходила для линейной модели?Иксxxy~f(x) Если да, есть ли функция для выполнения этого...

53
Как генерировать коррелированные случайные числа (с учетом средних, дисперсий и степени корреляции)?

Извините, если это кажется слишком основополагающим, но я думаю, что я просто пытаюсь подтвердить понимание здесь. У меня есть чувство, что я должен сделать это в два этапа, и я начал пытаться получить матрицы корреляции, но это только начинает казаться действительно вовлеченным. Я ищу краткое...

53
Что означает наличие «постоянной дисперсии» в модели линейной регрессии?

Что означает наличие «постоянной дисперсии» в термине ошибки? На мой взгляд, у нас есть данные с одной зависимой переменной и одной независимой переменной. Постоянная дисперсия является одним из предположений о линейной регрессии. Мне интересно, что означает гомоскедастичность. Поскольку даже если...

53
Каковы недостатки моделей пространства состояний и фильтра Калмана для моделирования временных рядов?

Учитывая все хорошие свойства моделей пространства состояний и KF, я задаюсь вопросом - каковы недостатки моделирования пространства состояний и использования фильтра Калмана (или EKF, UKF или фильтра частиц) для оценки? Допустим, скажем, обычные методологии, такие как ARIMA, VAR или специальные /...

53
Как искусственная нейронная сеть ANN может использоваться для неконтролируемой кластеризации?

Я понимаю, как artificial neural network (ANN)можно обучаться контролируемым образом с использованием обратного распространения для улучшения подгонки путем уменьшения ошибки в прогнозах. Я слышал, что ANN можно использовать для обучения без учителя, но как это можно сделать без какой-либо функции...

53
Адам оптимизатор с экспоненциальным затуханием

В большинстве кодов Tensorflow, которые я видел, используется Adam Optimizer с постоянной скоростью обучения 1e-4(т.е. 0,0001). Код обычно выглядит следующим образом: ...build the model... # Add the optimizer train_op = tf.train.AdamOptimizer(1e-4).minimize(cross_entropy) # Add the ops to...

53
Когда несбалансированные данные действительно являются проблемой в машинном обучении?

У нас уже было несколько вопросов о несбалансированных данных при использовании логистической регрессии , SVM , деревьев решений , пакетов и ряда других подобных вопросов, что делает эту тему очень популярной! К сожалению, каждый из вопросов, похоже, зависит от алгоритма, и я не нашел каких-либо...

52
При каких условиях весы Лайкерта должны использоваться в качестве порядковых или интервальных данных?

Многие исследования в области социальных наук используют шкалы Лайкерта. Когда уместно использовать данные Лайкерта в качестве порядковых и когда уместно использовать их в качестве интервальных...

52
Какова связь между тестом хи-квадрат и тестом равных пропорций?

Предположим, что у меня есть три популяции с четырьмя взаимоисключающими характеристиками. Я беру случайные выборки из каждой популяции и строю кросс-таблицу или таблицу частот для характеристик, которые я измеряю. Правильно ли я сказал, что: Если я хотел проверить, существует ли какая-либо связь...