Для заданных чисел, где значение каждого числа различно, обозначается как , и вероятность выбора каждого числа равна соответственно.
Теперь, если я выберу чисел на основе заданных вероятностей, где , каково ожидание суммы этих чисел? Обратите внимание, что выбор без замены, так что номера не могут включать повторяющиеся числа. Я понимаю, что если выбор сделан с заменой, ожидание суммы чисел равно , где
Кроме того, как насчет ожидания дисперсии этих чисел ?
Я учусь в аспирантуре, работаю над проблемой больших данных, и у меня нет статистических данных. Я ожидаю, что кто-то может дать мне формулу в качестве ответа. Однако, если ответ слишком сложен, чтобы его можно было описать формулой, или требуются интенсивные вычисления, приблизительный ответ является полностью приемлемым.
Вы можете предположить, что здесь довольно велико, и вероятность может сильно варьироваться. На практике значения этих вероятностей берутся из журнала запросов, в котором записана серия запросов агрегации. Дело в том, что частота каждого числа, участвующего в запросах, может быть довольно искаженной, то есть некоторые запрашиваются редко, а некоторые запрашиваются очень часто. Вы можете предположить, что распределение вероятностей - это нормальное распределение, распределение zipf или любые другие разумные альтернативы.
Распределение значений является только непрерывным подмножеством любого возможного распределения. Другими словами, если у вас есть гистограмма, которая представляет определенное распределение, все числа, вовлеченные в эту проблему, являются числами в пределах одного сегмента.
Что касается значения K, вы можете предположить, что оно всегда меньше количества часто запрашиваемых элементов.