ЗАНЯТИЕ 10. Измерение информации. Объемный подход

Информация и её свойства являются объектом исследования целого ряда научных дисциплин, таких как:

  • теория информации (математическая теория систем передачи информации);
  • кибернетика (наука об общих закономерностях процессов управления и передачи информации в машинах, живых организмах и обществе);
  • информатика (изучение процессов сбора, преобразования, хранения, защиты, поиска и передачи всех видов информации и средств их автоматизированной обработки);
  • семиотика (наука о знаках и знаковых системах);
  • теория массовой коммуникации (исследование средств массовой информации и их влияния на общество) и др.

3.1. Подходы к измерению информации

Современная наука о свойствах информации и закономерностях информационных процессов называется теорией информации. Содержание понятия «информация» можно раскрыть на примере двух исторически первых подходов к измерению количества информации: подходов Хартли и Шеннона: первый из них основан на теории множеств и комбинаторике, а второй — на теории вероятностей.

Информация может пониматься и интерпретироваться в различных проблемах, предметных областях по-разному. Вследствие этого, имеются различные подходы к определению измерения информации и различные способы введения меры количества информации.

Количество информации — числовая величина, адекватно характеризующая актуализируемую информацию по разнообразию, сложности, структурированности (упорядоченности), определенности, выбору состояний отображаемой системы.

Если рассматривается некоторая система, которая может принимать одно из n возможных состояний, то актуальной задачей является задача оценки этого выбора, исхода. Такой оценкой может стать мера информации(события).

Мера — непрерывная действительная неотрицательная функция, определенная на множестве событий и являющаяся аддитивной (мера суммы равнасуммемер).

Меры могут быть статические и динамические, в зависимости от того, какую информацию они позволяют оценивать: статическую (не актуализированную; на самом деле оцениваются сообщения без учета ресурсов и формы актуализации) или динамическую (актуализированную т.е. оцениваются также и затраты ресурсов для актуализации информации).

Рассмотрим более детально подходы к определению понятия информации, важные с позиций её измерения:

1) определение К. Шеннона, применяемое в математической теории  информации;

2) определение А. Н. Колмогорова, применяемое в отраслях информатики, связанных с использованием компьютеров.

3.2 Измерение информации. Объемный подход

Алфавитный подход основан на том, что всякое сообщение можно закодировать с помощью конечной последовательности символов некоторого алфавита.

Алфавит — упорядоченный набор символов, используемый для кодирования сообщений на некотором языке. Обычно под алфавитом понимают не только буквы, но и цифры, знаки препинания и пробел.

Мощность алфавита (N)- количество символов, используемых в алфавите.

Например, мощность алфавита из русских букв равна 32 (буква ё обычно не используется). Двоичный алфавит содержит 2 символа, его мощность равна двум.

Сообщения, записанные с помощью символов ASCII, используют алфавит из 256 символов. Сообщения, записанные по системе UNICODE, используют алфавит из 65 536 символов.

Если допустить, что все символы алфавита встречаются в тексте с одинаковой частотой (равновероятно), то количество информации, которое несет каждый символ, вычисляется по формуле Хартли:

i=log2N,

где N — мощность алфавита.

Формула Хартли задает связь между количеством возможных событий N и количеством информации i:

N=2i

Вам известно, что в компьютерах используется двоичное кодирование информации. Для двоичного представления текстов в компьютере чаще всего используется равномерный восьмиразрядный код. С его помощью можно закодировать алфавит из 256 символов, поскольку 256=28.

В стандартную кодовую таблицу (например, ASCII) помещаются все необходимые символы: английские и русские прописные и строчные буквы, цифры, знаки препинания, знаки арифметических операций, всевозможные скобки и пр.

В двоичном коде один двоичный разряд несет одну единицу информации, которая называется 1 бит.

Например, в 2-символьном алфавите каждый символ «весит» 1 бит (log22=1); в 4-символьном алфавите каждый символ несет 2 бита информации (log24=2); в 8-символьном — 3 бита (log28=3) и т. д.

Один символ из алфавита мощностью  256 (28) несет в тексте 8 битов информации. Такое количество информации называется байтом.

1 байт =8 битов

Информационный объем текста в памяти компьютера измеряется в байтах. Он равен количеству знаков в записи текста.

Для измерения информации используются и более крупные единицы:

Название единицы измерения Численная величина в байтах Точное количество байтов
Килобайт (Кбайт) 210 1024 байт
Мегабайт (Мбайт) 220 1024 килобайт
1 048 576  байт
Гигабайт (Гбайт) 230 1024 мегабайт
1 073 741 824 байт
Терабайт (Тбайт) 240 1024 гигабайт
1 099 511 627 776 байт
Петабайт (Пбайт) 250 1024 терабайт
1 125 899 906 842 624 байт
Эксабайт (Эбайт) 260 1024 петабайт
1 152 921 504 606 846 976 байт
Зеттабайт (Збайт) 270 1024 эксабайт
1 180 591 620 717 411 303 424 байт
Йоттабайт (Йбайт) 280 1024 зеттабайт
1 208 925 819 614 629 174 706 176
байт

Единицы измерения количества информации, в названии которых есть приставки «кило», «мега» и т. д., с точки зрения теории измерений не являются корректными, поскольку эти приставки используются в метрической системе мер, в которой в качестве множителей кратных единиц используется коэффициент  10n, где n=3,6,9 и т. д.

Для устранения этой некорректности Международная электротехническая комиссия, занимающаяся созданием стандартов для отрасли электронных технологий, утвердила ряд новых приставок для единиц измерения количества информации: киби (kibi), меби (mebi), гиби (gibi), теби (tebi), пети (peti), эксби (exbi). Однако пока используются старые обозначения единиц измерения количества информации, и требуется время, чтобы новые названия начали широко применяться.

Оставить комментарий

avatar
  Подписаться  
Уведомление о