Информация и её свойства являются объектом исследования целого ряда научных дисциплин, таких как:
- теория информации (математическая теория систем передачи информации);
- кибернетика (наука об общих закономерностях процессов управления и передачи информации в машинах, живых организмах и обществе);
- информатика (изучение процессов сбора, преобразования, хранения, защиты, поиска и передачи всех видов информации и средств их автоматизированной обработки);
- семиотика (наука о знаках и знаковых системах);
- теория массовой коммуникации (исследование средств массовой информации и их влияния на общество) и др.
3.1. Подходы к измерению информации
Современная наука о свойствах информации и закономерностях информационных процессов называется теорией информации. Содержание понятия «информация» можно раскрыть на примере двух исторически первых подходов к измерению количества информации: подходов Хартли и Шеннона: первый из них основан на теории множеств и комбинаторике, а второй — на теории вероятностей.
Информация может пониматься и интерпретироваться в различных проблемах, предметных областях по-разному. Вследствие этого, имеются различные подходы к определению измерения информации и различные способы введения меры количества информации.
Количество информации — числовая величина, адекватно характеризующая актуализируемую информацию по разнообразию, сложности, структурированности (упорядоченности), определенности, выбору состояний отображаемой системы.
Если рассматривается некоторая система, которая может принимать одно из n возможных состояний, то актуальной задачей является задача оценки этого выбора, исхода. Такой оценкой может стать мера информации(события).
Мера — непрерывная действительная неотрицательная функция, определенная на множестве событий и являющаяся аддитивной (мера суммы равнасуммемер).
Меры могут быть статические и динамические, в зависимости от того, какую информацию они позволяют оценивать: статическую (не актуализированную; на самом деле оцениваются сообщения без учета ресурсов и формы актуализации) или динамическую (актуализированную т.е. оцениваются также и затраты ресурсов для актуализации информации).
Рассмотрим более детально подходы к определению понятия информации, важные с позиций её измерения:
1) определение К. Шеннона, применяемое в математической теории информации;
2) определение А. Н. Колмогорова, применяемое в отраслях информатики, связанных с использованием компьютеров.
3.2 Измерение информации. Объемный подход
Алфавитный подход основан на том, что всякое сообщение можно закодировать с помощью конечной последовательности символов некоторого алфавита.
Алфавит — упорядоченный набор символов, используемый для кодирования сообщений на некотором языке. Обычно под алфавитом понимают не только буквы, но и цифры, знаки препинания и пробел.
Мощность алфавита (N)- количество символов, используемых в алфавите.
Например, мощность алфавита из русских букв равна 32 (буква ё обычно не используется). Двоичный алфавит содержит 2 символа, его мощность равна двум.
Сообщения, записанные с помощью символов ASCII, используют алфавит из 256 символов. Сообщения, записанные по системе UNICODE, используют алфавит из 65 536 символов.
Если допустить, что все символы алфавита встречаются в тексте с одинаковой частотой (равновероятно), то количество информации, которое несет каждый символ, вычисляется по формуле Хартли:
i=log2N,
где N — мощность алфавита.
Формула Хартли задает связь между количеством возможных событий N и количеством информации i:
N=2i
Вам известно, что в компьютерах используется двоичное кодирование информации. Для двоичного представления текстов в компьютере чаще всего используется равномерный восьмиразрядный код. С его помощью можно закодировать алфавит из 256 символов, поскольку 256=28.
В стандартную кодовую таблицу (например, ASCII) помещаются все необходимые символы: английские и русские прописные и строчные буквы, цифры, знаки препинания, знаки арифметических операций, всевозможные скобки и пр.
В двоичном коде один двоичный разряд несет одну единицу информации, которая называется 1 бит.
Например, в 2-символьном алфавите каждый символ «весит» 1 бит (log22=1); в 4-символьном алфавите каждый символ несет 2 бита информации (log24=2); в 8-символьном — 3 бита (log28=3) и т. д.
Один символ из алфавита мощностью 256 (28) несет в тексте 8 битов информации. Такое количество информации называется байтом.
1 байт =8 битов
Информационный объем текста в памяти компьютера измеряется в байтах. Он равен количеству знаков в записи текста.
Для измерения информации используются и более крупные единицы:
| Название единицы измерения | Численная величина в байтах | Точное количество байтов |
| Килобайт (Кбайт) | 210 | 1024 байт |
| Мегабайт (Мбайт) | 220 | 1024 килобайт 1 048 576 байт |
| Гигабайт (Гбайт) | 230 | 1024 мегабайт 1 073 741 824 байт |
| Терабайт (Тбайт) | 240 | 1024 гигабайт 1 099 511 627 776 байт |
| Петабайт (Пбайт) | 250 | 1024 терабайт 1 125 899 906 842 624 байт |
| Эксабайт (Эбайт) | 260 | 1024 петабайт 1 152 921 504 606 846 976 байт |
| Зеттабайт (Збайт) | 270 | 1024 эксабайт 1 180 591 620 717 411 303 424 байт |
| Йоттабайт (Йбайт) | 280 | 1024 зеттабайт 1 208 925 819 614 629 174 706 176 байт |
Единицы измерения количества информации, в названии которых есть приставки «кило», «мега» и т. д., с точки зрения теории измерений не являются корректными, поскольку эти приставки используются в метрической системе мер, в которой в качестве множителей кратных единиц используется коэффициент 10n, где n=3,6,9 и т. д.
Для устранения этой некорректности Международная электротехническая комиссия, занимающаяся созданием стандартов для отрасли электронных технологий, утвердила ряд новых приставок для единиц измерения количества информации: киби (kibi), меби (mebi), гиби (gibi), теби (tebi), пети (peti), эксби (exbi). Однако пока используются старые обозначения единиц измерения количества информации, и требуется время, чтобы новые названия начали широко применяться.

Оставить комментарий