2020-10-26 10:29:30 +00:00
---
toc_priority: 41
2021-03-08 14:54:44 +00:00
toc_title: "Хранение словарей в памяти"
2020-10-26 10:29:30 +00:00
---
2020-03-20 18:20:59 +00:00
# Хранение словарей в памяти {#dicts-external-dicts-dict-layout}
2017-10-25 05:27:09 +00:00
2018-12-12 17:28:00 +00:00
Словари можно размещать в памяти множеством способов.
2017-10-25 05:27:09 +00:00
2020-10-13 17:23:29 +00:00
Рекомендуем [flat ](#flat ), [hashed ](#dicts-external_dicts_dict_layout-hashed ) и [complex_key_hashed ](#complex-key-hashed ). Скорость обработки словарей при этом максимальна.
2017-10-25 05:27:09 +00:00
2020-03-20 18:20:59 +00:00
Размещение с кэшированием не рекомендуется использовать из-за потенциально низкой производительности и сложностей в подборе оптимальных параметров. Читайте о б этом подробнее в разделе «[cache](#cache)».
2017-10-25 05:27:09 +00:00
2019-08-23 10:55:34 +00:00
Повысить производительность словарей можно следующими способами:
2017-10-25 05:27:09 +00:00
2020-04-30 18:19:18 +00:00
- Вызывать функцию для работы с о словарём после `GROUP BY` .
- Помечать извлекаемые атрибуты как инъективные. Атрибут называется инъективным, если разным ключам соответствуют разные значения атрибута. Тогда при использовании в `GROUP BY` функции, достающей значение атрибута по ключу, эта функция автоматически выносится из `GROUP BY` .
2017-10-25 05:27:09 +00:00
При ошибках работы с о словарями ClickHouse генерирует исключения. Например, в следующих ситуациях:
2020-04-30 18:19:18 +00:00
- При обращении к словарю, который не удалось загрузить.
- При ошибке запроса к `cached` -словарю.
2017-10-25 05:27:09 +00:00
Список внешних словарей и их статус можно посмотреть в таблице `system.dictionaries` .
Общий вид конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2017-11-19 12:07:08 +00:00
< yandex >
2017-10-25 05:27:09 +00:00
< dictionary >
...
< layout >
2018-03-10 23:36:26 +00:00
< layout_type >
2017-10-25 05:27:09 +00:00
<!-- layout settings -->
< / layout_type >
< / layout >
...
< / dictionary >
2017-11-19 12:07:08 +00:00
< / yandex >
2017-10-25 05:27:09 +00:00
```
2020-08-06 17:05:43 +00:00
Соответствущий [DDL-запрос ](../../statements/create/dictionary.md#create-dictionary-query ):
2020-02-20 06:31:06 +00:00
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
CREATE DICTIONARY (...)
...
LAYOUT(LAYOUT_TYPE(param value)) -- layout settings
...
```
2020-03-20 18:20:59 +00:00
## Способы размещения словарей в памяти {#sposoby-razmeshcheniia-slovarei-v-pamiati}
2017-10-25 05:27:09 +00:00
2020-03-21 04:11:51 +00:00
- [flat ](#flat )
2020-06-05 19:22:38 +00:00
- [hashed ](#dicts-external_dicts_dict_layout-hashed )
2020-10-13 17:23:29 +00:00
- [sparse_hashed ](#dicts-external_dicts_dict_layout-sparse_hashed )
2020-03-21 04:11:51 +00:00
- [cache ](#cache )
2020-11-04 00:57:14 +00:00
- [ssd_cache ](#ssd-cache )
- [ssd_complex_key_cache ](#complex-key-ssd-cache )
2020-05-03 12:55:22 +00:00
- [direct ](#direct )
2020-10-13 17:23:29 +00:00
- [range_hashed ](#range-hashed )
- [complex_key_hashed ](#complex-key-hashed )
- [complex_key_cache ](#complex-key-cache )
- [complex_key_direct ](#complex-key-direct )
- [ip_trie ](#ip-trie )
2017-10-25 05:27:09 +00:00
2020-03-20 18:20:59 +00:00
### flat {#flat}
2017-10-25 05:27:09 +00:00
2020-02-02 21:46:31 +00:00
Словарь полностью хранится в оперативной памяти в виде плоских массивов. Объём памяти, занимаемой словарём пропорционален размеру самого большого по размеру ключа.
2017-10-25 05:27:09 +00:00
Ключ словаря имеет тип `UInt64` и е г о величина ограничена 500 000. Если при создании словаря обнаружен ключ больше, то ClickHouse бросает исключение и не создает словарь.
Поддерживаются все виды источников. При обновлении, данные (из файла, из таблицы) читаются целиком.
Это метод обеспечивает максимальную производительность среди всех доступных способов размещения словаря.
Пример конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2017-10-25 05:27:09 +00:00
< layout >
< flat / >
< / layout >
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
LAYOUT(FLAT())
```
2020-06-05 19:22:38 +00:00
### hashed {#dicts-external_dicts_dict_layout-hashed}
2017-10-25 05:27:09 +00:00
Словарь полностью хранится в оперативной памяти в виде хэш-таблиц. Словарь может содержать произвольное количество элементов с произвольными идентификаторами. Н а практике, количество ключей может достигать десятков миллионов элементов.
Поддерживаются все виды источников. При обновлении, данные (из файла, из таблицы) читаются целиком.
Пример конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2017-10-25 05:27:09 +00:00
< layout >
< hashed / >
< / layout >
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
LAYOUT(HASHED())
```
2020-10-13 17:23:29 +00:00
### sparse_hashed {#dicts-external_dicts_dict_layout-sparse_hashed}
2020-02-20 06:31:06 +00:00
Аналогичен `hashed` , но при этом занимает меньше места в памяти и генерирует более высокую загрузку CPU.
Пример конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2020-02-20 06:31:06 +00:00
< layout >
< sparse_hashed / >
< / layout >
```
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
LAYOUT(SPARSE_HASHED())
```
2017-10-25 05:27:09 +00:00
2020-10-13 17:23:29 +00:00
### complex_key_hashed {#complex-key-hashed}
2017-10-25 05:27:09 +00:00
2020-04-30 18:19:18 +00:00
Тип размещения предназначен для использования с составными [ключами ](external-dicts-dict-structure.md ). Аналогичен `hashed` .
2017-10-25 05:27:09 +00:00
Пример конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2017-10-25 05:27:09 +00:00
< layout >
< complex_key_hashed / >
< / layout >
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
LAYOUT(COMPLEX_KEY_HASHED())
```
2020-10-13 17:23:29 +00:00
### range_hashed {#range-hashed}
2017-10-25 05:27:09 +00:00
Словарь хранится в оперативной памяти в виде хэш-таблицы с упорядоченным массивом диапазонов и соответствующих им значений.
2019-08-26 01:34:16 +00:00
Этот способ размещения работает также как и hashed и позволяет дополнительно к ключу использовать дипазоны по дате/времени (произвольному числовому типу).
2017-10-25 05:27:09 +00:00
Пример: таблица содержит скидки для каждого рекламодателя в виде:
2020-03-20 18:20:59 +00:00
``` text
2018-03-25 02:04:22 +00:00
+---------------+---------------------+-------------------+--------+
| advertiser id | discount start date | discount end date | amount |
+===============+=====================+===================+========+
| 123 | 2015-01-01 | 2015-01-15 | 0.15 |
+---------------+---------------------+-------------------+--------+
| 123 | 2015-01-16 | 2015-01-31 | 0.25 |
+---------------+---------------------+-------------------+--------+
| 456 | 2015-01-01 | 2015-01-15 | 0.05 |
+---------------+---------------------+-------------------+--------+
2017-10-25 05:27:09 +00:00
```
2020-04-30 18:19:18 +00:00
Чтобы использовать выборку по диапазонам дат, необходимо в [structure ](external-dicts-dict-structure.md ) определить элементы `range_min` , `range_max` . В этих элементах должны присутствовать элементы `name` и `type` (если `type` не указан, будет использован тип по умолчанию – Date). `type` может быть любым численным типом (Date/DateTime/UInt64/Int32/др.).
2017-10-25 05:27:09 +00:00
Пример:
2020-03-20 18:20:59 +00:00
``` xml
2017-10-25 05:27:09 +00:00
< structure >
< id >
< name > Id< / name >
< / id >
< range_min >
< name > first< / name >
2019-08-26 01:34:16 +00:00
< type > Date< / type >
2017-10-25 05:27:09 +00:00
< / range_min >
< range_max >
< name > last< / name >
2020-03-20 18:20:59 +00:00
< type > Date< / type >
2017-10-25 05:27:09 +00:00
< / range_max >
...
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
CREATE DICTIONARY somedict (
id UInt64,
first Date,
last Date
)
PRIMARY KEY id
LAYOUT(RANGE_HASHED())
RANGE(MIN first MAX last)
```
2019-08-26 01:34:16 +00:00
Для работы с такими словарями в функцию `dictGetT` необходимо передавать дополнительный аргумент, для которого подбирается диапазон:
2017-10-25 05:27:09 +00:00
2020-03-21 04:11:51 +00:00
dictGetT('dict_name', 'attr_name', id, date)
2017-10-25 05:27:09 +00:00
Функция возвращает значение для заданных `id` и диапазона дат, в который входит переданная дата.
Особенности алгоритма:
2020-04-30 18:19:18 +00:00
- Если не найден `id` или для найденного `id` не найден диапазон, то возвращается значение по умолчанию для словаря.
2021-02-09 18:49:45 +00:00
- Если есть перекрывающиеся диапазоны, то возвращается значение из любого (случайного) подходящего диапазона.
- Если граница диапазона `NULL` или некорректная дата (1900-01-01), то диапазон считается открытым. Диапазон может быть открытым с обеих сторон.
2017-10-25 05:27:09 +00:00
Пример конфигурации:
2020-03-20 18:20:59 +00:00
``` xml
2017-11-19 12:07:08 +00:00
< yandex >
2017-10-25 05:27:09 +00:00
< dictionary >
...
< layout >
< range_hashed / >
< / layout >
< structure >
< id >
< name > Abcdef< / name >
< / id >
< range_min >
2019-08-26 01:34:16 +00:00
< name > StartTimeStamp< / name >
2020-03-20 18:20:59 +00:00
< type > UInt64< / type >
2017-10-25 05:27:09 +00:00
< / range_min >
< range_max >
2019-08-26 01:34:16 +00:00
< name > EndTimeStamp< / name >
< type > UInt64< / type >
2017-10-25 05:27:09 +00:00
< / range_max >
< attribute >
< name > XXXType< / name >
< type > String< / type >
< null_value / >
< / attribute >
< / structure >
< / dictionary >
2017-11-19 12:07:08 +00:00
< / yandex >
2017-10-25 05:27:09 +00:00
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
CREATE DICTIONARY somedict(
Abcdef UInt64,
StartTimeStamp UInt64,
EndTimeStamp UInt64,
XXXType String DEFAULT ''
)
PRIMARY KEY Abcdef
RANGE(MIN StartTimeStamp MAX EndTimeStamp)
```
2017-10-25 05:27:09 +00:00
2020-03-20 18:20:59 +00:00
### cache {#cache}
2017-10-25 05:27:09 +00:00
Словарь хранится в кэше, состоящем из фиксированного количества ячеек. Ячейки содержат часто используемые элементы.
При поиске в словаре сначала просматривается кэш. Н а каждый блок данных, все не найденные в кэше или устаревшие ключи запрашиваются у источника с помощью `SELECT attrs... FROM db.table WHERE id IN (k1, k2, ...)` . Затем, полученные данные записываются в кэш.
2020-04-30 18:19:18 +00:00
Для cache-словарей может быть задано время устаревания [lifetime ](external-dicts-dict-lifetime.md ) данных в кэше. Если от загрузки данных в ячейке прошло больше времени, чем `lifetime` , то значение не используется, и будет запрошено заново при следующей необходимости е г о использовать.
2017-10-25 05:27:09 +00:00
Это наименее эффективный из всех способов размещения словарей. Скорость работы кэша очень сильно зависит от правильности настройки и сценария использования. Словарь типа cache показывает высокую производительность лишь при достаточно больших hit rate-а х (рекомендуется 99% и выше). Посмотреть средний hit rate можно в таблице `system.dictionaries` .
Чтобы увеличить производительность кэша, используйте подзапрос с `LIMIT` , а снаружи вызывайте функцию с о словарём.
2020-04-30 18:19:18 +00:00
Поддерживаются [источники ](external-dicts-dict-sources.md ): MySQL, ClickHouse, executable, HTTP.
2017-10-25 05:27:09 +00:00
Пример настройки:
2020-03-20 18:20:59 +00:00
``` xml
2017-10-25 05:27:09 +00:00
< layout >
< cache >
<!-- Размер кэша в количестве ячеек. Округляется вверх до степени двух. -->
< size_in_cells > 1000000000< / size_in_cells >
< / cache >
< / layout >
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
LAYOUT(CACHE(SIZE_IN_CELLS 1000000000))
```
2017-10-25 05:27:09 +00:00
Укажите достаточно большой размер кэша. Количество ячеек следует подобрать экспериментальным путём:
2020-03-20 18:20:59 +00:00
1. Выставить некоторое значение.
2. Запросами добиться полной заполненности кэша.
3. Оценить потребление оперативной памяти с помощью таблицы `system.dictionaries` .
4. Увеличивать/уменьшать количество ячеек до получения требуемого расхода оперативной памяти.
2017-10-25 05:27:09 +00:00
2020-03-20 18:20:59 +00:00
!!! warning "Warning"
2018-07-20 17:35:34 +00:00
Н е используйте в качестве источника ClickHouse, поскольку он медленно обрабатывает запросы с о случайным чтением.
2017-10-25 05:27:09 +00:00
2020-10-13 17:23:29 +00:00
### complex_key_cache {#complex-key-cache}
2017-10-25 05:27:09 +00:00
2020-04-30 18:19:18 +00:00
Тип размещения предназначен для использования с составными [ключами ](external-dicts-dict-structure.md ). Аналогичен `cache` .
2018-03-14 09:08:37 +00:00
2020-11-04 00:55:54 +00:00
### ssd_cache {#ssd-cache}
Похож на `cache` , но хранит данные на SSD и индекс в оперативной памяти.
``` xml
< layout >
< ssd_cache >
<!-- Size of elementary read block in bytes. Recommended to be equal to SSD's page size. -->
< block_size > 4096< / block_size >
<!-- Max cache file size in bytes. -->
< file_size > 16777216< / file_size >
<!-- Size of RAM buffer in bytes for reading elements from SSD. -->
< read_buffer_size > 131072< / read_buffer_size >
<!-- Size of RAM buffer in bytes for aggregating elements before flushing to SSD. -->
< write_buffer_size > 1048576< / write_buffer_size >
<!-- Path where cache file will be stored. -->
< path > /var/lib/clickhouse/clickhouse_dictionaries/test_dict< / path >
< / ssd_cache >
< / layout >
```
или
``` sql
2021-03-18 09:55:17 +00:00
LAYOUT(SSD_CACHE(BLOCK_SIZE 4096 FILE_SIZE 16777216 READ_BUFFER_SIZE 1048576
PATH /var/lib/clickhouse/clickhouse_dictionaries/test_dict))
2020-11-04 00:55:54 +00:00
```
### complex_key_ssd_cache {#complex-key-ssd-cache}
Тип размещения предназначен для использования с составными [ключами ](../../../sql-reference/dictionaries/external-dictionaries/external-dicts-dict-structure.md ). Похож на `ssd_cache` .
2020-05-03 12:55:22 +00:00
### direct {#direct}
Словарь не хранит данные локально и взаимодействует с источником непосредственно в момент запроса.
Ключ словаря имеет тип `UInt64` .
2020-05-07 20:00:30 +00:00
Поддерживаются все виды [источников ](external-dicts-dict-sources.md ), кроме локальных файлов.
2020-05-03 12:55:22 +00:00
Пример конфигурации:
``` xml
< layout >
< direct / >
< / layout >
```
или
``` sql
LAYOUT(DIRECT())
```
2020-10-13 17:23:29 +00:00
### complex_key_direct {#complex-key-direct}
2020-05-13 16:05:05 +00:00
Тип размещения предназначен для использования с составными [ключами ](external-dicts-dict-structure.md ). Аналогичен `direct` .
2020-10-13 17:23:29 +00:00
### ip_trie {#ip-trie}
2018-03-14 09:08:37 +00:00
Тип размещения предназначен для сопоставления префиксов сети (IP адресов) с метаданными, такими как ASN.
Пример: таблица содержит префиксы сети и соответствующие им номера AS и коды стран:
2020-03-20 18:20:59 +00:00
``` text
2018-03-14 09:08:37 +00:00
+-----------------+-------+--------+
| prefix | asn | cca2 |
+=================+=======+========+
| 202.79.32.0/20 | 17501 | NP |
+-----------------+-------+--------+
| 2620:0:870::/48 | 3856 | US |
+-----------------+-------+--------+
| 2a02:6b8:1::/48 | 13238 | RU |
+-----------------+-------+--------+
| 2001:db8::/32 | 65536 | ZZ |
+-----------------+-------+--------+
```
При использовании такого макета структура должна иметь составной ключ.
Пример:
2020-03-20 18:20:59 +00:00
``` xml
2018-03-14 09:08:37 +00:00
< structure >
< key >
< attribute >
< name > prefix< / name >
< type > String< / type >
< / attribute >
< / key >
< attribute >
< name > asn< / name >
< type > UInt32< / type >
< null_value / >
< / attribute >
< attribute >
< name > cca2< / name >
< type > String< / type >
< null_value > ??< / null_value >
< / attribute >
...
2020-12-24 15:46:45 +00:00
< / structure >
< layout >
< ip_trie >
<!-- Ключевой аттрибут `prefix` будет доступен через dictGetString -->
<!-- Эта опция увеличивает потреблямую память -->
< access_to_key_from_attributes > true< / access_to_key_from_attributes >
< / ip_trie >
< / layout >
2018-03-14 09:08:37 +00:00
```
2020-02-20 06:31:06 +00:00
или
2020-03-20 18:20:59 +00:00
``` sql
2020-02-20 06:31:06 +00:00
CREATE DICTIONARY somedict (
prefix String,
asn UInt32,
cca2 String DEFAULT '??'
)
PRIMARY KEY prefix
```
2018-04-23 06:20:21 +00:00
Этот ключ должен иметь только один атрибут типа `String` , содержащий допустимый префикс IP. Другие типы еще не поддерживаются.
2018-03-14 09:08:37 +00:00
Для запросов необходимо использовать те же функции (`dictGetT` с кортежем), что и для словарей с составными ключами:
2020-03-20 18:20:59 +00:00
``` sql
2018-04-23 06:20:21 +00:00
dictGetT('dict_name', 'attr_name', tuple(ip))
```
2018-03-14 09:08:37 +00:00
2018-04-23 06:20:21 +00:00
Функция принимает либо `UInt32` для IPv4, либо `FixedString(16)` для IPv6:
2018-03-14 09:08:37 +00:00
2020-03-20 18:20:59 +00:00
``` sql
2018-04-23 06:20:21 +00:00
dictGetString('prefix', 'asn', tuple(IPv6StringToNum('2001:db8::1')))
```
2018-03-14 09:08:37 +00:00
Никакие другие типы не поддерживаются. Функция возвращает атрибут для префикса, соответствующего данному IP-адресу. Если есть перекрывающиеся префиксы, возвращается наиболее специфический.
2020-12-24 15:46:45 +00:00
Данные должны полностью помещаться в оперативной памяти.
2018-10-16 10:47:17 +00:00