2017-12-11 12:07:26 +00:00
# Функции для работы с URL
2017-03-12 17:58:51 +00:00
В с е функции работают не по RFC - то есть, максимально упрощены ради производительности.
2017-12-11 12:07:26 +00:00
## Функции, извлекающие часть URL-а .
2017-10-25 05:27:09 +00:00
2017-03-12 17:58:51 +00:00
Если в URL-е нет ничего похожего, то возвращается пустая строка.
2017-12-11 12:07:26 +00:00
### protocol
2017-03-12 17:58:51 +00:00
Возвращает протокол. Примеры: http, ftp, mailto, magnet...
2017-12-11 12:07:26 +00:00
### domain
2019-08-26 16:09:30 +00:00
Извлекает имя хоста из URL.
2019-09-23 15:31:46 +00:00
```sql
2019-08-26 16:09:30 +00:00
domain(url)
```
**Параметры**
- `url` — URL. Тип — [String ](../../data_types/string.md ).
URL может быть указан с о схемой или без неё. Примеры:
2019-09-23 15:31:46 +00:00
```text
2019-08-26 16:09:30 +00:00
svn+ssh://some.svn-hosting.com:80/repo/trunk
some.svn-hosting.com:80/repo/trunk
https://yandex.com/time/
```
Для указанных примеров функция `domain` возвращает следующие результаты:
2019-09-23 15:31:46 +00:00
```text
2019-08-26 16:09:30 +00:00
some.svn-hosting.com
some.svn-hosting.com
yandex.com
```
**Возвращаемые значения**
- Имя хоста. Если ClickHouse может распарсить входную строку как URL.
- Пустая строка. Если ClickHouse не может распарсить входную строку как URL.
Тип — `String` .
**Пример**
```sql
SELECT domain('svn+ssh://some.svn-hosting.com:80/repo/trunk')
```
```text
┌─domain('svn+ssh://some.svn-hosting.com:80/repo/trunk')─┐
│ some.svn-hosting.com │
└────────────────────────────────────────────────────────┘
```
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### domainWithoutWWW
2019-08-26 16:09:30 +00:00
Возвращает домен, удалив префикс 'www.', если он присутствовал.
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### topLevelDomain
2019-08-26 16:09:30 +00:00
Извлекает домен верхнего уровня из URL.
2019-09-23 15:31:46 +00:00
```sql
2019-08-26 16:09:30 +00:00
topLevelDomain(url)
```
**Параметры**
- `url` — URL. Тип — [String ](../../data_types/string.md ).
URL может быть указан с о схемой или без неё. Примеры:
2019-09-23 15:31:46 +00:00
```text
2019-08-26 16:09:30 +00:00
svn+ssh://some.svn-hosting.com:80/repo/trunk
some.svn-hosting.com:80/repo/trunk
https://yandex.com/time/
```
**Возвращаемые значения**
- Имя домена. Если ClickHouse может распарсить входную строку как URL.
- Пустая строка. Если ClickHouse не может распарсить входную строку как URL.
Тип — `String` .
**Пример**
```sql
SELECT topLevelDomain('svn+ssh://www.some.svn-hosting.com:80/repo/trunk')
```
```text
┌─topLevelDomain('svn+ssh://www.some.svn-hosting.com:80/repo/trunk')─┐
│ com │
└────────────────────────────────────────────────────────────────────┘
```
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### firstSignificantSubdomain
2017-10-25 05:27:09 +00:00
Возвращает "первый существенный поддомен". Это понятие является нестандартным и специфично для Яндекс.Метрики. Первый существенный поддомен - это домен второго уровня, если он не равен одному из com, net, org, co, или домен третьего уровня, иначе. Например, firstSignificantSubdomain('< https: / / news . yandex . ru / > ') = 'yandex', firstSignificantSubdomain('< https: / / news . yandex . com . tr / > ') = 'yandex'. Список "несущественных" доменов второго уровня и другие детали реализации могут изменяться в будущем.
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### cutToFirstSignificantSubdomain
2017-10-25 05:27:09 +00:00
Возвращает часть домена, включающую поддомены верхнего уровня до "первого существенного поддомена" (см. выше).
2017-03-12 17:58:51 +00:00
2017-10-25 05:27:09 +00:00
Например, `cutToFirstSignificantSubdomain('https://news.yandex.com.tr/') = 'yandex.com.tr'` .
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### path
2017-10-25 05:27:09 +00:00
Возвращает путь. Пример: `/top/news.html` Путь не включает в себя query string.
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### pathFull
2017-10-25 05:27:09 +00:00
Т о же самое, но включая query string и fragment. Пример: /top/news.html?page=2\#comments
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### queryString
2017-10-25 05:27:09 +00:00
Возвращает query-string. Пример: page=1& lr=213. query-string не включает в себя начальный знак вопроса, а также \# и всё, что после \#.
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### fragment
2017-03-12 17:58:51 +00:00
Возвращает fragment identifier. fragment не включает в себя начальный символ решётки.
2017-12-11 12:07:26 +00:00
### queryStringAndFragment
2017-10-25 05:27:09 +00:00
Возвращает query string и fragment identifier. Пример: страница=1\#29390.
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### extractURLParameter(URL, name)
2017-03-12 17:58:51 +00:00
Возвращает значение параметра name в URL, если такой есть; или пустую строку, иначе; если параметров с таким именем много - вернуть первый попавшийся. Функция работает при допущении, что имя параметра закодировано в URL в точности таким же образом, что и в переданном аргументе.
2017-12-11 12:07:26 +00:00
### extractURLParameters(URL)
2017-03-12 17:58:51 +00:00
Возвращает массив строк вида name=value, соответствующих параметрам URL. Значения никак не декодируются.
2017-12-11 12:07:26 +00:00
### extractURLParameterNames(URL)
2017-03-12 17:58:51 +00:00
Возвращает массив строк вида name, соответствующих именам параметров URL. Значения никак не декодируются.
2017-12-11 12:07:26 +00:00
### URLHierarchy(URL)
2017-03-12 17:58:51 +00:00
Возвращает массив, содержащий URL, обрезанный с конца по символам /, ? в пути и query-string. Подряд идущие символы-разделители считаются за один. Резка производится в позиции после всех подряд идущих символов-разделителей. Пример:
2017-12-11 12:07:26 +00:00
### URLPathHierarchy(URL)
2017-03-12 17:58:51 +00:00
Т о же самое, но без протокола и хоста в результате. Элемент / (корень) не включается. Пример:
Функция используется для реализации древовидных отчётов по URL в Яндекс.Метрике.
2017-06-13 20:35:07 +00:00
2019-09-23 15:31:46 +00:00
```text
2017-10-25 05:27:09 +00:00
URLPathHierarchy('https://example.com/browse/CONV-6788') =
[
'/browse/',
'/browse/CONV-6788'
]
```
2017-03-12 17:58:51 +00:00
2017-12-11 12:07:26 +00:00
### decodeURLComponent(URL)
2017-03-12 17:58:51 +00:00
Возвращает декодированный URL.
Пример:
2019-09-23 15:31:46 +00:00
```sql
2017-10-25 05:27:09 +00:00
SELECT decodeURLComponent('http://127.0.0.1:8123/?query=SELECT%201%3B') AS DecodedURL;
```
2017-03-12 17:58:51 +00:00
2019-09-23 15:31:46 +00:00
```text
2017-10-25 05:27:09 +00:00
┌─DecodedURL─────────────────────────────┐
│ http://127.0.0.1:8123/?query=SELECT 1; │
└────────────────────────────────────────┘
```
2017-06-13 04:15:47 +00:00
2017-12-11 12:07:26 +00:00
## Функции, удаляющие часть из URL-а
2017-10-25 05:27:09 +00:00
2017-03-12 17:58:51 +00:00
Если в URL-е нет ничего похожего, то URL остаётся без изменений.
2017-12-11 12:07:26 +00:00
### cutWWW
2017-03-12 17:58:51 +00:00
Удаляет не более одного 'www.' с начала домена URL-а , если есть.
2017-12-11 12:07:26 +00:00
### cutQueryString
2017-03-12 17:58:51 +00:00
Удаляет query string. Знак вопроса тоже удаляется.
2017-12-11 12:07:26 +00:00
### cutFragment
2017-03-12 17:58:51 +00:00
Удаляет fragment identifier. Символ решётки тоже удаляется.
2017-12-11 12:07:26 +00:00
### cutQueryStringAndFragment
2017-03-12 17:58:51 +00:00
Удаляет query string и fragment identifier. Знак вопроса и символ решётки тоже удаляются.
2017-12-11 12:07:26 +00:00
### cutURLParameter(URL, name)
2017-03-12 17:58:51 +00:00
Удаляет параметр URL с именем name, если такой есть. Функция работает при допущении, что имя параметра закодировано в URL в точности таким же образом, что и в переданном аргументе.
2018-10-16 10:47:17 +00:00
[Оригинальная статья ](https://clickhouse.yandex/docs/ru/query_language/functions/url_functions/ ) <!--hide-->