Согласно документации по MySQL , существует четыре типа TEXT:
- TINYTEXT
- ТЕКСТ
- MEDIUMTEXT
- LONGTEXT
Какова максимальная длина, которую я могу хранить в столбце каждого типа данных, предполагая, что кодировка символов - UTF-8?
Согласно документации по MySQL , существует четыре типа TEXT:
Какова максимальная длина, которую я могу хранить в столбце каждого типа данных, предполагая, что кодировка символов - UTF-8?
Ответы:
Из документации :
Обратите внимание, что количество символов, которое можно сохранить в столбце, будет зависеть от кодировки символов .
источник
A TEXT column with a maximum length of 255 (28 – 1) characters. The effective maximum length is less if the value contains multi-byte characters.
см. Ответ Анкана для более подробной информации.Расширение того же ответа
ЭТО ЖЕСТКИЙ СТОЛ ОЦЕНКИ ДЛЯ БЫСТРОГО РЕШЕНИЯ!
хх
Пожалуйста, обратитесь к ответу Криса V также: https://stackoverflow.com/a/35785869/1881812
источник
TINYTEXT
считает 1 байт + 8 байт от размера записи, тогда как aVARCHAR(255)
считает от 1 байта + 255 байт до 2 байт + 1020 байт (4 байта символов UTF-8) против размера записи.Подходя к задаче @ Ankan-Zerob, это моя оценка максимальной длины, которую можно сохранить в каждом типе текста, измеряемом словами :
В английском языке 4,8 буквы на слово, вероятно, являются хорошим средним значением (например, norvig.com/mayzner.html ), хотя длина слова будет варьироваться в зависимости от предметной области (например, разговорный язык или академические работы), поэтому нет смысла быть слишком точным. Английский - это в основном однобайтовые символы ASCII, с очень редкими многобайтовыми символами, которые близки к одному байту на букву. Для межсловных пробелов должен быть разрешен дополнительный символ, поэтому я округлил с 5,8 байта на слово. Языки с большим количеством акцентов, такие как, скажем, польский, будут хранить немного меньше слов, как, например, немецкий с более длинными словами.
Для языков, требующих многобайтовых символов, таких как греческий, арабский, иврит, хинди, тайский и т. Д. И т. Д., Обычно требуется два байта на символ в UTF-8. Угадывая по 5 букв на слово, я округлил с 11 байтов на слово.
Сценарии CJK (ханзи, кандзи, хирагана, катакана и т. Д.), О которых я ничего не знаю; Я полагаю, что символам в UTF-8 в основном требуется 3 байта, и (с огромным упрощением) они могут использовать около 2 символов в слове, поэтому они будут где-то между двумя другими. (Сценарии CJK, вероятно, потребуют меньше памяти при использовании UTF-16, в зависимости от).
Это, конечно, игнорирование накладных расходов на хранение и т. Д.
источник
Это хорошо, но не отвечает на вопрос:
«VARCHAR всегда должен использоваться вместо TINYTEXT». Tinytext полезен, если у вас широкие строки - поскольку данные хранятся вне записи. Производительность снижается, но она имеет смысл.
источник