Статья

Сколько букв в ДНК: генетический код простыми словами и что будет, если добавить ещё четыре

Сколько букв в ДНК: генетический код простыми словами и что будет, если добавить ещё четыре

Инна ЮдинаИнна Юдина·3 ч назад·
4
··0·
В ДНК четыре буквы: А, Т, Г и Ц (в латинском написании — A, T, G, C). Это четыре вещества, стоящие в длинной цепочке в определённом порядке, и сам порядок и есть текст, по которому клетка собирает белки. Четыре — не предел химии, а сложившаяся привычка жизни: в сентябре 2026 года группа Донга Вана из Калифорнийского университета в Сан-Диего показала, что бактериальный фермент правильно читает алфавит из восьми букв. Пока — в пробирке, не в живой клетке.

Что такое «буквы ДНК»

Формулировка «генетический код» звучит как что-то зашифрованное, а на деле всё приземлённее. ДНК — очень длинная нить. К её однообразному хребту через равные промежутки прицеплены боковые детальки, азотистые основания. Их четыре сорта: аденин, тимин, гуанин, цитозин — их и сокращают до букв А, Т, Г, Ц. Всё остальное в нити одинаковое, различаются только эти висюльки — значит, вся информация сидит в их порядке. Дальше простая механика. Клетка ползёт по нити и считывает буквы тройками. Тройка — адрес одной аминокислоты, они нанизываются в цепочку, цепочка сворачивается в белок: фермент, гормон, кусок мышцы. Из четырёх букв получается 4 × 4 × 4 = 64 тройки, и этого с запасом хватает на двадцать с небольшим аминокислот, из которых собрано всё живое. То есть «буквы» — не метафора для красоты, а буквально алфавит.

Почему буквы стоят парами и при чём тут копирование

Вторая половина фокуса — в том, что нитей две и они лежат друг напротив друга. Буквы там стоят не как попало: А всегда смотрит на Т, Г — на Ц. Это правило называют комплементарностью. Держатся пары водородными связями — слабенькими зацепками между атомами: у А–Т их две, у Г–Ц три (поэтому участки, богатые Г и Ц, труднее расплетаются). И вот ради чего всё устроено: по одной половинке вторая восстанавливается однозначно. Расплели нить пополам, к каждой достроили недостающее — получили две одинаковые молекулы вместо одной. Копирование наследственности, размножение клеток, передача признаков детям стоят на этом правиле. Поэтому вопрос «а можно добавить букв?» не праздный: новая буква имеет право на существование только если у неё есть своя пара и она не путается с существующими.

Таблица: буква, её пара и чем пара держится

Буква → с чем встаёт в пару → чем держится А (аденин) → Т (тимин) → две водородные связи; природная пара Г (гуанин) → Ц (цитозин) → три водородные связи; природная пара Z → P → три водородные связи; синтетическая пара алфавита «хатимодзи» S → B → три водородные связи; синтетическая пара того же алфавита NaM → TPT3 → водородных связей нет вообще; пара держится формой и притяжением «жирных», не любящих воду поверхностей Первые две строки есть в любой клетке на Земле, три нижние — химия, придуманная людьми. Z, P, S и B собраны в алфавит «хатимодзи» (по-японски «восемь знаков»): их нарисовали так, чтобы пары были той же ширины и формы, что природные.
Четыре природные буквы и четыре синтетические: кто с кем встаёт в пару и чем эта пара держится

Фермент проверяет форму пары, а не её химию

Ради этого поворота я и села писать. Чтобы с ДНК что-то происходило, к ней подходит фермент — у группы Вана это РНК-полимераза кишечной палочки, машина, которая ползёт по ДНК и переписывает её в РНК. Интуитивно кажется, что буквы она узнаёт химически: щупает те самые водородные связи и по ним понимает, правильная перед ней пара или брак. Структуры говорят другое. Фермент проверяет геометрию: пара должна иметь нужную ширину и правильно лечь в свой паз внутри белка. Это ближе к замку, чем к химическому анализу: важен профиль ключа, а не то, из чего он отлит. Отсюда и объяснение, почему синтетические буквы проходят фейсконтроль. Хатимодзи-пары сделали природного размера, они ложатся в паз как родные. Но показательнее всего NaM–TPT3: водородных связей нет, она держится тем, что две «жирные» плоские поверхности липнут друг к другу и плотно упакованы. По химии — совсем не то, что А–Т, а по форме — то что нужно, и фермент её принимает; в работе в PNAS (12 августа 2026, DOI 10.1073/pnas.2607774123) видно даже, что такая пара нормально захлопывает подвижную часть фермента перед следующим шагом. Выходит, миллиарды лет отбора настроили машину не на четыре конкретных вещества, а на форму того, что она держит в руках. Это и есть щель, в которую пролезает расширенный алфавит.
Схема: паз в ферменте пропускает и природную пару, и синтетическую без водородных связей — потому что совпадает форма

Почему в природе букв именно четыре

Вопрос возникает сразу, и честный ответ немного разочаровывает: единого объяснения нет, есть несколько соображений. Надёжность. Чем больше букв, тем чаще они путаются при копировании, а ошибка в наследственном тексте обходится дорого: небольшой процент брака съедает информацию очень быстро. Экономность. Четыре буквы — это две пары, минимум разных молекул, которые клетке нужно производить и держать под рукой. Добавьте ещё четыре — придётся содержать параллельную фабрику. История. Ранняя жизнь работала с тем, что было доступно в её химии, а когда на четырёхбуквенном алфавите выросли все механизмы разом — копирование, чтение, сборка белков, — менять алфавит стало невозможно: переделывать пришлось бы всё сразу. Эволюция так не умеет. Есть и расчёты, где четвёрку оценивают как компромисс: по плотности информации выгоднее алфавит побольше, но выигрыш съедается ростом ошибок. Словом, это не «единственно возможное число», а решение, которое сложилось и не переигрывалось.

Что теоретически даёт алфавит из восьми букв

Первое — плотность записи. Позиция из четырёх вариантов несёт два бита, из восьми — три: прибавка в полтора раза на каждую букву. На коротком куске ерунда, на длинных последовательностях — заметная разница. Второе — простор для белков. Троек из четырёх букв 64, из восьми — 512: появляется запас свободных адресов, которые можно раздать аминокислотам, каких в природе не бывает. А другие аминокислоты — это другие белки: с непривычной жёсткостью, необычной химией, меткой, которую можно поймать приборами. Расширение не только словаря, но и материала. Третье — избирательность: молекулы с необычными буквами хуже путаются с природными, и на них удобно строить узкие инструменты. Всё это пока возможности, а не готовые продукты.

Зачем это на практике: архив в ДНК и предохранитель

Хранение данных. ДНК — плотный и долговечный носитель: не требует питания и в правильных условиях лежит тысячелетиями. Идею записывать в неё архивы обсуждают давно, эксперименты идут. Лишние буквы работают напрямую: больше вариантов на позицию — короче цепочка на тот же объём, а синтез и чтение цепочек и есть самое дорогое в этой технологии. Инженерно готового решения пока нет ни у кого. Предохранитель. Вот это самое красивое. Инженерным микробам поручают полезную работу, и главный страх — что они разбегутся за пределы установки. Если организму для жизни нужны неприродные буквы, а взять их можно только из питательной среды, которую готовят в лаборатории, снаружи он просто остановится. Не карантин и не забор, а встроенная зависимость от того, чего в природе нет.

Это создание новой жизни? Нет

Отвечаю прямо. Взяли очищенный фермент и синтетические цепочки ДНК с необычными буквами, смешали в пробирке и посмотрели, что получится: фермент читает такую ДНК корректно. Потом эту сцену засняли — так, что видно отдельные атомы. Работа про один белок и одну реакцию. Живая клетка — другой масштаб задачи. Ей нужно не только прочитать необычные буквы, но и производить их, встраивать в свою ДНК при каждом делении, не терять при починке повреждений, не спотыкаться о десятки контрольных систем, обученных выбраковывать всё непривычное. Отдельные шаги делались — были бактерии, носившие одну дополнительную пару. Но клетки, живущей на восьми буквах, не существует, и до неё отсюда очень далеко. Правильная формулировка: природная молекулярная машина оказалась терпимее к чужой химии, чем от неё ждали. Это про механику фермента, а не про сотворение чего бы то ни было.

Как увидели молекулу: криоэлектронная микроскопия

Молекула белка слишком мала для света. Электроны в роли «освещения» подходят, но разбивают хрупкую органику раньше, чем удаётся снять приличный кадр, да и микроскоп работает в вакууме, а молекула без воды теряет форму. Решение — заморозка, но не обычная. Каплю раствора охлаждают так быстро, что вода не успевает собраться в кристаллики льда (они бы всё изуродовали), а застывает стеклом. Молекулы остаются в естественной форме, но обездвиженные, и заодно холод снижает вред от пучка. Дальше арифметика. Каждая молекула в стекле замерла в случайном повороте, и микроскоп снимает сотни тысяч слабых шумных теней с разных сторон. Компьютер сортирует их по ракурсам, усредняет тысячи одинаково повёрнутых снимков и собирает из плоских проекций объёмную модель. Похоже на томографию, только вместо одного пациента — миллионы копий одной молекулы. Способ отмечен Нобелевской премией по химии 2017 года и дошёл до разрешения, на котором видны отдельные атомы. Поэтому здесь можно говорить не «фермент справился», а «фермент придерживает пару вот в этом месте и вот так».

Честные ограничения

Это пробирка: фермент, ДНК и буфер, никакой клетки. Это бактериальный фермент — РНК-полимераза кишечной палочки; человеческие устроены сложнее, и переносить вывод на них напрямую нельзя. И это чтение, а не жизнь: показано, что текст с необычными буквами можно корректно переписать в РНК, а между этим и клеткой, которая копирует, чинит и передаёт такой текст потомкам, лежит длинная цепочка нерешённых задач. И ещё: работа не про правку генов. Соседняя тема, но принципиально другая — там меняют слова в уже написанном тексте, здесь пробуют расширить набор знаков, которыми текст записан.

Частые вопросы

Сколько всего букв в ДНК?

Четыре: А (аденин), Т (тимин), Г (гуанин), Ц (цитозин); в латинском написании A, T, G, C. Так устроено всё живое — от бактерии до человека. Восемь букв встречаются только в синтетических молекулах, собранных в лаборатории.

Почему буквы стоят парами?

Потому что нитей две и они лежат друг напротив друга: А напротив Т, Г напротив Ц. Благодаря этому строгому правилу по одной половине однозначно восстанавливается вторая — на этом держится всё копирование наследственности.

Чем буквы РНК отличаются от букв ДНК?

Букв тоже четыре, но вместо тимина (Т) стоит урацил (У), и нить обычно одинарная. РНК — рабочая копия участка текста; ДНК — долговременный оригинал.

Что такое хатимодзи?

«Хатимодзи» по-японски — «восемь знаков»: четыре природные буквы плюс четыре синтетические, Z, P, S и B. Они образуют две дополнительные пары — Z с P и S с B — и сделаны такого же размера и формы, как природные.

Восемь букв — это уже искусственный организм?

Нет. Опыты сделаны в пробирке с очищенным ферментом и синтетической ДНК. Клетки, живущей на восьмибуквенном алфавите, не существует: организм ещё нужно научить производить необычные буквы, вставлять их при каждом делении и не выбраковывать своими же системами контроля.

Где расширенный алфавит может пригодиться раньше всего?

В лабораторных инструментах: синтетические цепочки, прицельно цепляющиеся к нужным клеткам (авторы называют распознавание клеток рака печени), плотная запись данных в ДНК и биологический предохранитель — микроб, которому нужны буквы, доступные только в лаборатории.
Источники: Nature Communications, 2 сентября 2026 (DOI 10.1038/s41467-026-76668-0); PNAS, 12 августа 2026 (DOI 10.1073/pnas.2607774123); сообщение Калифорнийского университета в Сан-Диего. Алфавит «хатимодзи» описан в Science в 2019 году.
0

Пока нет комментариев

Сколько букв в ДНК: генетический код простыми словами