Избыток цитозина позволил тимовирусам записать изменчивый ген поверх стабильного

10-09-2026 06:22
news-image
Капуста, пораженная вирусом желтой мозаики турнепса (TYMV), и трехмерная структура этого вируса

Рис. 1. Слева — капуста, пораженная вирусом желтой мозаики турнепса (TYMV), фото из Википедии. Справа — трехмерная структура вируса, полученная методом рентгеноструктурного анализа (код PDB: 2FZ2)

Геном тимовирусов — фитопатогенов, заражающих в основном крестоцветные и паслёновые, — небольшой даже по вирусным меркам: всего около шести тысяч оснований. Тимовирусам приходится экономить: с одного и того же участка РНК считываются и гены, отвечающие за репликацию вируса (в основной рамке), и ген белка движения, обеспечивающего распространение вируса (в дополнительной рамке, со сдвигом в одно основание). Белки основной рамки под давлением отрицательного отбора почти не меняются, тогда как записанный буквально теми же «буквами» белок движения находится под положительным отбором и накапливает замены — вероятно, чтобы ускользать от защитных систем растения. Исследователи из Австралии и Ирана разобрались, как вирусам удается совместить несовместимое. Они показали, что разнонаправленный отбор на одном и том же участке генома становится возможным благодаря тому, что геном тимовирусов необычно богат цитозином.

Самый известный тимовирус (Tymovirus) — вирус желтой мозаики турнепса (TYMV), вызывающий появление пятен различной окраски на листьях. Он поражает растения семейства крестоцветных, например капусту (рис. 1). Статья, вышедшая в Journal of General Virology, выполнена на материале геномов TYMV и еще одного хорошо изученного тимовируса APLV (Andean potato latent virus). Ее главный автор — Адриан Гиббс из Австралийского национального университета в Канберре, — занимается эволюцией вирусов растений не одно десятилетие. Нынешняя статья продолжает его же работу, опубликованную несколькими месяцами ранее, — филогению 109 тимовирусов, прослеживающую их путь от крестоцветных Евразии к паслёновым Южной Америки (см. A. J. Gibbs et al., 2026. A Phylogeny of the Tymoviruses, Sensu Stricto, and Its Global Interpretation in Space and Time).

Эволюция геномов балансирует между давлением отрицательного отбора, отсеивающего мутантов с вредными изменениями, и положительного отбора, увеличивающего в популяции число мутантов с полезными изменениями. Для того чтобы «наткнуться» на благоприятную мутацию, в геноме должно быть достаточно материала для проб и ошибок. Если исходить из этого представления, то у вирусов с небольшими геномами, таких как тимовирусы, эволюция должна склоняться в сторону отрицательного отбора. Замены нуклеотидов в генах, связанных с важными функциями, такими как репликация, «не имеют права» быть даже слабовредными и отсеиваются отбором. Это позволяет виду выжить, однако ограничивает изменчивость и, следовательно, приобретение новых признаков. Однако наблюдения показывают, что тимовирусы остаются эволюционно достаточно гибкими, чтобы приобретать новых хозяев и реагировать на изменения в окружающей среде. Как им это удается? В описываемой статье показано, как разные режимы отбора могут поддерживаться параллельно на одном и том же отрезке генома тимовируса благодаря особенностям его нуклеотидного состава.

Нуклеотиды, кодоны и рамки считывания

Наследственная информация тимовирусов записана не в ДНК, а в одноцепочечной РНК. Попав в клетку, РНК тимовирусов читается рибосомой напрямую, как готовая инструкция. Можно сказать, что такой геном — это матричная РНК (мРНК). Такие РНК называют «плюс-цепями». Всё вместе принято сокращать +ssRNA — от английского positive-sense single-stranded RNA (плюс-цепь одноцепочечной РНК). Запись ведется четырьмя основаниями (нуклеотидами), которые обозначают буквами A (аденин), C (цитозин), G (гуанин) и U (урацил). В геноме тимовирусов 5,9–6,5 тысяч оснований.

Обычно в геномах +ssRNA-вирусов превалирует аденин, однако тимовирусные геномы сильно выделяются: они содержат до 40% цитозина. Кроме того, белки тимовирусов удивительно богаты аминокислотами лейцином (Leu), пролином (Pro) и серином (Ser).

Нуклеотиды читаются не по одному, а тройками: каждая тройка, называемая кодоном, соответствует одной аминокислоте — звену будущей белковой цепи. Аминокислот всего двадцать, а возможных троек шестьдесят четыре, поэтому многие аминокислоты закодированы несколькими разными кодонами — это свойство называется «вырожденностью генетического кода». Три тройки не кодируют ничего и служат сигналом «конец белка» (их называют стоп-кодонами). У разных организмов есть предпочтительные и редкие кодоны. Например, аминокислота лейцин может быть закодирована шестью кодонами — UUA, UUG, CUU, CUC, CUA и CUG, — однако на практике у конкретного вида может встречаться лишь один или два из них. Таким образом, кодонный состав, то есть набор предпочитаемых кодонов для аминокислот, не одинаков для разных организмов.

Раз нуклеотидные «слова» читаются тройками, то результат зависит от того, с какой позиции начать: сдвиг всего на одну букву разбивает ту же самую последовательность на другие тройки, а значит, при считывании получается совсем другой белок. Продолжим аналогию с естественным языком: набор букв томпилром, если ставить пробел после каждой третьей буквы, распадается на осмысленную фразу Том пил ром. Если же начало сдвинуть на одну букву вперед, но оставить правило «вставить пробел после каждой третьей буквы», то фраза превращается в бессмыслицу: омп илр ом. У любой РНК таких вариантов разбивки три, и участок, который при выбранном начале читается как осмысленная инструкция для белка (или белков, если инструкция содержит несколько генов — такое тоже бывает, например у бактерий), называется открытой рамкой считывания (open reading frame, ORF), или просто рамкой считывания. Обычно вирус использует одну рамку на один участок генома. Тимовирусы, как мы увидим, используют две, причем сдвинутая рамка считывания дает не бессмыслицу, а функциональный белок движения — подобно тому, как набор букв естоконас в зависимости от того, с какой буквы мы начинаем разделять его на слова, дает ест око нас и сто кон ас.

Четыре гена вируса желтой мозаики турнепса (TYMV), кодирующие белки для размножения вируса внутри клетки, расположены в пределах одной рамки считывания (Main ORF на рис. 2). Это метилтрансфераза, протеаза, хеликаза и РНК-зависимая-РНК-полимераза. Полимераза копирует геном, наращивая новую цепь РНК по старой как по образцу, а хеликаза нужна для корректной работы полимеразы. Метилтрансфераза достраивает на конце готовой копии «шапочку», прячущую вирусную РНК от защитных систем клетки. Протеаза (пептидаза) работает как ножницы: все эти белки синтезируются единой длинной цепью и лишь потом разделяются на самостоятельные части как раз с ее помощью. Отдельно транслируется ген белковой оболочки вируса (coat protein, CP на рис. 2): из множества его копий собирается «скорлупка», защищающая РНК за пределами клетки (рис. 1, справа).

Со сдвигом в один нуклеотид относительно основной рамки считывания закодирован белок движения (MP на рис. 2), участвующий в распространении вируса в тканях растения и, возможно, противодействующий защитным системам его клеток. Интересной особенностью белка движения является то, что он внутренне неупорядоченный (intrinsically disordered protein, IDP), или нативно-развернутый. Обычный белок после синтеза самопроизвольно сворачивается в определенную пространственную структуру, от которой зависит его функция: фермент режет или копирует именно потому, что его активный центр имеет строго заданную геометрию. Внутренне неупорядоченный белок такой структуры не имеет вовсе. В растворе он существует как подвижный ансамбль постоянно меняющихся конформаций.

Схема геномной организации TYMV

Рис. 2. Вверху — схема геномной организации TYMV. Main ORF — основная рамка считывания генома тимовируса, содержащая несколько генов, транслируемых в слитый белок и разрезаемая собственной протеазой вируса. MP ORF — рамка считывания гена белка движения (movement protein), сдвинутая относительно основной ORF влево на один нуклеотид. CP ORF — рамка для гена белка оболочки вируса, транслируемого отдельно. IDP — внутренне неупорядоченные белки, соединяющие структурные белки генома или их части. Внизу — пространственная структура вирусных белков. Иллюстрация из описываемой статьи

Обилие цитозина и аминокислотный состав

Ранее было показано, что основная рамка считывания в геноме TYMV содержит признаки сильного отрицательного отбора, но те кодоны, которые закрепились в результате положительного отбора, расположены в пределах сдвинутой на один нуклеотид более короткой рамки считывания (MP ORF на рис. 2). В рассматриваемой статье авторы провели поиск взаимосвязей между сдвигом рамки считывания, нуклеотидным составом вирусных РНК, аминокислотным составом белков, синтезированных на основе двух перекрывающихся рамок считывания, и предпочтением кодонов (их выбором из возможных альтернатив, доступных благодаря вырожденности генетического кода) в двух открытых рамках считывания.

Авторы исследовали закономерности того, как меняется распределение нуклеотидов и кодонов на протяжении генома вируса. Содержание C, A, U и G равномерно распределено по всему геному, однако распределение кодонов аминокислот, кодируемых перекрывающимися открытыми рамками считывания, варьирует значительно сильнее.

Чтобы проверить, является ли обогащение вирусных белков лейцином, пролином и серином следствием нуклеотидного или кодонного состава, нуклеотиды из геномов двух родственных и при этом хорошо изученных вирусов, APLV и TYMV, перетасовали случайным образом (по 100 повторов на геном) и «транслировали» полученную белиберду — естественно, только виртуально. Перемешивание сохраняет мононуклеотидный состав генома, но разрушает кодонную структуру, рамки считывания и влияние отбора. Всё, что остается в «белках» после такой процедуры, объясняется одним лишь нуклеотидным составом.

Случайные «белки» оказались так же богаты аминокислотами лейцином, пролином и серином, как настоящие. Это можно объяснить высоким содержанием цитозина в геноме. Дело в том, что цитозин во второй позиции кодона дает пролин (CCN, N означает «любой из возможных»), серин (UCN), треонин (ACN) или аланин (GCN); в первой — в том числе лейцин (CUN). Лейцин и серин имеют по шесть кодонов, пролин — четыре, то есть они часты в любой случайной последовательности. Следовательно, обогащенность лейцином, пролином и серином — не свойство белков, а следствие нуклеотидного состава генома.

У случайных «белков» также были посчитаны стоп-кодоны. В случайных «трансляциях» двух геномов стоп-кодоны встречались с частотой 3,1% и 3,0%. Это заметно ниже 4,69%, ожидаемых при равных долях оснований, и объясняется тем, что ни один из трех стоп-кодонов (UAA, UAG, UGA) не содержит C. Настоящие же рамки считывания стопов не содержат вовсе, при том что случайная рамка обрывалась бы в среднем через 33 кодона.

Затем авторы провели сравнение аминокислотного состава трех рамок считывания (главной рамки, содержащей четыре основных гена, рамок белка оболочки и белка движения) попарно у APLV и TYMV. Мерой служила сумма квадратов разностей процентных долей: для каждой из двадцати аминокислот смотрели, насколько отличается ее доля в двух белках, разности возводили в квадрат (чтобы крупные расхождения весили больше мелких, а избытки не гасили недостачи) и складывали. Получалось одно число: чем оно больше, тем сильнее два белка разошлись по составу. Заметим, что порядок аминокислот в цепи такое сравнение не учитывает вовсе.

В результате выяснилось, что продукт основной рамки считывания наиболее консервативен, а белок движения наиболее вариативен, причем белки движения различаются в основном по пролину и серину, а белки оболочки двух вирусов — по серину и треонину. То, что белки движения у родственных вирусов различаются именно по пролину и серину, особенно примечательно. Это остатки, характерные для внутренне неупорядоченных белков — как раз таких, как белок движения. Обогащение этими аминокислотами последовательности обычного белка обернулось бы поломкой, а у неупорядоченного белка ломать нечего и пространство свободы для положительного отбора больше.

Отрицательный и положительный отбор в перекрывающихся рамках считывания

В одной из предыдущих работ авторы выяснили, что отрицательный отбор в геномах тимовирусов сосредоточен в той рамке считывания, которая кодирует жизненно важные для вируса белки репликации — то есть белки, необходимые для размножения и воспроизведения генетической информации вируса. Положительный же отбор, напротив, приходится в основном на ген белка движения.

Как узнать, какой отбор действовал на ген? Здесь помогает та самая избыточность кода. Замены в геноме бывают двух видов: одни меняют кодон так, что изменяется кодируемая им аминокислота в белке (их называют несинонимичными, или значимыми); другие заменяют кодон альтернативным и аминокислоту не затрагивают вовсе (синонимичные). Второй вид замен отбор почти не замечает, так что синонимичные замены позволяют измерить, сколько изменений накопилось бы, если бы отбор молчал. Синонимичные замены можно использовать как «фон», отклонение от которого помогает увидеть влияние отбора. Отношение несинонимичных замен к синонимичным, нормированное на число потенциально возможных мест для таких замен, обозначают dN/dS. Если значимые замены накапливаются примерно так же, как безразличные, отношение близко к единице: отбор к судьбе этого белка равнодушен. Если значимых заметно меньше — отношение меньше единицы, и это признак отрицательного отбора: почти любое изменение белка оказывалось вредным и отсеивалось. А если значимых замен, наоборот, больше, чем безразличных, и отношение превышает единицу — это более редкий случай, когда отбор не просто «терпит» изменения белка, но и поддерживает их как полезные. Это и есть след положительного отбора.

Метод подсчета dN/dS имеет ограничение: с его помощью можно посчитать только давление отбора в среднем на весь геном. В нынешней статье авторы проверили этот вывод более тонким инструментом FUBAR, способным оценивать давление отбора для каждого отдельного кодона. Работает этот метод так. Несколько прочитанных геномов одного или близких видов выравнивают — то есть располагают друг под другом так, чтобы в одном столбце оказались нуклеотиды общего происхождения, а на месте вставок и делеций появились пропуски (для этого существуют специальные, хорошо известные специалистам алгоритмы). Получается таблица, где строки — геномы, а столбцы — сравнимые между собой позиции. Именно столбцы дальше и анализируются: столбец, одинаковый у всех изолятов (образцов вируса, для которых прочитан геном), говорит о сохранении этой позиции в эволюции, разнообразный же по составу столбец несет эволюционный сигнал.

Каждый столбец в отдельности — слишком бедный источник сведений. Даже по нескольким десяткам последовательностей замен в одной позиции обычно всего одна-две, и по такому материалу ничего надежного не скажешь. Поэтому FUBAR сначала «смотрит» на выравнивание целиком и оценивает, какие вообще режимы отбора встречаются и насколько они распространены: много ли позиций жестко законсервированных, много ли безразличных, есть ли позиции с превышением значимых замен над синонимичными. А затем каждую отдельную позицию оценивает уже на фоне этой общей картины и выдает не «да» или «нет», а вероятность того, что конкретный кодон относится к тому или иному режиму. В статистике такой прием называется байесовским: сведений об одной позиции мало, поэтому недостающее берется из того, что известно про весь ген. Позиция считается отобранной, если вероятность превышает установленный порог. У метода есть важное ограничение. FUBAR ищет отбор, действовавший постоянно, на всем протяжении истории вируса, и не замечает ситуаций, когда белок быстро менялся при освоении нового хозяина, а затем снова застыл. Иными словами, метод отвечает не на вопрос «менялась ли эта позиция когда-нибудь под давлением отбора», а скорее на вопрос «менялась ли она так всегда».

Такой анализ, как видно, должен получить на входе некоторое количество последовательностей родственных геномов для выравнивания. В достаточном количестве отсеквенированы геномы лишь двух тимовирусов — APLV и TYMV: 18 геномов и 21 геном, соответственно. Их и взяли для оценки давления отбора на конкретные кодоны.

Результат воспроизвел прежнюю картину. В белке движения APLV положительно отобранными оказались 211 кодонов, TYMV — 58, тогда как отрицательно отобранных там нашлось всего 14 и 8, соответственно. Таким образом, ген белка движения выглядит почти целиком «разрешенным к изменениям». В основной рамке считывания всё зеркально: положительно отобранных кодонов там оказались буквально единицы (один у APLV и три у TYMV), зато под отрицательным отбором находится 75% кодонов у APLV и 48% у TYMV. Почему эти два вируса так различаются между собой и по абсолютным числам, и по доле законсервированных позиций, авторы объяснить не берутся и лишь осторожно предполагают, что дело может быть в разных хозяевах.

Следующий анализ показал, что положительно отобранные кодоны распределены по всей длине гена белка движения более или менее равномерно, а отрицательно отобранные — так же равномерно по всей главной рамке считывания. Авторы также заметили, что положительно отобранные позиции в гене белка движения часто идут не поодиночке, а парами и более длинными сериями подряд, вплоть до двух групп по восемь идущих подряд сайтов у APLV. Чтобы понять, случайно ли это, они применили тест ван дер Планка (). Забавно, что этот метод был придуман для оценки того, сколько групп соседствующих друг с другом больных растений должно возникать на однородном поле просто по случайности. В данном случае «полем» служит последовательность, а «больными растениями» — отобранные кодоны. Наблюдаемый избыток пар и более крупных групп превысил ожидаемое при случайном распределении более чем на семь стандартных отклонений у TYMV и на двенадцать у APLV, то есть скучивание явно не случайно. Что за этим стоит, осталось неясным: никакого общего аминокислотного состава у этих групп не нашлось — одни пары состояли из похожих остатков, другие нет. И, что существенно, у отрицательно отобранных кодонов подобного скучивания не наблюдается: они рассеяны по основной рамке считывания независимо друг от друга.

У патогенов растений генами авирулентности называют гены, продукты которых узнаются R-белками устойчивого к этому патогену хозяина и запускают защитную реакцию. Такие гены отвечают за взаимодействие с хозяином и находятся под положительным отбором, поскольку патогену выгодно ускользнуть от узнавания. Чтобы выжить, вирус должен одновременно иметь и жестко законсервированные гены, и гены, свободно меняющиеся. Тимовирусы, по мысли авторов, решили эту задачу необычным способом: у них почти весь положительный отбор упакован в один-единственный ген, лежащий «поверх» других генов в дополнительной рамке считывания.

Для контраста приводятся потивирусы (Potyvirus), у которых практически весь геном — вдвое длиннее генома тимовирусов — это одна рамка считывания, а положительно отобранные участки разбросаны вдоль всего генома. За счет длины генома потивирусы могут позволить себе иметь участки под положительным отбором в разнообразных местах своей РНК, затрагивая несколько генов.

Правда, «тимовирусный» способ вряд ли окажется распространенным, потому что он опирается на редкую особенность генома — очень высокое содержание C, а через него на пролин-серинное смещение в составе белков. Поскольку это свойство нуклеотидного состава, а не рамки считывания, оно проявляется при любом способе прочтения последовательности, в том числе в сдвинутой рамке. Наглядный частный случай: тройка UCC, кодирующая серин, вместе с любой следующей буквой дает при сдвиге на один нуклеотид один из четырех кодонов пролина — CCA, CCU, CCG или CCC. Это позволяет белку движения обладать нативно-развернутой структурой и освобождает его от давления отрицательного отбора, стремящего сохранить жесткую пространственную структуру белков (рис. 3).

Аминокислоты в геноме, богатом цитозином

Рис. 3. C-богатый геном дает пролин-сериновые белки. Кодоны, соответствующие пролину, содержат два С, серину — С во второй позиции. Кроме того, при сдвиге рамки считывания кодоны, имеющие С во второй и третьей позициях, дают кодон для пролина при любом следующем за ними нуклеотиде. Участок CCCUCCA, соответствующий аминокислотам пролин-серин, прочитанный со сдвигом на один нуклеотид, дает пролин-пролин. Обилие пролина и серина мешает цепи свернуться в жесткую структуру, приводя к появлению нативно развернутого белка, терпимого к заменам.

Как именно ген белка движения тимовирусов работает в роли гена авирулентности, неизвестно. Проверять предлагается через круг хозяев. Большинство тимовирусов выделено либо с крестоцветных, либо с паслёновых, но несколько изолятов происходит с Ullucus tuberosus, уллюко, представителя гвоздичноцветных. При этом из уллюко получены два разных тимовирусных метагенома, и один из них ближе к вирусам крестоцветных, а другой к вирусам паслёновых. Иными словами, перед нами два независимых события освоения одного и того же необычного хозяина двумя разными линиями. Если эти вирусы удастся выделить и культивировать (пока это только метагеномные последовательности), то, сравнивая их гены белка движения с генами их ближайших родственников, оставшихся на исходных хозяевах, можно было бы биохимически проверить роль белка движения в определении круга хозяев.

Уллюко клубненосный

Рис. 4. Уллюко клубненосный (Ullucus tuberosus), однолетнее травянистое растение из семейства Basellaceae. Культивируется в горных районах Центральной и Южной Америки ради богатых крахмалом клубней (справа), употребляемых в пищу. Фото из Википедии и с сайта cultivariable.com

Выводы

Итак, тимовирусы решают задачу, с которой сталкивается любой паразит. Часть его устройства меняться не должна: механизм копирования генома отлажен, и почти любая правка в нём может оказаться поломкой. Другая часть, наоборот, меняться обязана, иначе растение научится узнавать пришельца и остановит заражение. Обычно вирусы разносят эти две задачи по разным участкам генома. Тимовирусы поступили иначе: у них консервативная и изменчивая части записаны друг поверх друга, на одном и том же отрезке РНК, но читаются в двух разных рамках. Замена, безразличная для белка репликации, оказывается заметной для белка, прочитанного со сдвигом. Так на одном куске генома уживаются два противоположных режима: один сохраняет, другой позволяет меняться.

Вирус доверил изменчивой рамке ген белка движения, того самого, что проводит вирус из клетки в клетку и, значит, чаще прочих сталкивается с защитными системами растения. У родственных вирусов белок движения давно известен как мишень, по которой растение опознает заразу; логично предположить, что и тимовирусы меняют его, чтобы такое опознание сорвать. Прямых доказательств этому пока нет, так что здесь мы имеем дело с правдоподобной догадкой, а не с установленным фактом. Проверить ее можно: несколько тимовирусов освоили уллюко, южноамериканский корнеплод, далекий и от капусты, и от картофеля. Сравнение их белков движения с белками ближайших родственников, оставшихся на прежних хозяевах, могло бы показать, действительно ли этот ген определяет, кого вирус способен заразить.

Наконец, стоит удержаться от соблазна считать найденное общим правилом. Запись с перекрыванием работает у тимовирусов во многом потому, что их геном необычно богат цитозином, из-за чего белок, прочитанный со сдвигом, лишен жесткой пространственной структуры и потому терпим к заменам, которые в обычном белке были бы смертельны. Такой состав генома встречается у немногих вирусов, и повторить этот прием мало кому под силу. Перед нами, похоже, не универсальный рецепт, а частное решение, выросшее из особенностей конкретной группы.

Лиза Григорашвили


Источник: Элементы