ADAR-project

Как построить структуру комплекса белок — РНК

Пошаговая инструкция: где взять последовательности, куда их вставить, что выставить в настройках и как понять, можно ли верить тому, что получилось. Считает AlphaFold 3 на стороне Google — на нашем сайте ничего не строится.

Шаг 1. Взять последовательность белка

Три источника, по убыванию удобства:

Перед вставкой уберите заголовок FASTA (строку с >), пробелы и переносы — AlphaFold принимает только буквы аминокислот, причём X и U (селеноцистеин) не примет.

Белки проекта: сначала целые конструкты, потом отдельные домены.
Что этоа.о.

Шаг 2. Взять последовательность РНК

С РНК главная ловушка — взять произвольный кусок. Одноцепочечная РНК без структуры сложится в кашу, и проверить предсказание будет нечем. Берите то, у чего есть экспериментальный ответ:

Три правила. Только буквы A C G U: тимин из ДНК-записи меняем на урацил. Модифицированные нуклеотиды (в PDB они записаны как X) заменяем на обычные — в наших заготовках 8-азанебуларин уже заменён на аденозин, он и стоит в редактируемом положении. Двуцепочечную РНК добавляем двумя отдельными цепями, а не одной строкой; шпильку — одной цепью, она свернётся сама.

Что этонтоткуда

Шаг 3. Куда заходить

СервисЧто умеетЦена и ограничения
AlphaFold Server
основной путь
Белки, ДНК, РНК, лиганды и ионы в одном комплексе. Это и есть AlphaFold 3. Бесплатно, вход по гугл-аккаунту. 30 заданий в сутки, комплекс до 5000 позиций, только некоммерческое использование.
AlphaFold DB
заглянуть до того, как считать
Готовые модели одиночных белков почти для всего UniProt. Бесплатно и без ограничений. Комплексов с РНК там нет — только сам белок.
Boltz-2, Protenix Открытые модели того же класса, тоже умеют белок вместе с РНК. Свободно, но нужна видеокарта на 40–48 ГБ памяти. Имеет смысл, когда 30 заданий в сутки мало.

Как экономить квоту: сначала загляните в AlphaFold DB. Если нужен просто фолд одиночного белка — он там уже посчитан. Сервер нужен ровно тогда, когда нужен комплекс.

Шаг 4. Что выставить в интерфейсе

  1. Continue with Google. Справа сверху появится счётчик Remaining jobs — сколько заданий осталось на сегодня.
  2. Первая сущность уже есть в форме. Слева от поля ввода — список типа: Protein, DNA, RNA, Ligand, Ion. Поставьте Protein и вставьте последовательность из шага 1.
  3. Copies — сколько копий этой цепи в комплексе. Для одного dsRBD — 1. Ставьте 2, только если проверяете димер: размер комплекса при этом удваивается.
  4. Add entity добавляет вторую цепь. Выберите тип RNA и вставьте последовательность из шага 2. Для двуцепочечного дуплекса нажмите Add entity ещё раз и добавьте вторую цепь отдельно.
  5. Continue and preview job. В окне предпросмотра:
    • Job name — назовите по-человечески, иначе через десяток заданий своё не найдёте (например hADAR2_dsRBD1_hairpin13).
    • Seed — начальное число генератора. Одинаковый seed на том же входе даёт тот же результат; чтобы проверить, устойчиво ли предсказание, тот же вход запускают ещё раз с другим seed.
  6. Confirm and submit job — задание уходит в очередь. Домен со шпилькой считается несколько минут, большой комплекс — десятки.
  7. Модификации остатков, лиганды и ионы для нашей задачи не нужны — не трогайте.

Если не хочется кликать, сервер принимает готовый JSON (кнопка импорта, до 100 заданий в файле). Заготовку можно собрать внизу страницы.

Шаг 5. Что придёт и как это читать

Скачивается архив. Внутри пять моделей (…_model_0.cif…_model_4.cif, нулевая — лучшая по мнению модели), копия запроса (…_job_request.json) и файлы с оценками уверенности.

Что смотретьГдеКак понимать
pLDDT
уверенность в каждом остатке
колонка B-фактора в самом .cif > 90 — можно верить; 70–90 — укладка в целом правильная; 50–70 — сомнительно; < 50 — обычно неструктурированный участок, который модель просто чем-то заполнила.
PAE
ошибка взаимного положения
отдельный файл и картинка на сайте Тёмный квадрат по диагонали — домен уложен уверенно. Тёмный внедиагональный блок между белком и РНК означает, что и их взаимное положение предсказано уверенно. Светлый — цепи сами по себе правильные, а как они стоят друг относительно друга, модель не знает.
ipTM
качество интерфейса
сводка в результатах Главное число для комплекса: > 0.8 — контакт предсказан уверенно; 0.6–0.8 — серая зона; < 0.6 — скорее всего, белок и РНК поставлены рядом наугад.
pTMтам же То же самое, но про структуру целиком, без разделения на цепи.

Чем открыть модель. Проще всего Mol* Viewer — прямо в браузере: Open Files, затем раскраска по pLDDT. Основательнее — PyMOL или ChimeraX: там же делают наложение на экспериментальную структуру (в PyMOL align model, 7zlq) и смотрят RMSD.

Что имеет смысл посчитать в нашем проекте

Задачаразмерзачем
Один dsRBD + шпилька 13 нт≈ 80 С этого начинают: считается за минуты, ответ есть в PDB (7ZLQ).
Два соседних dsRBD + дуплекс 32 нт≈ 210 Главный вопрос проекта: садятся ли два домена на одну молекулу РНК и на каком расстоянии друг от друга.
Тот же комплекс, но с доменами гидры и кальмара≈ 210 Сравнение: одинаково ли держат РНК домены из разных организмов.
Целый N-концевой конструкт + РНК400–950 Дорого и мутно: между доменами длинные неструктурированные линкеры, модель расставит домены как придётся — и PAE это честно покажет.

Перед отправкой проверьте: в белке нет заголовка FASTA и лишних символов; РНК записана буквами ACGU; двуцепочечная РНК добавлена двумя цепями; число копий соответствует замыслу; у задания понятное имя.

  1. Сколько всего позиций займёт комплекс dsRBD1 ADAR2 человека + шпилька 13 нт? Длину домена возьмите из таблицы в шаге 1.

    Подсказка Позиции — это аминокислоты плюс нуклеотиды, сложенные вместе.
  2. Сколько заданий в сутки даёт бесплатный AlphaFold Server?

  3. У модели высокий pLDDT и на белке, и на РНК, но верно ли белок сел на РНК — по этим числам не понять. Какую оценку смотреть?

    Подсказка Нужна оценка именно интерфейса между цепями, а не качества каждой цепи по отдельности.
Готовый файл задания вместо ручного ввода

Собирает JSON в формате AlphaFold Server (dialect: alphafoldserver, version 1) — его на сайте можно импортировать вместо того, чтобы добавлять сущности руками.

Решённые структуры ADAR с нуклеиновой кислотой — с чем сравнивать
PDBгодметодчто там нуклеотидов