🤓Бартов: про работу с ИТ- и медтекстами и про всякое
Открыть в Telegram
Евгений Бартов, главред бюро переводов «Альянс ПРО» (ИТ, ИБ | медицина) Перевожу, редактирую, веду практику, пишу статьи, автоматизирую работу. В переводах с 1998 г. Для вопросов, запросов и предложений — @bartov_e
Больше2 433
Подписчики
-124 часа
-87 дней
-1830 дней
Архив постов
И да, я понимаю, что тема у меня нелегкая, но что поделать — я просто обязан с вами этим счастьем тоже поделиться :) Так что будут термины еще.
Впереди подборка терминов по неравенствам (Пинскера, Йенсена и пр.), информациям (Чернова, Фишера, взаимная), дивергенциям и прочим штукам из теории информации.
Впереди еще 600 страниц этого увлекательного чтива - копать-не-перекопать :).
Еще и авторы, как я говорил, большие шутники, у которых все вычисляется просто (см. скриншот) 🙊.
Продираясь через смыслы книги по теории информации из моей прошлой заметки, я заметил, что в этой дисциплине много разных "дистанций" (distance). Я насчитал 18 штук, пришлось отложить перевод в сторону и разложить их по полочкам у себя в голове. Поехали.
1. Pairwise distance
2. Euclidean / Squared L2
3. L1-distance (Manhattan)
4. Geodesic distance
5. Hamming distance
6. TV- distance
7. Hellinger distance
8. Bhattacharyya distance
9. KL distance
10. Wasserstein distance
11. Sinkhorn distance
12. Le Cam distance и др.
Подробности: https://dzen.ru/a/apME1jkrpzPumHLV
Repost from MedConsult Translation
Друзья,
⚡ напоминаем, что до 1 сентября стоимость курса Translator's Bootcamp составит всего 8500 р.
И сегодня хотим познакомить Вас с двумя преподавателями курса.
⭐ Мария Степанова будет рассказывать о выборе специализации, составлении резюме и портфолио, а также расскажет об особенностях медицинского и устного переводов.
Дмитрий Троицкий раскроет тему юридических аспектов переводческих услуг, познакомит с основами технического перевода и поделится хитростями поиска в Гугл и Яндекс.
🎓 Курс пройдет с 7 по 16 сентября в интенсивной формате - одна лекция каждый день (кроме воскресенья). Для тех, кто не смог присутствовать, будем высылать запись занятия. 😊
📩 Регистрация на нашем сайте https://school.medconsult.ru/bootcamp или напрямую через менеджера Софью s.vais@medconsult.ru
Следите за анонсами, будем продолжать знакомить вас с лекторами!
🎓 @medconsult_translation
Накопирайтили с коллегой-переводчицей статью про ИИ, сегодня ушла в хабр - https://habr.com/ru/articles/1073416/ , набирает просмотры.
Для меня этот проект оказался интересен тем, что тема поначалу казалась мертвой, а у коллеги опыта копирайтинга не было. Но и у меня выбора не было - я статьей заниматься плотно не мог, т.к. был завален кучей других задач.
Так я нечаянно стал наставником по копирайтингу. Мы долго крутили и так и сяк материал клиента, ничего из него не вырисовывалось такого, то можно было бы показать читателям хабра. Поэтому логичным шагом было продолжение опроса клиента. В итоге после очередной пачки вопросов, мы вдруг нащупали, что из этого что-то может получиться - и как мне кажется, получилось.
Тема хоть и не про переводы, но тоже актуальна - заменят ли чатботы нам кнопочки в программах? Сейчас ведь во многих направлениях работа с ПО складывается так, что поговоришь с чатботом, он тебе нужные ответы выдаст, и ты даже кнопки не нажимаешь. Куда нас это приведет? Вот об этом и статья.
Я также попросил коллегу, Светлану, поделиться своими впечатлениями о своем первом опыте копирайтинга. Цитирую:
Мои первые шаги в копирайтинге показали, в какую сторону предстоит прогрызать гранит копирайтинга. Итак, где я споткнулась. 1. Отсутствие оригинала. Свобода творчества вызывает легкий ступор. 2. Даже самое понятное ТЗ имеет «дыры», например, вопросы вызывает даже длина текста. 3. Итерации, которые не обязательно похожи на редактуру. Эту проблему частично помогают решить четко сформулированные этапы работы. 4. Выбор «чужого» стиля, который может быть неочевиден. Хорошая новость в том, работа становится намного понятнее под руководством наставника, который помогает определить этапы работы и корректирует направление.
Если вдруг вас тоже зацепила теория информации (ну мало ли, вдруг вы такие же задроты, как и я), то вот вам еще пища для размышлений.
В 1997 году двое российских ученых, специалисты по теории информации изучали, как передают информацию муравьи. Оказалось, что муравьи, как минимум, неплохо умеют считать.
Вот цитата из работы этих ученых:
... результаты говорят о том, что разведчик передает фуражирам информацию о номере ветки. Мы доказали это, используя обычные, принятые в статистике методы, а также проводя специальные контрольные опыты. При этом оказалось, что зависимость времени t (в секундах) передачи информации о местонахождении пищи от номера ветки j представляет собой (с достаточно хорошей точностью) прямую пропорциональность... Получалось, что время «произнесения» муравьями числа 20 примерно в 2 раза дольше, чем числа 10, и в 10 раз дольше, чем числа 2...Для интересующися прилагаю само исследование.
Недавно мой словарный запас пополнился новым переводом слова operational.
Поскольку книга по программам-вымогателям закончилась, я переключился на другую книгу: про теорию информации.
Тема сложная, но интересная.
Чтобы примерно понять, что меня в ней заинтересовало, приведу пару примеров.
1.
Меня давно интересует тема упаковки смыслов в минимально возможное число слов - иными словами, меня интересует лаконичность в языке. Причем не только прикладная, типа как в русском передать тот или иной смысл, а в принципе, как передать компактно тот или иной смысл.
Почему, например, один и тот же промпт на русском и на английском различается по токенам в 3 раза? Получается у русского языка смысловая емкость в 3 раза ниже? Скорее всего нет, полагаю, тут вопрос в зрелости энкодеров и декодеров, но тем не менее.
Можно взять и более приземленный пример — почему один и тот же смысл в китайском укладывается в 350 знаков (иероглифов), в английском/русском в 1800 знаков с пробелами? Китайский получается лучше сжимает информацию? Хотя, я понимаю, там издержки другого плана - на кодирование одного иероглифа уходит больше бит, чем на кодирование одного знака в алфавитных языках.
Продолжение на https://dzen.ru/a/aosbFpDlW2RvJf0x
На хабре опубликовали статью: https://habr.com/ru/news/1073382/
Для ИТ-переводчиков это означает, что появился официальный источник терминологии по этому языку программирования. Раньше мы собирали эти термины по разным сусекам.
В книге про программы-вымогатели, перевод которой уже близится к концу, я был вынужден прибегнуть к одному приему, который многим коллегам-переводчикам может показаться спорным.
И тем не менее, учитывая склонность автора к постоянным повторам одних и тех же мыслей (типичная черта американских авторов), мне приходится то там, то сям как-то урезать эту «болтовню».
https://dzen.ru/a/ang0JXWaKXQ5SNby
В теории перевода есть такой критерий качества перевода/локализации — перевод должен вызывать те же эмоции, ощущения и образы у читателя, что и оригинал. Так получилось, что в некоторых ситуациях эту рекомендацию можно считать вредной. Поясню.
https://dzen.ru/a/andRVVEk-R0SiwzT
Всем привет.
Пара апдейтов по работе.
1. В МАХе сделал канал публичным (ссылка https://max.ru/channel_bartov), там включил комментарии.
2. К активному постингу скорее всего вернусь ближе к учебному году (т.е. середина осени), пока разгребаю завалы по работе (перевожу книжки по ИТ).
3. По переводам вышел на крейсерскую скорость даже сложных ИТ-текстов под ключ ок. 1-2 тыс. слов в час (удалось автоматизировать некоторые процессы, о которых я ранее рассказывал), поэтому преподавание я свернул, только консультирую по разным вопросам.
Разбор ИТ-перевода: «обнаружение» или «система обнаружения» + локализация бренда
== 1. 📋 ДАНО ==
На редактуру попал фрагмент текста по кибербезопасности.
* Исходный текст:
Detection is like having a car alarm that goes off once they’re inside the car... (e.g. LoJack).
* Вариант переводчика: «Обнаружение похоже на автомобильную сигнализацию... (например, система LoJack)».
== 2. 🔍 ЧТО НЕ ТАК ==
Смущает два момента.
1. Обнаружение - это процесс. Сигнализация — предмет. Как их корректно сравнить?
2. Что такое LoJack?
Разберемся.
== 3. 🧠 ХОД РАССУЖДЕНИЙ ==
1. В английском под Detection is like... подразумевается не процесс, а система, что подтверждается дальнейшим контекстом, там используются фразы detection system и detection tools. Соответственно, автор сравнивает не процесс, а инструмент — «система обнаружения».
2. Далее, русскоязычному читателю скорее всего будет непонятен термин LoJack. При изучении выяснилось, что это коммерческое название американской системы возврата угнанных автомобилей, работающей на основе радиочастотного слежения (https://m.media-amazon.com/images/I/71wfFQN5jLL.jpg). Их бренд практически неизвестен в России. Для локализации рекомендовал переводчику дать описательный перевод, например, «спутниковая система слежения».
== 4. ✅ ПРАВКА ==
* Вариант переводчика:
Обнаружение похоже на автомобильную сигнализацию, которая срабатывает уже после проникновения злоумышленника в автомобиль, отправляет оповещение владельцу и помогает отслеживать машину даже после угона (например, система LoJack).
* Вариант редактора:
Система обнаружения чем-то схожа с автомобильной сигнализацией, которая срабатывает при взломе, шлет оповещение и помогает отследить угнанную машину (например, через спутниковую систему слежения).С 1-го июля повышаю тариф на услуги обучения до 1750 за час /12500 за 10 часов.
Если кому надо зафиксировать нынешний тариф 1500 и 10000 руб. соответственно, пожалуйста, дайте о себе знать до 1-го июля.
Спасибо.
Разбор ИБ-перевода: размытый смысл указательного местоимения
== 1. 📋 ДАНО ==
На редактуру попал фрагмент перевода по теме кибербезопасности, описывающий атаку с перезаписью Trace‑Handle. Исходный текст:
«It requires the operator to have an arbitrary read‑write primitive in a vulnerable driver, such as those present in previous versions of Gigabyte’s atillk64.sys and LG Device Manager’s lha.sys…»
Вариант переводчика:
«Для ее применения оператор использует уязвимости драйвера, дающие возможность чтения и записи в памяти по произвольным адресам, как это было с предыдущими версиями Gigabyte atillk64.sys и lha.sys от LG Device Manager…»
== 2. 🔍 ЧТО НЕ ТАК ==
Я обратил внимание, что русский вариант «как это было с предыдущими версиями» не устраняет размытость, созданную через конструкцию such as those:
Грамматически such as those может быть прицеплено к:
- primitive → «такие примитивы, какие были в…»,
- vulnerable driver → «такие уязвимые драйверы, какие были в…»,
- отдалённо к vulnerability (хотя в тексте нет слова vulnerability отдельно).
Так к чему же оно относится? Разберемся.
== 3. 🧠 ХОД РАССУЖДЕНИЙ ==
1. Представим себе ИТ-инфраструктуру как охраняемый объект. Внутрь пускают только машины с пропусками (для ИТ-инфраструктуры это драйверы).
2. На объекте есть главный охранник (антивирус/EDR). Чтобы видеть всё, он использует тайного информатора EtwTi, который сидит глубоко в подвале (в ядре системы) и непрерывно шлёт отчёты: «процесс 5 читает чужую память», «процесс 12 запускает подозрительный код». Без этих отчётов охранник слепнет.
3. Злоумышленник хочет ограбить объект, но знает, что EtwTi сразу его сдаст. Удалить или убить информатора нельзя — он часть системы. Поэтому хакер готовит атаку «только на данные» (Data‑Only Attack): он не трогает код EtwTi, а тихо переписывает одну его настройку в памяти.
4. ХОД АТАКИ:
- Шаг 1 атаки — найти «своего» легального драйвера (BYOVD). Злоумышленник берёт старую версию официально подписанного драйвера, в котором производитель случайно оставил уязвимость. Примеры таких машин с пропусками, но с трещиной в броне: atillk64.sys от Gigabyte и lha.sys от LG Device Manager. Антивирус им изначально доверяет.
- Шаг 2 — получить «супер‑возможность» (примитив произвольного чтения/записи). Через уязвимость в этом драйвере хакер обретает возможность читать и писать данные по любому адресу в памяти ядра. Технически это называют примитивом произвольного чтения и записи (arbitrary read‑write primitive). Это не сам драйвер, не его уязвимость, а именно способность, которую уязвимость даёт. Ситуацию можно сравнить с тем, что хакер получил прибор, способный открыть любой сейф в здании и переписать любую бумагу.
- Шаг 3 — испортить отчёты. Обладая этой способностью, хакер находит в памяти ядра «блокнот» с настройками EtwTi. Там есть строка: Отправлять отчёты = ДА (1). Своим прибором он меняет одну цифру на НЕТ (0).
5. По итогу EtwTi продолжает работать, видит ограбление, но из‑за изменённой настройки просто молчит. Главный охранник считает, что всё тихо, а хакер делает что хочет.
== 4. ✅ ПРАВКА ==
🤫
* Вариант переводчика:
...использует уязвимости драйвера, дающие возможность чтения и записи в памяти по произвольным адресам, как это было с предыдущими версиями...* Вариант редактора:
...использует уязвимости драйвера, дающие возможности чтения и записи в памяти по произвольным адресам, подобные тем, что были в предыдущих версиях...
Разбор ИБ-перевода: «кража данных» или «эксфильтрация данных»
== 1. 📋 ДАНО ==
На редактуру попал фрагмент текста по информационной безопасности.
Оригинал:
Precisely because many organizations developed stronger backup and DR systems, ransomware attacks evolved, with one of the most significant trends being the incorporation of data exfiltration for use as leverage in extorting the victims to pay the ransom.Перевод:
Поскольку организации улучшили системы резервного копирования и аварийного восстановления, вымогательские атаки тоже эволюционировали. Одним из главных трендов стала кража данных, используемая как рычаг давления для принуждения к уплате выкупа.== 2. 🔍 ЧТО НЕ ТАК == Переводчик написал exfiltration = кража. Действительно ли термины "эксфильтрация" и "кража" взаимозаменяемы? Нет, объясняю почему. == 3. 🧠 ХОД РАССУЖДЕНИЙ == 1. «Кража» — это бытовой и юридический термин. Он описывает сам факт, что у злоумышленника неправомерно появилась копия чужих данных. Оригинал при этом может оставаться на месте. 2.
Data exfiltration («эксфильтрация данных») — это технический термин, характеризующий процесс кражи. Специфика этого процесса: несанкционированный (это само собой), но ключевой момент — это скрытный *вывод* данных за пределы защищенного сетевого периметра.
3. Это значит, что злоумышленники не просто копируют информацию. Чтобы обойти системы обнаружения утечки данных, они используют специальные методы: сжимают и шифруют архивы, передают данные очень медленно и мелкими частями (data throttling), часто маскируют их под легитимный трафик (например, под трафик запросов к DNS-серверам).
4. Из этого следует, что «эксфильтрация» — не синоним «кражи». В оригинале этот термин используется намеренно, чтобы подчеркнуть техническую сложность процесса вывода данных. В современных атаках с двойным вымогательством (double extortion - выкуп требуют и за сохранение конфиденциальности данных, и за их расшифровку) это ключевой этап, а не просто копирование файлов.
== 4. ✅ ПРАВКА ==
Вариант переводчика:
Одним из главных трендов стала кража данных, используемая как рычаг давления для принуждения к уплате выкупа.Вариант редактора:
Одним из главных трендов стала эксфильтрация данных, используемая как рычаг давления для принуждения к уплате выкупа.
По работе немножко завал, поэтому пардоньте, на большие статьи времени нету. Ограничусь пока короткими заметками (как раньше на карточках), благо материала такого хватает.
Разбор ИТ-перевода: «определение списка» или «литерал списка»
== 1. 📋 ДАНО ==
На редактуру попал фрагмент текста о программировании в Python.
Исходный текст:
«Хранимые в списке данные определяются как разделенные запятыми значения, заключенные в квадратные скобки. Списки можно определять используя любое имя переменной, а затем присваивая ей различные значения в квадратных скобках».
Вариант переводчика:
«The data stored in a list is defined as comma-separated values enclosed in square brackets. Lists can be defined by using any variable name and then assigning various values in square brackets».
== 2. 🔍 ЧТО НЕ ТАК ==
Основная проблема: исходный текст содержит техническую неточность, и переводчик её продублировал.
Оригинальные и переведенные формулировки смешивают два разных понятия: структуру данных в памяти компьютера (list) и её текстовое представление в коде (list literal). Также неверно описан процесс связывания списка с переменной. Поясняю подробнее.
== 3. 🧠 ХОД РАССУЖДЕНИЙ ==
1. В программировании необходимо различать объект (структуру данных
list) и его синтаксическое представление в исходном коде, которое называется «литерал» (list literal).
2. Утверждение, что список «определяется как значения в скобках», не всегда верно. Список можно создать и другими способами, например, динамически из файла или с помощью функции list(range(10)). В этих случаях в коде нет литерала [...].
3. В памяти компьютера объект-список не содержит ни скобок, ни запятых. Это элементы синтаксиса языка, а не самой структуры данных.
4. Утверждение, что списки «определяются именем переменной», также неточно. Происходит два отдельных действия: сначала создается объект-список, затем ссылка на него присваивается переменной. Переменная лишь именует объект, а не определяет его.
5. Следовательно, корректно говорить о «литерале списка», который *записывается* определенным образом, и о *создании* списка с *присваиванием* его переменной.
== 4. ✅ ПРАВКА ==
Вариант переводчика:
The data stored in a list is defined as comma-separated values enclosed in square brackets. Lists can be defined by using any variable name and then assigning various values in square brackets.
Вариант редактора:
A list literal is written as a comma-separated sequence of items enclosed in square brackets. You create a list by assigning a list literal to a variable.Наконец-то дошли руки до того, чтобы сделать страничку с описанием услуги по наставничеству/подготовке ИТ-переводчиков для издательства «Питер».
Если вдруг кто-то присматривался к этой услуге, велком. До конца октября я групповые курсы не планирую, так что если хотели посвятить лето изучению ИТ-переводов, чтобы уже по осени заключить контракт с издательством, можете обратить внимание и на эту возможность.
Отмечу, что конкретно по этой книге есть возможность зайти на сокращенную программу (т.е. без подготовки набора/форматирования и глоссария) — у меня на руках уже есть готовый текст и готовый глоссарий. Можно просто будет сразу приступить к переводу.
Также отмечу, что в рамках этого курса можно будет пройти и сокращенный курс автоматизации работы переводчика (тот самый конвейер, по которому я читал отдельный курс).
В общем, заглядывайте на страничку, я там вроде бы все подробно расписал (если что-то упустил важное, пишите в личку, контакты на странице есть).
https://tran.su/service/it-translation-tutor/
Первое, за что зацепился глаз — студент перевел image как «копия». В контексте ИТ это грубая ошибка — между этими понятиями пропасть.
Простое копирование — это операция на уровне файловой системы. Когда вы копируете папку с файлами с одного диска на другой, операционная система считывает содержимое файлов и записывает их на новое место. При этом их физическое расположение на новом диске, скорее всего, будет совершенно другим. Если вы так скопируете системный диск на новый носитель, а потом попытаетесь с него загрузиться — ничего не выйдет. Программы не запустятся, потому что нарушена вся структура, которую они ожидают.
Создание образа (imaging) — это совсем другой процесс...
Продолжение на https://dzen.ru/a/ag4Pt88SkjJ04Gin
(Мы в МАХ)
Про трактовку термина boolean
... добравшись до главы 10.4 Not using proper BOOLEANs я вдруг осознал, что я явно недооценивал глубину понятия «булевых» значений. Большинству этот тип данных известен по известным логическим значениям "ИСТИНА" и "ЛОЖЬ". Но с этим термином всё гораздо сложнее и многообразнее.
Продолжение https://dzen.ru/a/afhzofrI7SJ8j_PL
(Мы в МАХ)
Однажды переводчик мне сдал перевод презентации в билингве SDL Trados (*.sdlxliff). Обычная презентация, русско-английский перевод, тема — ИТ-маркетинг, заказчик торопит.
Моя задача — проверить перевод презентации и подготовить ее «под ключ». Выгрузил я ее из билингвального файла. И тут, на этапе сверки, обнаружил деталь. В исходнике в заголовках и в конце пунктов маркированного списка никаких точек не было. А у переводчика они были везде, в конце каждого предложения (дурная привычка, у меня такая же).
Продолжение на https://dzen.ru/a/afMm9zXdaEJBobKt
(Мы в МАХ)
