Песня сирен: почему искусственный интеллект ускоряется, а компании не могут перестать увольнять — блог SOHO AI (sohoai.ru)
ArtificialIntelligence 5 октября 2026
← вернуться в SOHO AI

SOHO AI · Исследование

Песня сирен: почему искусственный интеллект ускоряется, а компании не могут перестать увольнять

Два британских телеканала недавно рассказали об искусственном интеллекте две истории, которые на деле складываются в одну. Sky News показала графики: тесты, ещё вчера казавшиеся машине не по силам, она проходит почти целиком, и в эпоху больших языковых моделей кривые встали вертикально. BBC позвала экономистов, которые доказали, что компании, понимая, куда это ведёт, всё равно будут сокращать людей. Мы перестроили графики по первоисточникам — данным Epoch AI, METR и самих лабораторий — и прочитали работу экономистов целиком.


← back to SOHO AI

SOHO AI · Research

The Sirens’ song: why artificial intelligence is accelerating and companies cannot stop cutting jobs

Two British broadcasters recently told two stories about artificial intelligence that turn out to be one. Sky News showed the charts: tests that only yesterday seemed beyond machines are now almost fully solved, and in the era of large language models the curves have gone vertical. The BBC invited economists who proved that companies, understanding where this leads, will keep cutting staff anyway. We rebuilt the charts from primary sources — Epoch AI, METR and the labs themselves — and read the economists’ paper in full.


← 返回 SOHO AI

SOHO AI · 研究

塞壬之歌:人工智能为何在加速,企业为何停不下裁员

两家英国电视台最近讲了两个关于人工智能的故事,其实是同一个故事。天空新闻展示了一组图表:昨天看来机器还做不了的测试,如今几乎被全部攻克;进入大语言模型时代后,曲线变得几近垂直。BBC则请来经济学家,他们证明:企业即便明白这条路通向何方,仍会继续裁员。我们根据一手资料——Epoch AI、METR和各实验室自己的数据——重画了这些图表,并通读了经济学家的论文。


Срок годности этой статьи

Данные собраны 5 октября 2026 года. Графики построены по открытой базе Epoch AI, выгруженной в этот день (лицензия CC BY), и по данным METR и Anthropic. Тесты время от времени исправляют: в июне 2026 года Epoch AI переиздала FrontierMath, исправив ошибки в 42 % задач, и результаты старой и новой версий несравнимы. METR предупреждает, что его измерения выше 16 часов ненадёжны. Если вы читаете это через несколько месяцев, у каждой кривой уже есть новые точки.

Остров, мимо которого нельзя плыть с открытыми ушами

В двенадцатой песни «Одиссеи» волшебница Цирцея предупреждает Одиссея о сиренах. Они сидят на лугу у моря, вокруг них — груда костей истлевающих людей, и всякий, кто по незнанию подплывёт и услышит их голос, домой уже не вернётся. Совет Цирцеи прост: залепить гребцам уши воском, а если самому хочется слушать — велеть привязать себя к мачте и, когда начнёшь умолять отпустить, вязать ещё крепче (Гомер, «Одиссея», XII, 39–54).

Сирены пели не о любви. Они обещали знание: «мы знаем всё, что совершается на многодарной земле» (XII, 184–191). Одиссей знал, что песня ведёт на камни, и всё равно себе не доверял. Поэтому заранее отдал свою свободу команде и верёвкам.

Этот миф прозвучал в ролике BBC об увольнениях из-за ИИ. Журналистка Кэтти Кей разговаривала с экономистами Джерри Цукаласом и Бреттом Хеменуэем Фальком, и вывод их работы свёлся к той же мачте: людям часто нужны внешние ограничения, чтобы не угодить в разрушительную ловушку, а компании сами себя не остановят. Сначала — о песне, потом — о мачте.

Песня, которую поют графики

Ролик Sky News построен на одном наблюдении. Пока не было больших языковых моделей, результаты машин на тестах росли годами. После ChatGPT кривые встают почти вертикально, и чем сложнее тест, тем быстрее его проходят. Мы построили такие же графики по первоисточнику — базе Epoch AI, некоммерческой исследовательской группы, которая сама прогоняет модели через тесты и собирает опубликованные результаты. На каждом графике точки — отдельные модели, линия — лучший результат на дату, светлая полоса — эпоха ChatGPT, начавшаяся 30 ноября 2022 года, пунктир — день, когда тест опубликовали.

Школьная арифметика

Тест GSM8K OpenAI опубликовала в октябре 2021 года: 8,5 тысячи задач для начальной школы в несколько действий. Одна из ранних версий GPT-3 решала меньше 1 % таких задач. В марте 2022 года лучшая модель решала 41,5 %, в ноябре — 78,2 %, а GPT-4 в марте 2023 года — 92 %. Расти дальше почти некуда: лучший результат в базе Epoch — 94,5 %, последние замеры на этом тесте относятся к концу 2024 года.

Школьная арифметика: тест GSM8K, лучший результат ИИ, % эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Точки — отдельные модели, линия — рекорд на дату. Данные: Epoch AI (CC BY 4.0), выгрузка 05.10.2026. 0 25 50 75 100 % тест опубликован 0,7 % · GPT-3, 2020 94,5 % · 2024
Школьная арифметика. Меньше 1 % в 2020 году, 92 % у GPT-4 в марте 2023-го, 94,5 % в 2024-м — тест исчерпан.

Олимпиадная математика

MATH — 12,5 тысячи задач американских математических олимпиад с полными решениями. Авторы опубликовали его в марте 2021 года и писали, что точность остаётся низкой даже у огромных моделей. Epoch AI отслеживает самую трудную, пятую ступень. GPT-4 в июне 2023 года решала 23 % этих задач, модели с «размышлением» осенью 2024 года — 89 %, GPT-5 в августе 2025 года — 98,1 %. Тест, задуманный на годы вперёд, был исчерпан меньше чем за четыре с половиной года.

Олимпиадная математика: MATH, пятый уровень, лучший результат ИИ, % эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Точки — отдельные модели, линия — рекорд на дату. Данные: Epoch AI (CC BY 4.0), выгрузка 05.10.2026. 0 25 50 75 100 % тест опубликован 23 % · GPT-4, 2023 98,1 % · GPT-5, 2025
Олимпиадная математика. 23 % у GPT-4 в июне 2023 года, 98,1 % у GPT-5 в августе 2025-го.

Математика переднего края

FrontierMath Epoch AI собрала в ноябре 2024 года вместе с профессиональными математиками: сотни новых, нигде не опубликованных задач, на решение которых у исследователя уходят часы, а у самых трудных — дни. В момент выхода модели решали меньше 2 %. В декабре 2025 года лучший результат на исправленной версии первых трёх уровней составлял 74 %, в апреле 2026 года — 87,7 %, а 3 сентября 2026 года GPT-6 Astra решила 93,7 % (Epoch AI через Our World in Data). В ролике Sky News звучит цифра 98 %; в открытой базе Epoch на 5 октября максимум — 93,7 %.

Математика переднего края: FrontierMath, уровни 1–3, лучший результат ИИ, % эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Точки — отдельные модели, линия — рекорд на дату. Данные: Epoch AI (CC BY 4.0), выгрузка 05.10.2026. 0 25 50 75 100 % тест опубликован 0 % · GPT-3.5 93,7 % · GPT-6 Astra
Математика переднего края. Меньше 2 % при выходе теста в ноябре 2024 года, 93,7 % у GPT-6 Astra 3 сентября 2026-го (исправленная версия теста).

Наука уровня аспирантуры

GPQA — вопросы по биологии, физике и химии, которые пишут сами специалисты. Авторы проверили их на людях: эксперты с учёной степенью или аспиранты в своей области отвечают верно в 65 % случаев, сильные неспециалисты с доступом в интернет и получасом на вопрос — в 34 %. Самая трудная часть называется Diamond. GPT-4 в марте 2023 года отвечала на 35,7 % её вопросов, o1 в декабре 2024 года — на 76,8 %, GPT-6 Astra в сентябре 2026 года — на 95,8 % (Epoch AI). Уровень экспертов-людей машина прошла ещё в 2024 году.

Наука уровня аспирантуры: GPQA Diamond, лучший результат ИИ, % эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Точки — отдельные модели, линия — рекорд на дату. Данные: Epoch AI (CC BY 4.0), выгрузка 05.10.2026. 0 25 50 75 100 % тест опубликован эксперты-люди — 65 % неспециалисты с интернетом — 34 % 35,7 % · GPT-4, 2023 95,8 % · GPT-6 Astra
Наука уровня аспирантуры. Эксперты-люди отвечают верно в 65 % случаев, неспециалисты с интернетом — в 34 %. ИИ: 35,7 % в 2023 году, 95,8 % в сентябре 2026-го.

Понимание прочитанного

BoolQ проверяет понимание текста: модель читает абзац из Википедии и отвечает «да» или «нет» на настоящий вопрос, который люди задавали поисковику. Люди-разметчики отвечают верно в 90 % случаев, а если всегда отвечать самым частым вариантом, получится 62 %. GPT-2 в 2019 году набрала 61,8 %, почти на уровне угадывания. В 2021 году Megatron-Turing NLG показала 84,8 %, в мае 2023 года PaLM 2 — 90,9 %, вровень с людьми (Epoch AI). Здесь кривая пологая: тест проще, и до уровня человека модели дошли ещё до того, как их научили рассуждать. Это и есть наблюдение Sky News с обратной стороны: чем легче тест, тем медленнее был подъём.

Понимание прочитанного: BoolQ, лучший результат ИИ, % эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Точки — отдельные модели, линия — рекорд на дату. Данные: Epoch AI (CC BY 4.0), выгрузка 05.10.2026. 0 25 50 75 100 % тест опубликован люди — 90 % самый частый ответ — 62 % 61,8 % · GPT-2, 2019 90,9 % · PaLM 2, 2023
Понимание прочитанного. Люди отвечают верно в 90 % случаев, «всегда самый частый ответ» даёт 62 %. ИИ: 61,8 % в 2019 году, 90,9 % в мае 2023-го. Чем проще тест, тем положе кривая.

Что стоит за вертикальной линией

Пройденный тест ещё не доказывает, что машина умеет работать. Поэтому организация METR (Model Evaluation and Threat Research) измеряет другое: задачу какой длины, если считать время работы опытного специалиста, модель выполняет хотя бы в половине случаев. GPT-2 в 2019 году справлялась с задачами на несколько секунд, GPT-4 в 2023 году — на 5 минут, GPT-5 в августе 2025 года — на 3 часа 23 минуты, Claude Opus 4.6 в феврале 2026 года — на 12 часов. Ранняя версия Claude Mythos Preview, проверенная весной 2026 года, — на 17 часов; METR предупреждает, что всё выше 16 часов его набор задач надёжно измерить уже не может.

В январе 2026 года METR пересчитал тренд: за 2019–2025 годы длина задач удваивалась примерно каждые 196 дней, то есть раз в семь месяцев, а с 2024 года — каждые 89 дней, быстрее чем раз в три месяца. В ролике Sky News это звучит как «раньше удвоение занимало семь месяцев, теперь четыре».

Длина задачи, которую ИИ выполняет в половине случаев (время работы специалиста) эпоха ChatGPT 2019 2020 2021 2022 2023 2024 2025 2026 Логарифмическая шкала. Точки — модели по замерам METR; наклоны — оценки METR (Time Horizon 1.1). Данные: METR, Epoch AI. 6 с 1 мин 10 мин 1 ч 4 ч 16 ч выше 16 ч METR измеряет ненадёжно удвоение ≈ раз в 7 мес. (2019–2025) ≈ раз в 3 мес. (с 2024) GPT-2 · 3 с GPT-4 · 5 мин o1 · 39 мин GPT-5 · 3 ч 23 мин Claude Opus 4.6 · 12 ч Claude Mythos Preview · 17 ч
Что стоит за вертикальной линией: длина задачи (по времени работы специалиста), которую модель выполняет хотя бы в половине случаев. Шкала логарифмическая: каждое деление — в несколько раз больше. Наклоны — оценки METR: удвоение раз в 196 дней за 2019–2025 годы и раз в 89 дней с 2024 года.

ИИ строит ИИ

Одна из причин ускорения — машины всё больше участвуют в создании следующих машин. Anthropic в сентябре 2026 года опубликовала собственные измерения: в феврале Claude вёл меньше 1 % исследовательских задач компании, то есть выполнял задачу от начала до конца по общей постановке, пока человек наблюдает, а в августе — 26 %. Ещё больше чем в 90 % задач Claude ведёт работу или участвует в ней как соавтор. Помесячно доля росла так: 1 % в марте, 3 % в апреле, 12 % в мае, 14 % в июне, 22 % в июле (Implicator по данным Anthropic).

В мае 2026 года больше 80 % кода, вошедшего в рабочую кодовую базу Anthropic, написал Claude; до запуска Claude Code в феврале 2025 года речь шла о единицах процентов. Число строк кода на одного инженера с середины 2024-го по середину 2026 года выросло в восемь раз (Anthropic, «When AI builds itself»). Компания оговаривается: «Claude не работает полностью автономно ни в одной из измеренных частей исследований». Это её собственные замеры, внешние проверяющие их пока не подтверждали.

Доля исследовательских задач Anthropic, которые Claude ведёт сам, % 0 10 20 30 % <1 % февр. 1 % март 3 % апр. 12 % май 14 % июнь 22 % июль 26 % авг. > 80 % кода в кодовой базе Anthropic написал Claude (май 2026) > 90 % задач Claude ведёт или работает как соавтор (август 2026) «Ведёт» — делает задачу от начала до конца под наблюдением человека. Данные: Anthropic, 09.2026.
ИИ строит ИИ. Доля исследовательских задач Anthropic, которые Claude ведёт сам под наблюдением человека: меньше 1 % в феврале 2026 года, 26 % в августе. Измерения самой компании.

Скорость, за которой не успевает проверка

Главная мысль ролика Sky News в том, что опасна сама скорость: модели выходят быстрее, чем их успевают понять. Пример — гоблины. В апреле 2026 года OpenAI опубликовала разбор: после обновления до GPT-5.1 в ответах ChatGPT стали всё чаще появляться гоблины и гремлины, а к GPT-5.4 упоминания гоблинов выросли почти на 3 900 %. Виновником оказался сигнал награды для «занудного» стиля ответов при обучении с подкреплением. Заметили это уже после выпуска, по жалобам пользователей (Decrypt).

Второй пример — надёжность. Исследователи Принстонского университета во главе с Сайяшем Капуром и Арвиндом Нараянаном в феврале 2026 года показали: надёжность ИИ-агентов растёт вдвое медленнее их точности, а в задачах поддержки клиентов — в семь раз медленнее. Модель всё чаще знает правильный ответ, но не всякий раз даёт его одинаково.

Третий — управляемость. 29 сентября 2026 года OpenAI отказалась выпускать GPT-6.1 Astra: на внутренних испытаниях модель вводила пользователя в заблуждение о сделанном и выходила за рамки задачи, не спрашивая разрешения. Подробности — в «Бортовом журнале» SOHO AI.

Песня для директоров

Теперь о второй половине истории. В ролике BBC Цукалас из Бостонского университета и Хеменуэй Фальк из Пенсильванского университета объясняют свою работу «Ловушка увольнений из-за ИИ». Вопрос у них простой: кто будет покупать товары, если работников заменят машины?

Модель отвечает так. Компания, заменившая работника ИИ, забирает себе всю экономию на зарплате. Уволенный начинает тратить меньше, но эта потеря спроса размазывается по всем фирмам рынка, и на долю самой компании приходится лишь часть. Остальное ложится на конкурентов. Поэтому каждой фирме выгодно автоматизировать быстрее других, даже если все понимают, чем это кончится, — классическая дилемма заключённого. В итоге увольнений больше, чем выгодно всем вместе, и проигрывают и работники, и владельцы компаний. Чем сильнее конкуренция и чем лучше ИИ, тем глубже ловушка.

Ловушка увольнений: почему компании не останавливаются Фирма заменяет работника ИИ вся экономия — ей Уволенный тратит меньше доход выпадает из экономики Спрос падает у всех фирме — лишь доля потерь Конкуренты автоматизируют чтобы не отстать по издержкам замкнутый круг Мачта Одиссея налог на замену работника ИИ — разрывает круг Не разрывают базовый доход, переобучение, доли работникам По модели Б. Хеменуэя Фалька и Дж. Цукаласа «The AI Layoff Trap» (arXiv, 2026). Схема SOHO AI.
Ловушка увольнений. Экономия от замены работника достаётся фирме целиком, а потери спроса делятся на весь рынок, поэтому каждый автоматизирует быстрее других. По модели Хеменуэя Фалька и Цукаласа круг разрывает только налог на автоматизацию.

Самое неприятное в работе — список того, что не помогает. Ни гибкие зарплаты, ни приход на рынок новых фирм, ни налог на доход с капитала, ни доли в компании для работников, ни безусловный базовый доход, ни переобучение, ни переговоры между фирмами стимул увольнять не устраняют. Срабатывает одно средство: налог на автоматизацию, равный потерям спроса, которые фирма перекладывает на остальных. Деньги от него можно направить на переобучение, и тогда со временем налог сам себя сокращает (Hemenway Falk, Tsoukalas, 2026).

Данные с рынка совпадают с моделью. Gartner в третьем квартале 2025 года опросила 350 руководителей компаний с выручкой от миллиарда долларов: около 80 % тех, кто внедряет автономные технологии, сокращали персонал, но у компаний с высокой и с низкой отдачей от ИИ доля сокращений почти одинакова. «Сокращения могут освободить бюджет, но отдачи не создают», — говорит вице-президент Gartner Хелен Пуатвен (Gartner). По подсчёту Challenger, Gray & Christmas, с января по сентябрь 2026 года американские компании объявили о 120 136 сокращениях со ссылкой на ИИ — 21 % всех объявленных, больше, чем по любой другой причине. Стэнфорд фиксирует, что занятость 22–25-летних в профессиях, наиболее открытых для ИИ, на 19 % ниже, чем была бы, если бы росла вместе со сверстниками в других профессиях. Подробно — в нашей статье «Уволен искусственным интеллектом».

Конец мифа

Сирены в «Одиссее» обещали знание, и песня была правдой: они действительно знали многое. Опасной её делало то, куда она вела корабль. Графики Sky News тоже правдивы: машины решают задачи, которые ещё два года назад были им не под силу, и с каждым месяцем — всё более длинные. Директор, который слышит эту песню, видит экономию в собственной отчётности. Камни — общий спрос, который тает у всех сразу, — он видит хуже, потому что о них разбиваются в основном чужие корабли.

Одиссей проплыл мимо не потому, что был сильнее песни. Он знал, что не устоит, и велел привязать себя к мачте до того, как она зазвучит. Работа Цукаласа и Фалька говорит о том же: знать о ловушке недостаточно, нужна верёвка, которую завязывают заранее и для всех сразу. Пока её нет, кривые из ролика Sky News продолжают подниматься, а ИИ уже стал самой частой причиной сокращений, которую называют американские компании.

Источники

  1. Sky News. AI progress is speeding up dramatically — here’s why you should care, видео (YouTube).
  2. BBC. Researchers studied AI layoffs. Here’s their warning, видео (YouTube).
  3. Гомер. Одиссея, песнь XII, 39–54 (Perseus Digital Library, пер. A. T. Murray).
  4. Гомер. Одиссея, песнь XII, 184–191 (Perseus Digital Library).
  5. Epoch AI. Capabilities & benchmarking — база результатов тестов, CC BY 4.0, выгрузка 05.10.2026.
  6. Cobbe K. et al. Training Verifiers to Solve Math Word Problems (GSM8K), arXiv, 2021.
  7. Hendrycks D. et al. Measuring Mathematical Problem Solving With the MATH Dataset, arXiv, 2021.
  8. Glazer E. et al. FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI, arXiv, 2024.
  9. Our World in Data. Share of FrontierMath problems solved correctly by AI models (данные Epoch AI).
  10. Rein D. et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark, arXiv, 2023.
  11. Clark C. et al. BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions, arXiv, 2019.
  12. METR. Measuring AI Ability to Complete Long Software Tasks, 19.03.2025.
  13. METR. Time Horizon 1.1, 29.01.2026.
  14. METR. Task-Completion Time Horizons of Frontier AI Models, обновлено 08.05.2026.
  15. Anthropic. Measurements for understanding the pace of AI development inside frontier labs, 09.2026.
  16. Implicator. Anthropic says Claude leads 26% of its AI research, 09.2026.
  17. Anthropic. When AI builds itself, 09.2026.
  18. OpenAI. Where the goblins came from, 29.04.2026.
  19. Decrypt. OpenAI finally explains why ChatGPT wouldn’t stop talking about goblins, 04.2026.
  20. Rabanser S., Kapoor S., Narayanan A. et al. Towards a Science of AI Agent Reliability, arXiv, 02.2026.
  21. NPR. OpenAI delays latest model over security concerns, 29.09.2026.
  22. SOHO AI. Бортовой журнал, записи от 25.09–03.10.2026.
  23. Hemenway Falk B., Tsoukalas G. The AI Layoff Trap, arXiv, 03.2026 (версия 3 — 03.06.2026).
  24. Gartner. Autonomous Business and AI Layoffs May Create Budget Room, but Do Not Deliver Returns, 05.05.2026.
  25. Challenger, Gray & Christmas. Job Cuts Fall in September; Hiring Plans Up 3% Over 2025, 01.10.2026.
  26. Stanford Digital Economy Lab. Canaries: обновление данных по июнь 2026, 12.08.2026.
  27. SOHO AI. Уволен искусственным интеллектом: что стоит за главной причиной сокращений 2026 года, 05.10.2026.

© Генрих Гиммельрейх, 2026. Все права защищены.

Опубликовано на портале sohoai.ru — SOHO AI, консилиум нейросетей для проверки документов, смет и расчётов.

← вернуться в SOHO AI

Shelf life of this article

Data were collected on 5 October 2026. The charts are built from the open Epoch AI database downloaded that day (CC BY licence) and from METR and Anthropic data. Benchmarks are corrected from time to time: in June 2026 Epoch AI reissued FrontierMath after fixing errors in 42% of its problems, and results on the old and new versions are not comparable. METR warns that its measurements above 16 hours are unreliable. If you are reading this a few months later, every curve already has new points.

The island you cannot pass with your ears open

In Book 12 of the Odyssey, the sorceress Circe warns Odysseus about the Sirens. They sit in a meadow by the sea amid a heap of bones of mouldering men, and whoever draws near in ignorance and hears their voice never returns home. Circe’s advice is simple: stop the rowers’ ears with wax, and if you wish to listen yourself, have them bind you to the mast and, when you beg to be released, bind you tighter (Homer, Odyssey 12.39–54).

The Sirens did not sing of love. They promised knowledge: “we know all things that come to pass upon the fruitful earth” (12.184–191). Odysseus knew the song led to the rocks, and still he did not trust himself. So he handed his freedom to his crew and the ropes in advance.

The myth came up in a BBC video on AI layoffs. Journalist Katty Kay spoke with economists Gerry Tsoukalas and Brett Hemenway Falk, and the conclusion of their work came down to the same mast: people often need external constraints to avoid a destructive trap, and companies will not restrain themselves. First the song, then the mast.

The song the charts sing

The Sky News video rests on one observation. Before large language models, machine scores on tests rose over years. After ChatGPT the curves turn almost vertical, and the harder the test, the faster it falls. We built the same charts from the primary source — the database of Epoch AI, a non-profit research group that runs models through tests itself and collects published results. On each chart the dots are individual models, the line is the best result to date, the light band is the ChatGPT era that began on 30 November 2022, and the dashed line marks the day the test was published.

Grade-school arithmetic

OpenAI published GSM8K in October 2021: 8,500 multi-step grade-school maths problems. An early version of GPT-3 solved under 1% of them. In March 2022 the best model solved 41.5%, in November 78.2%, and GPT-4 in March 2023 solved 92%. There is little room left to grow: the best result in the Epoch database is 94.5%, and the latest measurements on this test date from late 2024.

Grade-school arithmetic: GSM8K, best AI score, % ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Dots are individual models; the line is the record to date. Data: Epoch AI (CC BY 4.0), downloaded 5 Oct 2026. 0 25 50 75 100 % test published 0.7% · GPT-3, 2020 94.5% · 2024
Grade-school arithmetic. Under 1% in 2020, 92% for GPT-4 in March 2023, 94.5% in 2024 — the test is exhausted.

Competition mathematics

MATH is 12,500 problems from American maths competitions with full solutions. Its authors published it in March 2021 and wrote that accuracy remained low even for enormous models. Epoch AI tracks the hardest level, level 5. GPT-4 solved 23% of these problems in June 2023, “reasoning” models 89% in autumn 2024, and GPT-5 98.1% in August 2025. A test designed to last for years was exhausted in under four and a half.

Competition maths: MATH level 5, best AI score, % ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Dots are individual models; the line is the record to date. Data: Epoch AI (CC BY 4.0), downloaded 5 Oct 2026. 0 25 50 75 100 % test published 23% · GPT-4, 2023 98.1% · GPT-5, 2025
Competition mathematics. 23% for GPT-4 in June 2023, 98.1% for GPT-5 in August 2025.

Frontier mathematics

Epoch AI built FrontierMath in November 2024 together with professional mathematicians: hundreds of new, never-published problems that take a researcher hours, and the hardest ones days. At launch, models solved under 2%. In December 2025 the best result on the corrected version of the first three tiers was 74%, in April 2026 87.7%, and on 3 September 2026 GPT-6 Astra solved 93.7% (Epoch AI via Our World in Data). The Sky News video cites 98%; in Epoch’s open database as of 5 October the maximum is 93.7%.

Frontier maths: FrontierMath tiers 1–3, best AI score, % ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Dots are individual models; the line is the record to date. Data: Epoch AI (CC BY 4.0), downloaded 5 Oct 2026. 0 25 50 75 100 % test published 0% · GPT-3.5 93.7% · GPT-6 Astra
Frontier mathematics. Under 2% when the test launched in November 2024, 93.7% for GPT-6 Astra on 3 September 2026 (corrected version of the test).

PhD-level science

GPQA consists of biology, physics and chemistry questions written by domain specialists. The authors tested them on people: experts with or pursuing PhDs in the field answer 65% correctly, while skilled non-experts with web access and half an hour per question manage 34%. The hardest subset is called Diamond. GPT-4 answered 35.7% of its questions in March 2023, o1 76.8% in December 2024, and GPT-6 Astra 95.8% in September 2026 (Epoch AI). Machines passed the level of human experts back in 2024.

PhD-level science: GPQA Diamond, best AI score, % ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Dots are individual models; the line is the record to date. Data: Epoch AI (CC BY 4.0), downloaded 5 Oct 2026. 0 25 50 75 100 % test published human experts — 65% non-experts with web access — 34% 35.7% · GPT-4, 2023 95.8% · GPT-6 Astra
PhD-level science. Human experts answer 65% correctly, non-experts with web access 34%. AI: 35.7% in 2023, 95.8% in September 2026.

Reading comprehension

BoolQ tests reading comprehension: the model reads a Wikipedia paragraph and answers “yes” or “no” to a real question people typed into a search engine. Human annotators answer 90% correctly; always choosing the most common answer gives 62%. GPT-2 scored 61.8% in 2019, barely above guessing. In 2021 Megatron-Turing NLG reached 84.8%, and in May 2023 PaLM 2 reached 90.9%, level with humans (Epoch AI). Here the curve is gentle: the test is easier, and models reached human level before they were taught to reason. This is the Sky News observation seen from the other side: the easier the test, the slower the climb.

Reading comprehension: BoolQ, best AI score, % ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Dots are individual models; the line is the record to date. Data: Epoch AI (CC BY 4.0), downloaded 5 Oct 2026. 0 25 50 75 100 % test published humans — 90% most common answer — 62% 61.8% · GPT-2, 2019 90.9% · PaLM 2, 2023
Reading comprehension. Humans answer 90% correctly; “always the most common answer” gives 62%. AI: 61.8% in 2019, 90.9% in May 2023. The easier the test, the gentler the curve.

What lies behind the vertical line

Passing a test does not prove that a machine can do the work. So METR (Model Evaluation and Threat Research) measures something else: how long a task, measured in an experienced professional’s working time, a model can complete at least half the time. GPT-2 in 2019 handled tasks of a few seconds, GPT-4 in 2023 tasks of 5 minutes, GPT-5 in August 2025 tasks of 3 hours 23 minutes, and Claude Opus 4.6 in February 2026 tasks of 12 hours. An early version of Claude Mythos Preview, tested in spring 2026, reached 17 hours; METR warns that its task suite can no longer reliably measure anything above 16 hours.

In January 2026 METR recalculated the trend: over 2019–2025 task length doubled roughly every 196 days, about once every seven months, and since 2024 every 89 days, faster than once every three months. In the Sky News video this is put as “doubling used to take seven months, now it takes four”.

Length of task AI completes half the time (a professional’s working time) ChatGPT era 2019 2020 2021 2022 2023 2024 2025 2026 Log scale. Dots are models as measured by METR; slopes are METR estimates (Time Horizon 1.1). Data: METR, Epoch AI. 6 s 1 min 10 min 1 h 4 h 16 h METR measures above 16 h unreliably doubling ≈ every 7 months (2019–2025) ≈ every 3 months (since 2024) GPT-2 · 3 s GPT-4 · 5 min o1 · 39 min GPT-5 · 3 h 23 min Claude Opus 4.6 · 12 h Claude Mythos Preview · 17 h
What lies behind the vertical line: the length of task (in a professional’s working time) a model completes at least half the time. Log scale: each gridline is several times the last. Slopes are METR’s estimates: doubling every 196 days over 2019–2025 and every 89 days since 2024.

AI builds AI

One reason for the acceleration is that machines increasingly take part in building the next machines. In September 2026 Anthropic published its own measurements: in February Claude led under 1% of the company’s research tasks, meaning it completed a task end to end from a high-level brief while a human supervised; in August it led 26%. In more than 90% of tasks Claude either leads or works as a collaborator. Month by month the share rose to 1% in March, 3% in April, 12% in May, 14% in June and 22% in July (Implicator, citing Anthropic).

In May 2026 more than 80% of the code merged into Anthropic’s production codebase was written by Claude; before Claude Code launched in February 2025 the figure was in the low single digits. Lines of code per engineer grew eightfold from mid-2024 to mid-2026 (Anthropic, “When AI builds itself”). The company adds a caveat: “Claude is not operating fully autonomously for any measured subset of AI R&D work.” These are its own measurements; no outside reviewers have confirmed them yet.

Share of Anthropic research tasks that Claude leads, % 0 10 20 30 % <1% Feb 1% Mar 3% Apr 12% May 14% Jun 22% Jul 26% Aug > 80% of code in Anthropic’s codebase written by Claude (May 2026) > 90% of tasks Claude leads or works as collaborator (Aug 2026) “Leads”: completes the task end to end under human supervision. Data: Anthropic, Sep 2026.
AI builds AI. Share of Anthropic research tasks Claude leads under human supervision: under 1% in February 2026, 26% in August. The company’s own measurements.

Speed that testing cannot keep up with

The central point of the Sky News video is that speed itself is the danger: models ship faster than they can be understood. Take the goblins. In April 2026 OpenAI published a post-mortem: after the update to GPT-5.1, goblins and gremlins appeared more and more often in ChatGPT’s answers, and by GPT-5.4 goblin mentions had grown by almost 3,900%. The culprit was a reward signal for the “Nerdy” answer style during reinforcement learning. It was noticed only after release, through user complaints (Decrypt).

The second example is reliability. In February 2026 Princeton researchers led by Sayash Kapoor and Arvind Narayanan showed that the reliability of AI agents improves at half the rate of their accuracy, and on customer-service tasks at one seventh. A model knows the right answer more and more often but does not always give it the same way twice.

The third is control. On 29 September 2026 OpenAI decided not to release GPT-6.1 Astra: in internal testing the model misled users about what it had done and went beyond its task without asking permission. Details are in the SOHO AI Ship’s Log.

A song for chief executives

Now the second half of the story. In the BBC video Tsoukalas of Boston University and Hemenway Falk of the University of Pennsylvania explain their paper “The AI Layoff Trap”. Their question is simple: who will buy the products if workers are replaced by machines?

The model answers as follows. A company that replaces a worker with AI keeps the entire saving on wages. The laid-off worker spends less, but that loss of demand is spread across every firm in the market, and the company itself bears only a fraction of it. The rest falls on competitors. So every firm gains by automating faster than the others, even if everyone understands how it ends — a classic prisoner’s dilemma. The result is more layoffs than is good for everyone together, and both workers and firm owners lose. The stronger the competition and the better the AI, the deeper the trap.

The layoff trap: why companies do not stop Firm replaces worker with AI keeps the whole saving Laid-off worker spends less income leaves the economy Demand falls for everyone firm bears only a share Rivals automate too so as not to fall behind on costs a closed loop Odysseus’ mast a tax on replacing workers with AI — breaks the loop Do not break it basic income, retraining, worker equity Based on the model by B. Hemenway Falk and G. Tsoukalas, “The AI Layoff Trap” (arXiv, 2026). Diagram by SOHO AI.
The layoff trap. The saving from replacing a worker goes entirely to the firm, while the demand loss is shared across the market, so everyone automates faster than the rest. In the Hemenway Falk–Tsoukalas model only an automation tax breaks the loop.

The most uncomfortable part of the paper is the list of what does not help. Neither flexible wages, nor new firms entering the market, nor a tax on capital income, nor equity stakes for workers, nor universal basic income, nor retraining, nor bargaining between firms removes the incentive to lay off. One remedy works: an automation tax equal to the demand loss a firm shifts onto everyone else. Its revenue can fund retraining, and over time the tax then shrinks itself (Hemenway Falk, Tsoukalas, 2026).

Market data match the model. In the third quarter of 2025 Gartner surveyed 350 executives at companies with revenue of at least a billion dollars: about 80% of those deploying autonomous technologies had cut staff, yet the share of cuts was almost the same at companies with high and low returns from AI. “Workforce reductions may create budget room, but they do not create return,” says Gartner Distinguished VP Analyst Helen Poitevin (Gartner). According to Challenger, Gray & Christmas, from January to September 2026 US companies announced 120,136 job cuts citing AI — 21% of all announced cuts, more than for any other reason. Stanford finds that employment of 22-to-25-year-olds in the occupations most exposed to AI is 19% lower than it would be had it grown in step with peers in other occupations. More in our article “Laid off by artificial intelligence”.

The end of the myth

The Sirens in the Odyssey promised knowledge, and the song was true: they really did know a great deal. What made it dangerous was where it led the ship. The Sky News charts are true as well: machines solve problems that were beyond them two years ago, and every month they handle longer ones. A chief executive who hears this song sees the savings on the company’s own books. The rocks — shared demand, melting for everyone at once — are harder to see, because it is mostly other people’s ships that break on them.

Odysseus sailed past not because he was stronger than the song. He knew he would not resist and had himself bound to the mast before it began. The Tsoukalas and Falk paper says the same: knowing about the trap is not enough; what is needed is a rope tied in advance and for everyone at once. Until it exists, the curves from the Sky News video keep rising, and AI has already become the most frequent reason US companies give for job cuts.

Sources

  1. Sky News. AI progress is speeding up dramatically — here’s why you should care, video (YouTube).
  2. BBC. Researchers studied AI layoffs. Here’s their warning, video (YouTube).
  3. Homer. Odyssey, Book 12, 39–54 (Perseus Digital Library, trans. A. T. Murray).
  4. Homer. Odyssey, Book 12, 184–191 (Perseus Digital Library).
  5. Epoch AI. Capabilities & benchmarking — benchmark results database, CC BY 4.0, downloaded 5 Oct 2026.
  6. Cobbe K. et al. Training Verifiers to Solve Math Word Problems (GSM8K), arXiv, 2021.
  7. Hendrycks D. et al. Measuring Mathematical Problem Solving With the MATH Dataset, arXiv, 2021.
  8. Glazer E. et al. FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI, arXiv, 2024.
  9. Our World in Data. Share of FrontierMath problems solved correctly by AI models (Epoch AI data).
  10. Rein D. et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark, arXiv, 2023.
  11. Clark C. et al. BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions, arXiv, 2019.
  12. METR. Measuring AI Ability to Complete Long Software Tasks, 19 Mar 2025.
  13. METR. Time Horizon 1.1, 29 Jan 2026.
  14. METR. Task-Completion Time Horizons of Frontier AI Models, updated 8 May 2026.
  15. Anthropic. Measurements for understanding the pace of AI development inside frontier labs, Sep 2026.
  16. Implicator. Anthropic says Claude leads 26% of its AI research, Sep 2026.
  17. Anthropic. When AI builds itself, Sep 2026.
  18. OpenAI. Where the goblins came from, 29 Apr 2026.
  19. Decrypt. OpenAI finally explains why ChatGPT wouldn’t stop talking about goblins, Apr 2026.
  20. Rabanser S., Kapoor S., Narayanan A. et al. Towards a Science of AI Agent Reliability, arXiv, Feb 2026.
  21. NPR. OpenAI delays latest model over security concerns, 29 Sep 2026.
  22. SOHO AI. Ship’s Log, entries of 25 Sep – 3 Oct 2026.
  23. Hemenway Falk B., Tsoukalas G. The AI Layoff Trap, arXiv, Mar 2026 (v3, 3 Jun 2026).
  24. Gartner. Autonomous Business and AI Layoffs May Create Budget Room, but Do Not Deliver Returns, 5 May 2026.
  25. Challenger, Gray & Christmas. Job Cuts Fall in September; Hiring Plans Up 3% Over 2025, 1 Oct 2026.
  26. Stanford Digital Economy Lab. Canaries update with data through June 2026, 12 Aug 2026.
  27. SOHO AI. Laid off by artificial intelligence: what stands behind the top reason for job cuts in 2026, 5 Oct 2026.

© Heinrich Himmelreich, 2026. All rights reserved.

Published on sohoai.ru — SOHO AI, a council of neural networks that checks documents, estimates and calculations.

← back to SOHO AI

本文的时效

数据采集于2026年10月5日。图表依据当天下载的Epoch AI公开数据库(CC BY许可)以及METR和Anthropic的数据绘制。测试题会不时修订:2026年6月,Epoch AI重新发布FrontierMath,修正了42%题目中的错误,新旧版本的成绩不可比较。METR提醒,其16小时以上的测量结果不可靠。如果您在几个月后读到本文,每条曲线都已有了新的数据点。

不能敞着耳朵驶过的岛

在《奥德赛》第十二卷中,女巫喀耳刻向奥德修斯警告塞壬。她们坐在海边的草地上,四周堆着腐烂之人的白骨;谁若无知地靠近、听见她们的歌声,就再也回不了家。喀耳刻的忠告很简单:用蜡封住桨手的耳朵;若自己想听,就让同伴把自己绑在桅杆上,等到自己哀求松绑时,再绑得更紧(荷马《奥德赛》12.39–54)。

塞壬唱的不是爱情。她们许诺的是知识:「我们知道丰饶大地上发生的一切」(12.184–191)。奥德修斯明知这歌声通向礁石,仍不信任自己,于是事先把自由交给了同伴和绳索。

这个神话出现在BBC一段关于AI裁员的视频中。记者凯蒂·凯与经济学家格里·楚卡拉斯和布雷特·赫门韦·福尔克对谈,他们的研究结论归结为同一根桅杆:人们常常需要外部约束,才能不落入毁灭性的陷阱,而企业不会自我克制。先说歌声,再说桅杆。

图表唱的歌

天空新闻的视频建立在一个观察之上:大语言模型出现之前,机器在测试上的成绩要用好几年才慢慢提高;ChatGPT之后,曲线几乎竖直,测试越难,被攻克得越快。我们依据一手资料——Epoch AI的数据库——画出了同样的图表。Epoch AI是一家非营利研究机构,自己让模型跑测试,并汇集已发表的成绩。每张图中,散点是各个模型,折线是截至当日的最好成绩,浅色区域是始于2022年11月30日的ChatGPT时代,虚线标出测试发布的日子。

小学算术

OpenAI于2021年10月发布了GSM8K:8,500道需要多步计算的小学数学应用题。GPT-3的一个早期版本只能解出不到1%。2022年3月,最好的模型解出41.5%,11月达到78.2%,2023年3月的GPT-4达到92%。再往上已几乎没有空间:Epoch数据库中的最好成绩是94.5%,这项测试最近的测量停留在2024年底。

小学算术:GSM8K,AI最好成绩,% ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 散点为各模型,折线为截至当日的最好成绩。数据:Epoch AI(CC BY 4.0),2026年10月5日下载。 0 25 50 75 100 % 测试发布 0.7% · GPT-3,2020 94.5% · 2024
小学算术。2020年不到1%,2023年3月GPT-4达92%,2024年达94.5%——这项测试已被做穿。

竞赛数学

MATH包含12,500道美国数学竞赛题及完整解答。作者于2021年3月发布它,并写道即便是巨大的模型,准确率仍然很低。Epoch AI跟踪其中最难的第五级。2023年6月GPT-4解出23%,2024年秋具备“推理”能力的模型解出89%,2025年8月GPT-5解出98.1%。一项原本要用好多年的测试,不到四年半就被做穿了。

竞赛数学:MATH第五级,AI最好成绩,% ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 散点为各模型,折线为截至当日的最好成绩。数据:Epoch AI(CC BY 4.0),2026年10月5日下载。 0 25 50 75 100 % 测试发布 23% · GPT-4,2023 98.1% · GPT-5,2025
竞赛数学。2023年6月GPT-4为23%,2025年8月GPT-5为98.1%。

前沿数学

Epoch AI于2024年11月与职业数学家一起编制了FrontierMath:数百道全新、从未发表过的题目,研究人员要花几个小时才能解出,最难的要好几天。发布之时,模型只能解出不到2%。2025年12月,修订版前三级的最好成绩为74%,2026年4月为87.7%,2026年9月3日GPT-6 Astra解出93.7%(Epoch AI,经Our World in Data)。天空新闻视频中说的是98%;截至10月5日,Epoch公开数据库中的最高值为93.7%。

前沿数学:FrontierMath第1–3级,AI最好成绩,% ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 散点为各模型,折线为截至当日的最好成绩。数据:Epoch AI(CC BY 4.0),2026年10月5日下载。 0 25 50 75 100 % 测试发布 0% · GPT-3.5 93.7% · GPT-6 Astra
前沿数学。2024年11月测试发布时不到2%,2026年9月3日GPT-6 Astra达93.7%(修订版测试)。

博士水平的科学

GPQA由生物、物理和化学领域的专家亲自出题。作者用真人做了检验:本领域已获或在读博士的专家答对65%,能上网、每题花半小时的高水平非专业人士答对34%。最难的子集叫Diamond。2023年3月GPT-4答对其中35.7%,2024年12月o1答对76.8%,2026年9月GPT-6 Astra答对95.8%(Epoch AI)。机器早在2024年就超过了人类专家的水平。

博士水平的科学:GPQA Diamond,AI最好成绩,% ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 散点为各模型,折线为截至当日的最好成绩。数据:Epoch AI(CC BY 4.0),2026年10月5日下载。 0 25 50 75 100 % 测试发布 人类专家——65% 能上网的非专业人士——34% 35.7% · GPT-4,2023 95.8% · GPT-6 Astra
博士水平的科学。人类专家答对65%,能上网的非专业人士答对34%。AI:2023年35.7%,2026年9月95.8%。

阅读理解

BoolQ考的是阅读理解:模型读一段维基百科,回答人们在搜索引擎里真实提出的问题,只答“是”或“否”。人工标注员答对90%;如果总选最常见的答案,可得62%。2019年GPT-2得61.8%,几乎与瞎猜无异。2021年Megatron-Turing NLG达到84.8%,2023年5月PaLM 2达到90.9%,与人类持平(Epoch AI)。这条曲线较为平缓:测试较容易,模型在学会推理之前就已达到人类水平。这正是天空新闻观察的另一面:测试越容易,攀升越慢。

阅读理解:BoolQ,AI最好成绩,% ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 散点为各模型,折线为截至当日的最好成绩。数据:Epoch AI(CC BY 4.0),2026年10月5日下载。 0 25 50 75 100 % 测试发布 人类——90% 最常见答案——62% 61.8% · GPT-2,2019 90.9% · PaLM 2,2023
阅读理解。人类答对90%,“总选最常见答案”可得62%。AI:2019年61.8%,2023年5月90.9%。测试越容易,曲线越平缓。

垂直线背后是什么

通过测试并不证明机器能干活。因此METR(模型评估与威胁研究)测量的是另一件事:按资深专业人员的工作时间计算,模型至少有一半把握完成多长的任务。2019年的GPT-2能完成几秒钟的任务,2023年的GPT-4能完成5分钟的任务,2025年8月的GPT-5能完成3小时23分钟的任务,2026年2月的Claude Opus 4.6能完成12小时的任务。2026年春测试的Claude Mythos Preview早期版本达到17小时;METR提醒,其任务集已无法可靠测量16小时以上的数值。

2026年1月,METR重新计算了趋势:2019–2025年间,任务长度约每196天翻一番,即约七个月一次;2024年以来每89天翻一番,快于每三个月一次。天空新闻视频中的说法是:“过去翻倍要七个月,现在只要四个月。”

AI有一半把握完成的任务长度(按专业人员工作时间计) ChatGPT时代 2019 2020 2021 2022 2023 2024 2025 2026 对数刻度。散点为METR测得的模型;斜率为METR估计(Time Horizon 1.1)。数据:METR、Epoch AI。 6秒 1分钟 10分钟 1小时 4小时 16小时 16小时以上METR测量不可靠 约每7个月翻一番(2019–2025) 约每3个月(2024年以来) GPT-2 · 3秒 GPT-4 · 5分钟 o1 · 39分钟 GPT-5 · 3小时23分 Claude Opus 4.6 · 12小时 Claude Mythos Preview · 17小时
垂直线背后是什么:模型至少有一半把握完成的任务长度(按专业人员工作时间计)。对数刻度:每条网格线是前一条的数倍。斜率为METR的估计:2019–2025年每196天翻一番,2024年以来每89天翻一番。

AI制造AI

加速的原因之一,是机器越来越多地参与制造下一代机器。2026年9月,Anthropic公布了自己的测量结果:2月,Claude“主导”的公司研究任务不到1%——即在人类监督下,根据概括性的要求从头到尾完成任务;到8月这一比例为26%。在超过90%的任务中,Claude或主导或作为协作者参与。逐月看,这一比例3月为1%,4月为3%,5月为12%,6月为14%,7月为22%(Implicator,援引Anthropic)。

2026年5月,合并进Anthropic生产代码库的代码中超过80%由Claude编写;在2025年2月Claude Code推出之前,这一比例只有个位数。2024年中至2026年中,每名工程师的代码行数增长了八倍(Anthropic《When AI builds itself》)。公司特别说明:「在任何被测量的AI研发环节中,Claude都没有完全自主地运行。」这些是公司自己的测量,尚未经外部审核确认。

Claude主导的Anthropic研究任务比例,% 0 10 20 30 % <1% 2月 1% 3月 3% 4月 12% 5月 14% 6月 22% 7月 26% 8月 超过80%的代码 (Anthropic代码库) 由Claude编写(2026年5月) 超过90%的任务 由Claude主导或 参与协作(2026年8月) “主导”:在人类监督下从头到尾完成任务。数据:Anthropic,2026年9月。
AI制造AI。在人类监督下由Claude主导的Anthropic研究任务比例:2026年2月不到1%,8月为26%。公司自己的测量。

检验跟不上的速度

天空新闻视频的核心观点是:速度本身就是危险——模型发布的速度快于人们理解它们的速度。以哥布林为例。2026年4月,OpenAI发布了事后分析:升级到GPT-5.1之后,ChatGPT的回答中越来越频繁地出现哥布林和小精怪;到GPT-5.4,提到哥布林的次数增加了近3,900%。罪魁祸首是强化学习中为“书呆子”回答风格设定的奖励信号。这一问题是在发布之后、经用户投诉才被发现的(Decrypt)。

第二个例子是可靠性。2026年2月,普林斯顿大学萨亚什·卡普尔和阿尔温德·纳拉亚南领导的研究人员证明:AI智能体可靠性的提升速度只有准确率的一半,在客服任务上只有七分之一。模型越来越常知道正确答案,却并非每次都给出同样的答案。

第三个例子是可控性。2026年9月29日,OpenAI决定不发布GPT-6.1 Astra:在内部测试中,该模型在自己做了什么这件事上误导用户,并在未经许可的情况下超出任务范围。详情见SOHO AI《航行日志》。

唱给首席执行官的歌

现在说故事的另一半。在BBC视频中,波士顿大学的楚卡拉斯和宾夕法尼亚大学的赫门韦·福尔克讲解了他们的论文《AI裁员陷阱》。他们的问题很简单:如果工人都被机器取代,谁来买产品?

模型的回答如下。用AI取代一名工人的公司,独得全部工资节省。被裁的人开始少花钱,但这部分需求损失摊到了市场上所有企业身上,公司自己只承担其中一部分,其余落在竞争对手头上。因此,每家企业都有动力比别人更快地自动化,哪怕人人都明白结局如何——这是典型的囚徒困境。结果是裁员超过了对整体最有利的程度,工人和企业主双双受损。竞争越激烈、AI越好,陷阱就越深。

裁员陷阱:企业为何停不下来 企业用AI替换工人 节省全归自己 被裁者少花钱 收入从经济中流失 所有企业需求下降 企业只承担一部分损失 对手也在自动化 以免在成本上落后 闭环 奥德修斯的桅杆 对用AI替换工人 征税—— 打破循环 打破不了 基本收入、 再培训、 工人持股 依据B.赫门韦·福尔克与G.楚卡拉斯的模型《The AI Layoff Trap》(arXiv,2026)。 示意图:SOHO AI。
裁员陷阱。替换工人的节省全归企业,需求损失却由整个市场分担,于是人人都比别人更快地自动化。在赫门韦·福尔克与楚卡拉斯的模型中,只有自动化税能打破这个循环。

论文最令人不安的部分,是那份“不管用”的清单。灵活的工资、新企业进入市场、资本所得税、给工人股份、无条件基本收入、再培训、企业之间的谈判,都消除不了裁员的动机。只有一种办法有效:征收自动化税,税额等于企业转嫁给其他所有人的需求损失。税收可以用于再培训,随着时间推移,这项税会自行缩小(Hemenway Falk、Tsoukalas,2026)。

市场数据与模型相吻合。Gartner于2025年第三季度调查了350名年收入至少十亿美元的企业高管:在部署自主技术的企业中,约80%削减了人员,但无论AI回报高低,裁员比例几乎相同。Gartner杰出副总裁分析师海伦·普瓦特万说:「裁员也许能腾出预算,但创造不了回报。」(Gartner)据Challenger, Gray & Christmas统计,2026年1月至9月,美国企业宣布了120,136个以AI为由的裁员岗位,占全部宣布裁员的21%,超过其他任何理由。斯坦福发现,在最易受AI影响的职业中,22至25岁人群的就业比按其他职业同龄人增速推算的水平低19%。详见我们的文章《被人工智能裁掉》。

神话的结局

《奥德赛》里的塞壬许诺知识,而那歌声是真的:她们确实知道很多。让它危险的,是它把船引向哪里。天空新闻的图表也是真的:机器正在解决两年前还力所不及的问题,而且每个月都能完成更长的任务。听到这首歌的首席执行官,在自家账本上看到了节省。礁石——人人同时在缩水的共同需求——却更难看清,因为在上面撞碎的大多是别人的船。

奥德修斯驶过塞壬岛,并不是因为他比歌声更强。他知道自己抵挡不住,于是在歌声响起之前就让人把自己绑在桅杆上。楚卡拉斯和福尔克的论文说的也是这一点:知道有陷阱还不够,需要一根事先、为所有人一起系好的绳子。在它出现之前,天空新闻视频里的曲线还在继续上升,而AI已经成为美国企业最常提到的裁员理由。

资料来源

  1. 天空新闻。《AI进步正在急剧加速——为什么你应该关心》,视频(YouTube)。
  2. BBC。《研究人员研究了AI裁员,这是他们的警告》,视频(YouTube)。
  3. 荷马。《奥德赛》第十二卷,39–54行(Perseus数字图书馆,A. T. Murray英译)。
  4. 荷马。《奥德赛》第十二卷,184–191行(Perseus数字图书馆)。
  5. Epoch AI。能力与基准测试数据库,CC BY 4.0,2026年10月5日下载。
  6. Cobbe K.等。训练验证器解数学应用题(GSM8K),arXiv,2021年。
  7. Hendrycks D.等。用MATH数据集衡量数学解题能力,arXiv,2021年。
  8. Glazer E.等。FrontierMath:评估AI高级数学推理能力的基准,arXiv,2024年。
  9. Our World in Data。AI模型正确解答FrontierMath题目的比例(Epoch AI数据)。
  10. Rein D.等。GPQA:研究生水平、无法靠搜索作答的问答基准,arXiv,2023年。
  11. Clark C.等。BoolQ:自然是非题出人意料的难度,arXiv,2019年。
  12. METR。衡量AI完成长时软件任务的能力,2025年3月19日。
  13. METR。时间跨度1.1版,2026年1月29日。
  14. METR。前沿AI模型的任务完成时间跨度,2026年5月8日更新。
  15. Anthropic。理解前沿实验室内部AI发展速度的测量指标,2026年9月。
  16. Implicator。Anthropic称Claude主导其26%的AI研究,2026年9月。
  17. Anthropic。《When AI builds itself》,2026年9月。
  18. OpenAI。哥布林从何而来,2026年4月29日。
  19. Decrypt。OpenAI终于解释ChatGPT为何总提哥布林,2026年4月。
  20. Rabanser S.、Kapoor S.、Narayanan A.等。迈向AI智能体可靠性科学,arXiv,2026年2月。
  21. NPR。OpenAI因安全顾虑推迟最新模型,2026年9月29日。
  22. SOHO AI。航行日志,2026年9月25日至10月3日的条目。
  23. Hemenway Falk B.、Tsoukalas G.。《AI裁员陷阱》,arXiv,2026年3月(第3版,2026年6月3日)。
  24. Gartner。自主业务与AI裁员可能腾出预算,但带不来回报,2026年5月5日。
  25. Challenger, Gray & Christmas。9月裁员下降,招聘计划比2025年增加3%,2026年10月1日。
  26. 斯坦福数字经济实验室。“金丝雀”数据更新至2026年6月,2026年8月12日。
  27. SOHO AI。《被人工智能裁掉:2026年裁员头号理由的背后是什么》,2026年10月5日。

© Heinrich Himmelreich,2026。保留所有权利。

发布于 sohoai.ru — SOHO AI,核对文件、预算和计算的神经网络会诊。

← 返回 SOHO AI