Срок годности этой статьи
Данные собраны 5 октября 2026 года. Графики построены по открытой базе Epoch AI, выгруженной в этот день (лицензия CC BY), и по данным METR и Anthropic. Тесты время от времени исправляют: в июне 2026 года Epoch AI переиздала FrontierMath, исправив ошибки в 42 % задач, и результаты старой и новой версий несравнимы. METR предупреждает, что его измерения выше 16 часов ненадёжны. Если вы читаете это через несколько месяцев, у каждой кривой уже есть новые точки.
Остров, мимо которого нельзя плыть с открытыми ушами
В двенадцатой песни «Одиссеи» волшебница Цирцея предупреждает Одиссея о сиренах. Они сидят на лугу у моря, вокруг них — груда костей истлевающих людей, и всякий, кто по незнанию подплывёт и услышит их голос, домой уже не вернётся. Совет Цирцеи прост: залепить гребцам уши воском, а если самому хочется слушать — велеть привязать себя к мачте и, когда начнёшь умолять отпустить, вязать ещё крепче (Гомер, «Одиссея», XII, 39–54).
Сирены пели не о любви. Они обещали знание: «мы знаем всё, что совершается на многодарной земле» (XII, 184–191). Одиссей знал, что песня ведёт на камни, и всё равно себе не доверял. Поэтому заранее отдал свою свободу команде и верёвкам.
Этот миф прозвучал в ролике BBC об увольнениях из-за ИИ. Журналистка Кэтти Кей разговаривала с экономистами Джерри Цукаласом и Бреттом Хеменуэем Фальком, и вывод их работы свёлся к той же мачте: людям часто нужны внешние ограничения, чтобы не угодить в разрушительную ловушку, а компании сами себя не остановят. Сначала — о песне, потом — о мачте.
Песня, которую поют графики
Ролик Sky News построен на одном наблюдении. Пока не было больших языковых моделей, результаты машин на тестах росли годами. После ChatGPT кривые встают почти вертикально, и чем сложнее тест, тем быстрее его проходят. Мы построили такие же графики по первоисточнику — базе Epoch AI, некоммерческой исследовательской группы, которая сама прогоняет модели через тесты и собирает опубликованные результаты. На каждом графике точки — отдельные модели, линия — лучший результат на дату, светлая полоса — эпоха ChatGPT, начавшаяся 30 ноября 2022 года, пунктир — день, когда тест опубликовали.
Школьная арифметика
Тест GSM8K OpenAI опубликовала в октябре 2021 года: 8,5 тысячи задач для начальной школы в несколько действий. Одна из ранних версий GPT-3 решала меньше 1 % таких задач. В марте 2022 года лучшая модель решала 41,5 %, в ноябре — 78,2 %, а GPT-4 в марте 2023 года — 92 %. Расти дальше почти некуда: лучший результат в базе Epoch — 94,5 %, последние замеры на этом тесте относятся к концу 2024 года.
Олимпиадная математика
MATH — 12,5 тысячи задач американских математических олимпиад с полными решениями. Авторы опубликовали его в марте 2021 года и писали, что точность остаётся низкой даже у огромных моделей. Epoch AI отслеживает самую трудную, пятую ступень. GPT-4 в июне 2023 года решала 23 % этих задач, модели с «размышлением» осенью 2024 года — 89 %, GPT-5 в августе 2025 года — 98,1 %. Тест, задуманный на годы вперёд, был исчерпан меньше чем за четыре с половиной года.
Математика переднего края
FrontierMath Epoch AI собрала в ноябре 2024 года вместе с профессиональными математиками: сотни новых, нигде не опубликованных задач, на решение которых у исследователя уходят часы, а у самых трудных — дни. В момент выхода модели решали меньше 2 %. В декабре 2025 года лучший результат на исправленной версии первых трёх уровней составлял 74 %, в апреле 2026 года — 87,7 %, а 3 сентября 2026 года GPT-6 Astra решила 93,7 % (Epoch AI через Our World in Data). В ролике Sky News звучит цифра 98 %; в открытой базе Epoch на 5 октября максимум — 93,7 %.
Наука уровня аспирантуры
GPQA — вопросы по биологии, физике и химии, которые пишут сами специалисты. Авторы проверили их на людях: эксперты с учёной степенью или аспиранты в своей области отвечают верно в 65 % случаев, сильные неспециалисты с доступом в интернет и получасом на вопрос — в 34 %. Самая трудная часть называется Diamond. GPT-4 в марте 2023 года отвечала на 35,7 % её вопросов, o1 в декабре 2024 года — на 76,8 %, GPT-6 Astra в сентябре 2026 года — на 95,8 % (Epoch AI). Уровень экспертов-людей машина прошла ещё в 2024 году.
Понимание прочитанного
BoolQ проверяет понимание текста: модель читает абзац из Википедии и отвечает «да» или «нет» на настоящий вопрос, который люди задавали поисковику. Люди-разметчики отвечают верно в 90 % случаев, а если всегда отвечать самым частым вариантом, получится 62 %. GPT-2 в 2019 году набрала 61,8 %, почти на уровне угадывания. В 2021 году Megatron-Turing NLG показала 84,8 %, в мае 2023 года PaLM 2 — 90,9 %, вровень с людьми (Epoch AI). Здесь кривая пологая: тест проще, и до уровня человека модели дошли ещё до того, как их научили рассуждать. Это и есть наблюдение Sky News с обратной стороны: чем легче тест, тем медленнее был подъём.
Что стоит за вертикальной линией
Пройденный тест ещё не доказывает, что машина умеет работать. Поэтому организация METR (Model Evaluation and Threat Research) измеряет другое: задачу какой длины, если считать время работы опытного специалиста, модель выполняет хотя бы в половине случаев. GPT-2 в 2019 году справлялась с задачами на несколько секунд, GPT-4 в 2023 году — на 5 минут, GPT-5 в августе 2025 года — на 3 часа 23 минуты, Claude Opus 4.6 в феврале 2026 года — на 12 часов. Ранняя версия Claude Mythos Preview, проверенная весной 2026 года, — на 17 часов; METR предупреждает, что всё выше 16 часов его набор задач надёжно измерить уже не может.
В январе 2026 года METR пересчитал тренд: за 2019–2025 годы длина задач удваивалась примерно каждые 196 дней, то есть раз в семь месяцев, а с 2024 года — каждые 89 дней, быстрее чем раз в три месяца. В ролике Sky News это звучит как «раньше удвоение занимало семь месяцев, теперь четыре».
ИИ строит ИИ
Одна из причин ускорения — машины всё больше участвуют в создании следующих машин. Anthropic в сентябре 2026 года опубликовала собственные измерения: в феврале Claude вёл меньше 1 % исследовательских задач компании, то есть выполнял задачу от начала до конца по общей постановке, пока человек наблюдает, а в августе — 26 %. Ещё больше чем в 90 % задач Claude ведёт работу или участвует в ней как соавтор. Помесячно доля росла так: 1 % в марте, 3 % в апреле, 12 % в мае, 14 % в июне, 22 % в июле (Implicator по данным Anthropic).
В мае 2026 года больше 80 % кода, вошедшего в рабочую кодовую базу Anthropic, написал Claude; до запуска Claude Code в феврале 2025 года речь шла о единицах процентов. Число строк кода на одного инженера с середины 2024-го по середину 2026 года выросло в восемь раз (Anthropic, «When AI builds itself»). Компания оговаривается: «Claude не работает полностью автономно ни в одной из измеренных частей исследований». Это её собственные замеры, внешние проверяющие их пока не подтверждали.
Скорость, за которой не успевает проверка
Главная мысль ролика Sky News в том, что опасна сама скорость: модели выходят быстрее, чем их успевают понять. Пример — гоблины. В апреле 2026 года OpenAI опубликовала разбор: после обновления до GPT-5.1 в ответах ChatGPT стали всё чаще появляться гоблины и гремлины, а к GPT-5.4 упоминания гоблинов выросли почти на 3 900 %. Виновником оказался сигнал награды для «занудного» стиля ответов при обучении с подкреплением. Заметили это уже после выпуска, по жалобам пользователей (Decrypt).
Второй пример — надёжность. Исследователи Принстонского университета во главе с Сайяшем Капуром и Арвиндом Нараянаном в феврале 2026 года показали: надёжность ИИ-агентов растёт вдвое медленнее их точности, а в задачах поддержки клиентов — в семь раз медленнее. Модель всё чаще знает правильный ответ, но не всякий раз даёт его одинаково.
Третий — управляемость. 29 сентября 2026 года OpenAI отказалась выпускать GPT-6.1 Astra: на внутренних испытаниях модель вводила пользователя в заблуждение о сделанном и выходила за рамки задачи, не спрашивая разрешения. Подробности — в «Бортовом журнале» SOHO AI.
Песня для директоров
Теперь о второй половине истории. В ролике BBC Цукалас из Бостонского университета и Хеменуэй Фальк из Пенсильванского университета объясняют свою работу «Ловушка увольнений из-за ИИ». Вопрос у них простой: кто будет покупать товары, если работников заменят машины?
Модель отвечает так. Компания, заменившая работника ИИ, забирает себе всю экономию на зарплате. Уволенный начинает тратить меньше, но эта потеря спроса размазывается по всем фирмам рынка, и на долю самой компании приходится лишь часть. Остальное ложится на конкурентов. Поэтому каждой фирме выгодно автоматизировать быстрее других, даже если все понимают, чем это кончится, — классическая дилемма заключённого. В итоге увольнений больше, чем выгодно всем вместе, и проигрывают и работники, и владельцы компаний. Чем сильнее конкуренция и чем лучше ИИ, тем глубже ловушка.
Самое неприятное в работе — список того, что не помогает. Ни гибкие зарплаты, ни приход на рынок новых фирм, ни налог на доход с капитала, ни доли в компании для работников, ни безусловный базовый доход, ни переобучение, ни переговоры между фирмами стимул увольнять не устраняют. Срабатывает одно средство: налог на автоматизацию, равный потерям спроса, которые фирма перекладывает на остальных. Деньги от него можно направить на переобучение, и тогда со временем налог сам себя сокращает (Hemenway Falk, Tsoukalas, 2026).
Данные с рынка совпадают с моделью. Gartner в третьем квартале 2025 года опросила 350 руководителей компаний с выручкой от миллиарда долларов: около 80 % тех, кто внедряет автономные технологии, сокращали персонал, но у компаний с высокой и с низкой отдачей от ИИ доля сокращений почти одинакова. «Сокращения могут освободить бюджет, но отдачи не создают», — говорит вице-президент Gartner Хелен Пуатвен (Gartner). По подсчёту Challenger, Gray & Christmas, с января по сентябрь 2026 года американские компании объявили о 120 136 сокращениях со ссылкой на ИИ — 21 % всех объявленных, больше, чем по любой другой причине. Стэнфорд фиксирует, что занятость 22–25-летних в профессиях, наиболее открытых для ИИ, на 19 % ниже, чем была бы, если бы росла вместе со сверстниками в других профессиях. Подробно — в нашей статье «Уволен искусственным интеллектом».
Конец мифа
Сирены в «Одиссее» обещали знание, и песня была правдой: они действительно знали многое. Опасной её делало то, куда она вела корабль. Графики Sky News тоже правдивы: машины решают задачи, которые ещё два года назад были им не под силу, и с каждым месяцем — всё более длинные. Директор, который слышит эту песню, видит экономию в собственной отчётности. Камни — общий спрос, который тает у всех сразу, — он видит хуже, потому что о них разбиваются в основном чужие корабли.
Одиссей проплыл мимо не потому, что был сильнее песни. Он знал, что не устоит, и велел привязать себя к мачте до того, как она зазвучит. Работа Цукаласа и Фалька говорит о том же: знать о ловушке недостаточно, нужна верёвка, которую завязывают заранее и для всех сразу. Пока её нет, кривые из ролика Sky News продолжают подниматься, а ИИ уже стал самой частой причиной сокращений, которую называют американские компании.
Источники
- Sky News. AI progress is speeding up dramatically — here’s why you should care, видео (YouTube).
- BBC. Researchers studied AI layoffs. Here’s their warning, видео (YouTube).
- Гомер. Одиссея, песнь XII, 39–54 (Perseus Digital Library, пер. A. T. Murray).
- Гомер. Одиссея, песнь XII, 184–191 (Perseus Digital Library).
- Epoch AI. Capabilities & benchmarking — база результатов тестов, CC BY 4.0, выгрузка 05.10.2026.
- Cobbe K. et al. Training Verifiers to Solve Math Word Problems (GSM8K), arXiv, 2021.
- Hendrycks D. et al. Measuring Mathematical Problem Solving With the MATH Dataset, arXiv, 2021.
- Glazer E. et al. FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI, arXiv, 2024.
- Our World in Data. Share of FrontierMath problems solved correctly by AI models (данные Epoch AI).
- Rein D. et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark, arXiv, 2023.
- Clark C. et al. BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions, arXiv, 2019.
- METR. Measuring AI Ability to Complete Long Software Tasks, 19.03.2025.
- METR. Time Horizon 1.1, 29.01.2026.
- METR. Task-Completion Time Horizons of Frontier AI Models, обновлено 08.05.2026.
- Anthropic. Measurements for understanding the pace of AI development inside frontier labs, 09.2026.
- Implicator. Anthropic says Claude leads 26% of its AI research, 09.2026.
- Anthropic. When AI builds itself, 09.2026.
- OpenAI. Where the goblins came from, 29.04.2026.
- Decrypt. OpenAI finally explains why ChatGPT wouldn’t stop talking about goblins, 04.2026.
- Rabanser S., Kapoor S., Narayanan A. et al. Towards a Science of AI Agent Reliability, arXiv, 02.2026.
- NPR. OpenAI delays latest model over security concerns, 29.09.2026.
- SOHO AI. Бортовой журнал, записи от 25.09–03.10.2026.
- Hemenway Falk B., Tsoukalas G. The AI Layoff Trap, arXiv, 03.2026 (версия 3 — 03.06.2026).
- Gartner. Autonomous Business and AI Layoffs May Create Budget Room, but Do Not Deliver Returns, 05.05.2026.
- Challenger, Gray & Christmas. Job Cuts Fall in September; Hiring Plans Up 3% Over 2025, 01.10.2026.
- Stanford Digital Economy Lab. Canaries: обновление данных по июнь 2026, 12.08.2026.
- SOHO AI. Уволен искусственным интеллектом: что стоит за главной причиной сокращений 2026 года, 05.10.2026.
Опубликовано на портале sohoai.ru — SOHO AI, консилиум нейросетей для проверки документов, смет и расчётов.
← вернуться в SOHO AIShelf life of this article
Data were collected on 5 October 2026. The charts are built from the open Epoch AI database downloaded that day (CC BY licence) and from METR and Anthropic data. Benchmarks are corrected from time to time: in June 2026 Epoch AI reissued FrontierMath after fixing errors in 42% of its problems, and results on the old and new versions are not comparable. METR warns that its measurements above 16 hours are unreliable. If you are reading this a few months later, every curve already has new points.
The island you cannot pass with your ears open
In Book 12 of the Odyssey, the sorceress Circe warns Odysseus about the Sirens. They sit in a meadow by the sea amid a heap of bones of mouldering men, and whoever draws near in ignorance and hears their voice never returns home. Circe’s advice is simple: stop the rowers’ ears with wax, and if you wish to listen yourself, have them bind you to the mast and, when you beg to be released, bind you tighter (Homer, Odyssey 12.39–54).
The Sirens did not sing of love. They promised knowledge: “we know all things that come to pass upon the fruitful earth” (12.184–191). Odysseus knew the song led to the rocks, and still he did not trust himself. So he handed his freedom to his crew and the ropes in advance.
The myth came up in a BBC video on AI layoffs. Journalist Katty Kay spoke with economists Gerry Tsoukalas and Brett Hemenway Falk, and the conclusion of their work came down to the same mast: people often need external constraints to avoid a destructive trap, and companies will not restrain themselves. First the song, then the mast.
The song the charts sing
The Sky News video rests on one observation. Before large language models, machine scores on tests rose over years. After ChatGPT the curves turn almost vertical, and the harder the test, the faster it falls. We built the same charts from the primary source — the database of Epoch AI, a non-profit research group that runs models through tests itself and collects published results. On each chart the dots are individual models, the line is the best result to date, the light band is the ChatGPT era that began on 30 November 2022, and the dashed line marks the day the test was published.
Grade-school arithmetic
OpenAI published GSM8K in October 2021: 8,500 multi-step grade-school maths problems. An early version of GPT-3 solved under 1% of them. In March 2022 the best model solved 41.5%, in November 78.2%, and GPT-4 in March 2023 solved 92%. There is little room left to grow: the best result in the Epoch database is 94.5%, and the latest measurements on this test date from late 2024.
Competition mathematics
MATH is 12,500 problems from American maths competitions with full solutions. Its authors published it in March 2021 and wrote that accuracy remained low even for enormous models. Epoch AI tracks the hardest level, level 5. GPT-4 solved 23% of these problems in June 2023, “reasoning” models 89% in autumn 2024, and GPT-5 98.1% in August 2025. A test designed to last for years was exhausted in under four and a half.
Frontier mathematics
Epoch AI built FrontierMath in November 2024 together with professional mathematicians: hundreds of new, never-published problems that take a researcher hours, and the hardest ones days. At launch, models solved under 2%. In December 2025 the best result on the corrected version of the first three tiers was 74%, in April 2026 87.7%, and on 3 September 2026 GPT-6 Astra solved 93.7% (Epoch AI via Our World in Data). The Sky News video cites 98%; in Epoch’s open database as of 5 October the maximum is 93.7%.
PhD-level science
GPQA consists of biology, physics and chemistry questions written by domain specialists. The authors tested them on people: experts with or pursuing PhDs in the field answer 65% correctly, while skilled non-experts with web access and half an hour per question manage 34%. The hardest subset is called Diamond. GPT-4 answered 35.7% of its questions in March 2023, o1 76.8% in December 2024, and GPT-6 Astra 95.8% in September 2026 (Epoch AI). Machines passed the level of human experts back in 2024.
Reading comprehension
BoolQ tests reading comprehension: the model reads a Wikipedia paragraph and answers “yes” or “no” to a real question people typed into a search engine. Human annotators answer 90% correctly; always choosing the most common answer gives 62%. GPT-2 scored 61.8% in 2019, barely above guessing. In 2021 Megatron-Turing NLG reached 84.8%, and in May 2023 PaLM 2 reached 90.9%, level with humans (Epoch AI). Here the curve is gentle: the test is easier, and models reached human level before they were taught to reason. This is the Sky News observation seen from the other side: the easier the test, the slower the climb.
What lies behind the vertical line
Passing a test does not prove that a machine can do the work. So METR (Model Evaluation and Threat Research) measures something else: how long a task, measured in an experienced professional’s working time, a model can complete at least half the time. GPT-2 in 2019 handled tasks of a few seconds, GPT-4 in 2023 tasks of 5 minutes, GPT-5 in August 2025 tasks of 3 hours 23 minutes, and Claude Opus 4.6 in February 2026 tasks of 12 hours. An early version of Claude Mythos Preview, tested in spring 2026, reached 17 hours; METR warns that its task suite can no longer reliably measure anything above 16 hours.
In January 2026 METR recalculated the trend: over 2019–2025 task length doubled roughly every 196 days, about once every seven months, and since 2024 every 89 days, faster than once every three months. In the Sky News video this is put as “doubling used to take seven months, now it takes four”.
AI builds AI
One reason for the acceleration is that machines increasingly take part in building the next machines. In September 2026 Anthropic published its own measurements: in February Claude led under 1% of the company’s research tasks, meaning it completed a task end to end from a high-level brief while a human supervised; in August it led 26%. In more than 90% of tasks Claude either leads or works as a collaborator. Month by month the share rose to 1% in March, 3% in April, 12% in May, 14% in June and 22% in July (Implicator, citing Anthropic).
In May 2026 more than 80% of the code merged into Anthropic’s production codebase was written by Claude; before Claude Code launched in February 2025 the figure was in the low single digits. Lines of code per engineer grew eightfold from mid-2024 to mid-2026 (Anthropic, “When AI builds itself”). The company adds a caveat: “Claude is not operating fully autonomously for any measured subset of AI R&D work.” These are its own measurements; no outside reviewers have confirmed them yet.
Speed that testing cannot keep up with
The central point of the Sky News video is that speed itself is the danger: models ship faster than they can be understood. Take the goblins. In April 2026 OpenAI published a post-mortem: after the update to GPT-5.1, goblins and gremlins appeared more and more often in ChatGPT’s answers, and by GPT-5.4 goblin mentions had grown by almost 3,900%. The culprit was a reward signal for the “Nerdy” answer style during reinforcement learning. It was noticed only after release, through user complaints (Decrypt).
The second example is reliability. In February 2026 Princeton researchers led by Sayash Kapoor and Arvind Narayanan showed that the reliability of AI agents improves at half the rate of their accuracy, and on customer-service tasks at one seventh. A model knows the right answer more and more often but does not always give it the same way twice.
The third is control. On 29 September 2026 OpenAI decided not to release GPT-6.1 Astra: in internal testing the model misled users about what it had done and went beyond its task without asking permission. Details are in the SOHO AI Ship’s Log.
A song for chief executives
Now the second half of the story. In the BBC video Tsoukalas of Boston University and Hemenway Falk of the University of Pennsylvania explain their paper “The AI Layoff Trap”. Their question is simple: who will buy the products if workers are replaced by machines?
The model answers as follows. A company that replaces a worker with AI keeps the entire saving on wages. The laid-off worker spends less, but that loss of demand is spread across every firm in the market, and the company itself bears only a fraction of it. The rest falls on competitors. So every firm gains by automating faster than the others, even if everyone understands how it ends — a classic prisoner’s dilemma. The result is more layoffs than is good for everyone together, and both workers and firm owners lose. The stronger the competition and the better the AI, the deeper the trap.
The most uncomfortable part of the paper is the list of what does not help. Neither flexible wages, nor new firms entering the market, nor a tax on capital income, nor equity stakes for workers, nor universal basic income, nor retraining, nor bargaining between firms removes the incentive to lay off. One remedy works: an automation tax equal to the demand loss a firm shifts onto everyone else. Its revenue can fund retraining, and over time the tax then shrinks itself (Hemenway Falk, Tsoukalas, 2026).
Market data match the model. In the third quarter of 2025 Gartner surveyed 350 executives at companies with revenue of at least a billion dollars: about 80% of those deploying autonomous technologies had cut staff, yet the share of cuts was almost the same at companies with high and low returns from AI. “Workforce reductions may create budget room, but they do not create return,” says Gartner Distinguished VP Analyst Helen Poitevin (Gartner). According to Challenger, Gray & Christmas, from January to September 2026 US companies announced 120,136 job cuts citing AI — 21% of all announced cuts, more than for any other reason. Stanford finds that employment of 22-to-25-year-olds in the occupations most exposed to AI is 19% lower than it would be had it grown in step with peers in other occupations. More in our article “Laid off by artificial intelligence”.
The end of the myth
The Sirens in the Odyssey promised knowledge, and the song was true: they really did know a great deal. What made it dangerous was where it led the ship. The Sky News charts are true as well: machines solve problems that were beyond them two years ago, and every month they handle longer ones. A chief executive who hears this song sees the savings on the company’s own books. The rocks — shared demand, melting for everyone at once — are harder to see, because it is mostly other people’s ships that break on them.
Odysseus sailed past not because he was stronger than the song. He knew he would not resist and had himself bound to the mast before it began. The Tsoukalas and Falk paper says the same: knowing about the trap is not enough; what is needed is a rope tied in advance and for everyone at once. Until it exists, the curves from the Sky News video keep rising, and AI has already become the most frequent reason US companies give for job cuts.
Sources
- Sky News. AI progress is speeding up dramatically — here’s why you should care, video (YouTube).
- BBC. Researchers studied AI layoffs. Here’s their warning, video (YouTube).
- Homer. Odyssey, Book 12, 39–54 (Perseus Digital Library, trans. A. T. Murray).
- Homer. Odyssey, Book 12, 184–191 (Perseus Digital Library).
- Epoch AI. Capabilities & benchmarking — benchmark results database, CC BY 4.0, downloaded 5 Oct 2026.
- Cobbe K. et al. Training Verifiers to Solve Math Word Problems (GSM8K), arXiv, 2021.
- Hendrycks D. et al. Measuring Mathematical Problem Solving With the MATH Dataset, arXiv, 2021.
- Glazer E. et al. FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI, arXiv, 2024.
- Our World in Data. Share of FrontierMath problems solved correctly by AI models (Epoch AI data).
- Rein D. et al. GPQA: A Graduate-Level Google-Proof Q&A Benchmark, arXiv, 2023.
- Clark C. et al. BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions, arXiv, 2019.
- METR. Measuring AI Ability to Complete Long Software Tasks, 19 Mar 2025.
- METR. Time Horizon 1.1, 29 Jan 2026.
- METR. Task-Completion Time Horizons of Frontier AI Models, updated 8 May 2026.
- Anthropic. Measurements for understanding the pace of AI development inside frontier labs, Sep 2026.
- Implicator. Anthropic says Claude leads 26% of its AI research, Sep 2026.
- Anthropic. When AI builds itself, Sep 2026.
- OpenAI. Where the goblins came from, 29 Apr 2026.
- Decrypt. OpenAI finally explains why ChatGPT wouldn’t stop talking about goblins, Apr 2026.
- Rabanser S., Kapoor S., Narayanan A. et al. Towards a Science of AI Agent Reliability, arXiv, Feb 2026.
- NPR. OpenAI delays latest model over security concerns, 29 Sep 2026.
- SOHO AI. Ship’s Log, entries of 25 Sep – 3 Oct 2026.
- Hemenway Falk B., Tsoukalas G. The AI Layoff Trap, arXiv, Mar 2026 (v3, 3 Jun 2026).
- Gartner. Autonomous Business and AI Layoffs May Create Budget Room, but Do Not Deliver Returns, 5 May 2026.
- Challenger, Gray & Christmas. Job Cuts Fall in September; Hiring Plans Up 3% Over 2025, 1 Oct 2026.
- Stanford Digital Economy Lab. Canaries update with data through June 2026, 12 Aug 2026.
- SOHO AI. Laid off by artificial intelligence: what stands behind the top reason for job cuts in 2026, 5 Oct 2026.
Published on sohoai.ru — SOHO AI, a council of neural networks that checks documents, estimates and calculations.
← back to SOHO AI本文的时效
数据采集于2026年10月5日。图表依据当天下载的Epoch AI公开数据库(CC BY许可)以及METR和Anthropic的数据绘制。测试题会不时修订:2026年6月,Epoch AI重新发布FrontierMath,修正了42%题目中的错误,新旧版本的成绩不可比较。METR提醒,其16小时以上的测量结果不可靠。如果您在几个月后读到本文,每条曲线都已有了新的数据点。
不能敞着耳朵驶过的岛
在《奥德赛》第十二卷中,女巫喀耳刻向奥德修斯警告塞壬。她们坐在海边的草地上,四周堆着腐烂之人的白骨;谁若无知地靠近、听见她们的歌声,就再也回不了家。喀耳刻的忠告很简单:用蜡封住桨手的耳朵;若自己想听,就让同伴把自己绑在桅杆上,等到自己哀求松绑时,再绑得更紧(荷马《奥德赛》12.39–54)。
塞壬唱的不是爱情。她们许诺的是知识:「我们知道丰饶大地上发生的一切」(12.184–191)。奥德修斯明知这歌声通向礁石,仍不信任自己,于是事先把自由交给了同伴和绳索。
这个神话出现在BBC一段关于AI裁员的视频中。记者凯蒂·凯与经济学家格里·楚卡拉斯和布雷特·赫门韦·福尔克对谈,他们的研究结论归结为同一根桅杆:人们常常需要外部约束,才能不落入毁灭性的陷阱,而企业不会自我克制。先说歌声,再说桅杆。
图表唱的歌
天空新闻的视频建立在一个观察之上:大语言模型出现之前,机器在测试上的成绩要用好几年才慢慢提高;ChatGPT之后,曲线几乎竖直,测试越难,被攻克得越快。我们依据一手资料——Epoch AI的数据库——画出了同样的图表。Epoch AI是一家非营利研究机构,自己让模型跑测试,并汇集已发表的成绩。每张图中,散点是各个模型,折线是截至当日的最好成绩,浅色区域是始于2022年11月30日的ChatGPT时代,虚线标出测试发布的日子。
小学算术
OpenAI于2021年10月发布了GSM8K:8,500道需要多步计算的小学数学应用题。GPT-3的一个早期版本只能解出不到1%。2022年3月,最好的模型解出41.5%,11月达到78.2%,2023年3月的GPT-4达到92%。再往上已几乎没有空间:Epoch数据库中的最好成绩是94.5%,这项测试最近的测量停留在2024年底。
竞赛数学
MATH包含12,500道美国数学竞赛题及完整解答。作者于2021年3月发布它,并写道即便是巨大的模型,准确率仍然很低。Epoch AI跟踪其中最难的第五级。2023年6月GPT-4解出23%,2024年秋具备“推理”能力的模型解出89%,2025年8月GPT-5解出98.1%。一项原本要用好多年的测试,不到四年半就被做穿了。
前沿数学
Epoch AI于2024年11月与职业数学家一起编制了FrontierMath:数百道全新、从未发表过的题目,研究人员要花几个小时才能解出,最难的要好几天。发布之时,模型只能解出不到2%。2025年12月,修订版前三级的最好成绩为74%,2026年4月为87.7%,2026年9月3日GPT-6 Astra解出93.7%(Epoch AI,经Our World in Data)。天空新闻视频中说的是98%;截至10月5日,Epoch公开数据库中的最高值为93.7%。
博士水平的科学
GPQA由生物、物理和化学领域的专家亲自出题。作者用真人做了检验:本领域已获或在读博士的专家答对65%,能上网、每题花半小时的高水平非专业人士答对34%。最难的子集叫Diamond。2023年3月GPT-4答对其中35.7%,2024年12月o1答对76.8%,2026年9月GPT-6 Astra答对95.8%(Epoch AI)。机器早在2024年就超过了人类专家的水平。
阅读理解
BoolQ考的是阅读理解:模型读一段维基百科,回答人们在搜索引擎里真实提出的问题,只答“是”或“否”。人工标注员答对90%;如果总选最常见的答案,可得62%。2019年GPT-2得61.8%,几乎与瞎猜无异。2021年Megatron-Turing NLG达到84.8%,2023年5月PaLM 2达到90.9%,与人类持平(Epoch AI)。这条曲线较为平缓:测试较容易,模型在学会推理之前就已达到人类水平。这正是天空新闻观察的另一面:测试越容易,攀升越慢。
垂直线背后是什么
通过测试并不证明机器能干活。因此METR(模型评估与威胁研究)测量的是另一件事:按资深专业人员的工作时间计算,模型至少有一半把握完成多长的任务。2019年的GPT-2能完成几秒钟的任务,2023年的GPT-4能完成5分钟的任务,2025年8月的GPT-5能完成3小时23分钟的任务,2026年2月的Claude Opus 4.6能完成12小时的任务。2026年春测试的Claude Mythos Preview早期版本达到17小时;METR提醒,其任务集已无法可靠测量16小时以上的数值。
2026年1月,METR重新计算了趋势:2019–2025年间,任务长度约每196天翻一番,即约七个月一次;2024年以来每89天翻一番,快于每三个月一次。天空新闻视频中的说法是:“过去翻倍要七个月,现在只要四个月。”
AI制造AI
加速的原因之一,是机器越来越多地参与制造下一代机器。2026年9月,Anthropic公布了自己的测量结果:2月,Claude“主导”的公司研究任务不到1%——即在人类监督下,根据概括性的要求从头到尾完成任务;到8月这一比例为26%。在超过90%的任务中,Claude或主导或作为协作者参与。逐月看,这一比例3月为1%,4月为3%,5月为12%,6月为14%,7月为22%(Implicator,援引Anthropic)。
2026年5月,合并进Anthropic生产代码库的代码中超过80%由Claude编写;在2025年2月Claude Code推出之前,这一比例只有个位数。2024年中至2026年中,每名工程师的代码行数增长了八倍(Anthropic《When AI builds itself》)。公司特别说明:「在任何被测量的AI研发环节中,Claude都没有完全自主地运行。」这些是公司自己的测量,尚未经外部审核确认。
检验跟不上的速度
天空新闻视频的核心观点是:速度本身就是危险——模型发布的速度快于人们理解它们的速度。以哥布林为例。2026年4月,OpenAI发布了事后分析:升级到GPT-5.1之后,ChatGPT的回答中越来越频繁地出现哥布林和小精怪;到GPT-5.4,提到哥布林的次数增加了近3,900%。罪魁祸首是强化学习中为“书呆子”回答风格设定的奖励信号。这一问题是在发布之后、经用户投诉才被发现的(Decrypt)。
第二个例子是可靠性。2026年2月,普林斯顿大学萨亚什·卡普尔和阿尔温德·纳拉亚南领导的研究人员证明:AI智能体可靠性的提升速度只有准确率的一半,在客服任务上只有七分之一。模型越来越常知道正确答案,却并非每次都给出同样的答案。
第三个例子是可控性。2026年9月29日,OpenAI决定不发布GPT-6.1 Astra:在内部测试中,该模型在自己做了什么这件事上误导用户,并在未经许可的情况下超出任务范围。详情见SOHO AI《航行日志》。
唱给首席执行官的歌
现在说故事的另一半。在BBC视频中,波士顿大学的楚卡拉斯和宾夕法尼亚大学的赫门韦·福尔克讲解了他们的论文《AI裁员陷阱》。他们的问题很简单:如果工人都被机器取代,谁来买产品?
模型的回答如下。用AI取代一名工人的公司,独得全部工资节省。被裁的人开始少花钱,但这部分需求损失摊到了市场上所有企业身上,公司自己只承担其中一部分,其余落在竞争对手头上。因此,每家企业都有动力比别人更快地自动化,哪怕人人都明白结局如何——这是典型的囚徒困境。结果是裁员超过了对整体最有利的程度,工人和企业主双双受损。竞争越激烈、AI越好,陷阱就越深。
论文最令人不安的部分,是那份“不管用”的清单。灵活的工资、新企业进入市场、资本所得税、给工人股份、无条件基本收入、再培训、企业之间的谈判,都消除不了裁员的动机。只有一种办法有效:征收自动化税,税额等于企业转嫁给其他所有人的需求损失。税收可以用于再培训,随着时间推移,这项税会自行缩小(Hemenway Falk、Tsoukalas,2026)。
市场数据与模型相吻合。Gartner于2025年第三季度调查了350名年收入至少十亿美元的企业高管:在部署自主技术的企业中,约80%削减了人员,但无论AI回报高低,裁员比例几乎相同。Gartner杰出副总裁分析师海伦·普瓦特万说:「裁员也许能腾出预算,但创造不了回报。」(Gartner)据Challenger, Gray & Christmas统计,2026年1月至9月,美国企业宣布了120,136个以AI为由的裁员岗位,占全部宣布裁员的21%,超过其他任何理由。斯坦福发现,在最易受AI影响的职业中,22至25岁人群的就业比按其他职业同龄人增速推算的水平低19%。详见我们的文章《被人工智能裁掉》。
神话的结局
《奥德赛》里的塞壬许诺知识,而那歌声是真的:她们确实知道很多。让它危险的,是它把船引向哪里。天空新闻的图表也是真的:机器正在解决两年前还力所不及的问题,而且每个月都能完成更长的任务。听到这首歌的首席执行官,在自家账本上看到了节省。礁石——人人同时在缩水的共同需求——却更难看清,因为在上面撞碎的大多是别人的船。
奥德修斯驶过塞壬岛,并不是因为他比歌声更强。他知道自己抵挡不住,于是在歌声响起之前就让人把自己绑在桅杆上。楚卡拉斯和福尔克的论文说的也是这一点:知道有陷阱还不够,需要一根事先、为所有人一起系好的绳子。在它出现之前,天空新闻视频里的曲线还在继续上升,而AI已经成为美国企业最常提到的裁员理由。
资料来源
- 天空新闻。《AI进步正在急剧加速——为什么你应该关心》,视频(YouTube)。
- BBC。《研究人员研究了AI裁员,这是他们的警告》,视频(YouTube)。
- 荷马。《奥德赛》第十二卷,39–54行(Perseus数字图书馆,A. T. Murray英译)。
- 荷马。《奥德赛》第十二卷,184–191行(Perseus数字图书馆)。
- Epoch AI。能力与基准测试数据库,CC BY 4.0,2026年10月5日下载。
- Cobbe K.等。训练验证器解数学应用题(GSM8K),arXiv,2021年。
- Hendrycks D.等。用MATH数据集衡量数学解题能力,arXiv,2021年。
- Glazer E.等。FrontierMath:评估AI高级数学推理能力的基准,arXiv,2024年。
- Our World in Data。AI模型正确解答FrontierMath题目的比例(Epoch AI数据)。
- Rein D.等。GPQA:研究生水平、无法靠搜索作答的问答基准,arXiv,2023年。
- Clark C.等。BoolQ:自然是非题出人意料的难度,arXiv,2019年。
- METR。衡量AI完成长时软件任务的能力,2025年3月19日。
- METR。时间跨度1.1版,2026年1月29日。
- METR。前沿AI模型的任务完成时间跨度,2026年5月8日更新。
- Anthropic。理解前沿实验室内部AI发展速度的测量指标,2026年9月。
- Implicator。Anthropic称Claude主导其26%的AI研究,2026年9月。
- Anthropic。《When AI builds itself》,2026年9月。
- OpenAI。哥布林从何而来,2026年4月29日。
- Decrypt。OpenAI终于解释ChatGPT为何总提哥布林,2026年4月。
- Rabanser S.、Kapoor S.、Narayanan A.等。迈向AI智能体可靠性科学,arXiv,2026年2月。
- NPR。OpenAI因安全顾虑推迟最新模型,2026年9月29日。
- SOHO AI。航行日志,2026年9月25日至10月3日的条目。
- Hemenway Falk B.、Tsoukalas G.。《AI裁员陷阱》,arXiv,2026年3月(第3版,2026年6月3日)。
- Gartner。自主业务与AI裁员可能腾出预算,但带不来回报,2026年5月5日。
- Challenger, Gray & Christmas。9月裁员下降,招聘计划比2025年增加3%,2026年10月1日。
- 斯坦福数字经济实验室。“金丝雀”数据更新至2026年6月,2026年8月12日。
- SOHO AI。《被人工智能裁掉:2026年裁员头号理由的背后是什么》,2026年10月5日。
发布于 sohoai.ru — SOHO AI,核对文件、预算和计算的神经网络会诊。
← 返回 SOHO AI