Anthropic пусна във вторник Claude Fable 5 – първата публична версия на своя дългоочакван и същевременно предизвикващ сериозни опасения модел Claude Mythos. Той е оборудван със защитни механизми, които трябва да попречат на потребителите да го използват за експлоатиране на уязвимости в киберсигурността или за разработване на биологични оръжия.

КЛЮЧОВИ ФАКТИ
- Компанията съобщи още, че ще пусне и друг, по-мощен модел – Claude Mythos 5, за „малка група киберзащитници и доставчици на инфраструктура“, които вече са имали достъп до Claude Mythos Preview.
- Anthropic твърди, че двата нови модела са по-добри в софтуерното инженерство, в задачи, свързани с обработка и анализ на знания, като финансов анализ, както и в задачи, които изискват работа с изображения и дълъг контекст.
- AI компанията заяви, че работи с правителството на САЩ, за да „разширява постепенно достъпа“ до по-усъвършенствания модел, за който твърди, че има „най-силните способности в областта на киберсигурността от всички модели в света“.
- Claude Fable 5 и Mythos 5 ще струват 10 долара за 1 млн. входящи токена и 25 долара за 1 млн. изходящи токена – приблизително двойно повече от цената на най-напредналите модели Claude Opus на Anthropic, които са налични в момента, но все пак под половината от цената, на която се предлагаше Claude Mythos Preview.
- Слуховете за очакваното пускане започнаха да се разпространяват, след като бюлетинът Sources първи съобщи, че Anthropic се готви да пусне публична версия със „значителни защитни механизми“ във вторник. По-късно информацията беше съобщена и от The Information.
КАК ЩЕ РАБОТЯТ ЗАЩИТНИТЕ МЕХАНИЗМИ НА CLAUDE FABLE?
Anthropic заяви, че Claude Fable ще бъде пуснат с нови системи за засичане на злоупотреби, включително опити за „джейлбрейк“ на модела с цел достъп до потенциално вредна информация. Тези системи, които Anthropic нарича „класификатори“, работят, като при засичане на определени теми пренасочват заявките към Claude Opus.
Класификаторите ще обхващат запитвания, свързани с киберсигурност, включително опити Claude да бъде използван за „агентско хакване“, както и определени въпроси по биология и химия, които биха могли да доведат до разработване на биологични оръжия. Третият класификатор е свързан с това, което Anthropic нарича „дестилация“ – опити Claude да бъде използван за създаване на конкурентни AI модели.
КЛЮЧОВА ИСТОРИЯ
Anthropic дава подробности за предстоящия си модел от месеци. Компанията го обяви през април, но тогава отказа да го пусне публично заради опасения, свързани със сигурността. Вместо това тя избра да предостави версия на група технологични компании като Apple, Microsoft и Google чрез Project Glasswing, за да бъдат идентифицирани уязвимости в киберсигурността.
Anthropic пусна публично Mythos малко повече от седмица след като конфиденциално подаде документи за първично публично предлагане. Според информации компанията се стреми да излезе на борсата по-късно тази година и в момента е оценявана на 965 млрд. долара след кръг на финансиране през май.
