DeepSWE підкорює лідерборд ШІ-кодування: GPT-5.5 на вершині, Claude Opus розкрив слабке місце тесту

Протягом місяців провідні бенчмарки для розробки коду на основі штучного інтелекту (ШІ) розповідали компаніям заспокійливу, але оманливу історію: найпотужніші моделі мають приблизно однакові можливості. Сімейство GPT від OpenAI, Claude Opus від Anthropic та Gemini від Google DeepMind демонстрували близькі результати…








