Работа

Более компактная модель с лучшей архитектурой

Я сравнил четыре комбинации: меньшие и большие языковые модели, каждая с графом знаний и без него. Оценка охватила многоэтапные вопросы, разрешение неоднозначности сущностей, операции над множествами, область документа, обоснованность, стоимость и задержку.

Полезный результат был не в том, что меньшие модели всегда выигрывают. Они не выигрывают. Результат в том, что архитектура может иметь большее значение, чем размер модели. В 35 прямых тестах Llama 3.1 8B с инструментами для графов превзошла Llama 3.3 70B без них: оценка на 55% выше, входные токены по $0,075 вместо $1,00 за миллион и средняя задержка 2,9 секунды вместо 8,8. Она также произвела проверяемую цепь вызовов инструментов для каждого ответа, чего одна модель 70B не смогла.

Я опубликовал методологию, результаты по категориям, ограничения и дизайн системы, потому что компромисс более полезен, когда его может изучить кто-то другой.