Оплата за виклик змінює економіку пілота
Оренда виділеного GPU вигідна тільки тоді, коли його вдається завантажувати передбачувано й постійно. Для невеликого продукту з нерівномірним трафіком — кілька запитів вночі, сплеск удень — постійно орендований прискорювач більшу частину часу простоює, але й далі коштує грошей. Serverless-модель інференсу перекладає оплату на фактичний виклик, а платформа сама масштабує кількість активних інстансів до нуля в тихі періоди. Це знижує поріг входу для команд, які ще не знають точного профілю навантаження свого продукту, і дає змогу тестувати гіпотезу без довгострокового контракту на обладнання.
Холодний старт стає новим вузьким місцем
Масштабування до нуля означає, що перший запит після паузи повинен підняти контейнер, завантажити модель у пам’ять прискорювача і лише тоді відповісти. Для великих моделей цей час може сягати секунд, що неприйнятно для інтерактивного сценарію. Платформи пропонують часткові рішення: тримати мінімальну кількість «теплих» інстансів, кешувати ваги моделі ближче до прискорювача або дозволяти клієнту заздалегідь «розігріти» середовище. Команді потрібно вимірювати не середню, а найгіршу затримку і чесно вирішити, чи прийнятна вона для конкретного сценарію використання. Порівняння варто починати з питання, коли оренда GPU у хмарі перестає бути вигідною, а щільність обчислень пов’язана з новими системами охолодження дата-центрів.
Контроль над версією моделі не зникає повністю
Serverless не означає відмову від відповідальності за те, яка саме версія моделі відповідає користувачу. Потрібні той самий контроль версій, поступове розгортання нової моделі на частці трафіку і можливість швидко відкотитися, що й у власній інфраструктурі. Платформа також визначає, які формати моделей і апаратні прискорювачі підтримуються, тому міграція між постачальниками рідко буває безшовною. Перед вибором варто перевірити, чи можна експортувати ваги моделі й конфігурацію у формат, який приймуть інші середовища виконання.
Вибір залежить від профілю навантаження, а не хайпу
Serverless GPU-інференс найкраще підходить для нерівномірного або ще не вивченого навантаження, де головна мета — швидко перевірити продукт без капітальних витрат. Для стабільного, передбачуваного й великого обсягу запитів виділений або зарезервований прискорювач зазвичай виходить дешевшим за одиницю виконаної роботи. Розумний шлях — почати з serverless-варіанту, зібрати реальні дані про частоту й розмір запитів протягом кількох місяців, а тоді порівняти фактичну вартість із альтернативою власного або зарезервованого обладнання, а не приймати рішення наперед за загальними міркуваннями.




Коментарі
Щоб залишити коментар, увійдіть через Google або Facebook.