Prompt injection - модель не розрізняє «інструкції розробника» і «дані»: текст у листі, відгуку, PDF чи вебсторінці може містити «ігноруй попередні інструкції й...». Повністю цю проблему не розв'язано, тому захист будується так, ніби модель буде обдурена.
Принципи:
- модель - недовірений компонент. Її вивід - як введення користувача: валідувати, екранувати в HTML, не підставляти в SQL, шляхи, команди;
- мінімальні права інструментів: агент, що читає сторонній контент, не повинен мати інструментів з незворотними діями. Поєднання «читає пошту» + «надсилає листи» + «бачить приватні дані» - класичний сценарій витоку;
- авторизація в коді інструмента від імені реального користувача, а не «що попросила модель»;
- схвалення людиною (
Approvable) для грошей, видалення, зовнішніх відправок; - розділення даних і інструкцій: сторонній текст - окремим блоком з явною позначкою, що це дані. Знижує, але не усуває ризик;
- вихідні фільтри: не дозволяти моделі вставляти довільні посилання й зображення в HTML-відповідь - через них виводять дані (запит до
attacker.com/?data=...).
Контроль витрат:
Кожна відповідь містить використання токенів:
$response = SupportAssistant::make()->prompt($message);
$response->usage->inputTokens;
$response->usage->outputTokens;
$response->usage->cacheReadInputTokens;
Що робити з цими даними:
- записувати токени, модель і користувача для кожного виклику - без цього неможливо зрозуміти, хто й що коштує;
- ліміти на користувача й тариф - лічильник у Redis чи базі, перевірка перед викликом;
RateLimiterна маршрутах з AI - бот без обмежень може витратити місячний бюджет за ніч;#[MaxTokens]і#[MaxSteps]- верхня межа довжини відповіді й кількості викликів інструментів;- розмір контексту: історія розмови росте з кожним повідомленням, і кожен запит оплачує її знову. Обрізати історію чи стискати її в резюме;
- дешевша модель для простих задач:
#[UseCheapestModel]для класифікації й витягання даних, потужна - лише там, де потрібно міркування; - кешування: однакові запити (ембединги того самого тексту, резюме того самого документа) - зберегти результат, а не платити знову; кешування промптів у провайдера для довгого незмінного системного промпту;
- сповіщення про аномалії: різке зростання витрат за годину - сигнал про зловживання чи цикл.
Для персональних даних: не відправляти провайдеру більше, ніж потрібно для задачі, і знати, чи зберігає він дані й чи використовує їх для навчання - це питання договору й налаштувань облікового запису провайдера.