כלי · בדיקות תוכנה / בוטים ל-Telegram / אפליקציות LLM
TG-Probe
2025 · כלי · Python 3.11+, Telethon
כלי AI לבדיקות אוטומטיות של בוטים ב-Telegram, ובמיוחד בוטים מבוססי LLM: תרחישים, חקירה, מתקפות, רגרסיה.
TG-Probe מתנהג כמו משתמש רגיל ומריץ תרחישי YAML מול כל בוט ב-Telegram, ובמצב חקירה ה-AI עובר על הבוט בעצמו ובונה גרף מצבים. מצב adversarial נפרד בודק את עמידות בוטי ה-LLM מפני prompt injection ו-jailbreak, ומצב רגרסיה משווה את התשובות מול קו בסיס. דוחות ב-JSON / HTML / JUnit ודוגמאות ל-GitHub Actions ול-GitLab CI.
המשימה
קשה לבדוק בוטים ב-Telegram באופן אוטומטי, ובמיוחד בוטי LLM: התשובות אינן דטרמיניסטיות, והממשק הוא צ'אט חי.
מה בפנים
- מצב תרחישים: תרחישי YAML עם בדיקות תנאים (הכלת טקסט, כפתורים, זמן תגובה)
- מצב חקירה: ה-AI חוקר את הבוט באופן אוטונומי ובונה גרף מצבים
- מצב adversarial: prompt injection, jailbreaks ווקטורי תקיפה נוספים
- מצב רגרסיה: השוואה מול קו בסיס (baseline)
- Dual-LLM: אורקסטרטור (Claude Sonnet 4) + מבצע (Gemini 2.5 Flash) דרך OpenRouter
- CLI (init / auth / run / explore / attack / baseline / validate), דוחות ב-JSON, HTML, JUnit ובקונסול
תרגום מכונה — בהגהה.