ריצת מעבדה · 8 באוקטובר 2026 · בארכיון
ריצת מעבדה #1
תוצאות ראשונות שאפשר לפרסם. ההיקף ברור: מודלי Cloudflare Workers AI בחשבון שלנו — לא Ideogram, Midjourney, Otter או אפליקציות צרכניות אחרות. הן נשארות NOT YET TESTED. עמודי «הכי טובים» נשארים בלי דירוג.
מסקנה בשפה פשוטה
מבין מודלי יצירת התמונות ב־Workers AI שבדקנו הערב על פוסטרים עם טקסט מדויק וספירת עצמים, הוביל FLUX.2 [klein] 4B (ספירה 3/3, טקסט בפוסטר 2/3, תווית קפה 1/3). FLUX.1 [schnell] עמד בספירה ב־1/3 ובטקסט מדויק ב־0/3. SDXL Base 1.0 ו־SDXL-Lightning קיבלו 0/3 בכל משימה.
על הקלטה סינתטית STT-01-TTS (23.8 דקות, 4 דוברים), whisper-large-v3-turbo הגיע ל־WER של 2.3%, whisper-tiny-en ל־3.0%, ו־whisper ל־5.3% (עם מנרמל Whisper). שלושתם מצאו 12/12 עובדות מוזרעות. המודלים האלה לא מחזירים דיאריזציה.
היקף ושיטה
- נתיב גישה: Cloudflare Workers AI בחשבון TaskVerdict, דרך Pages Function פרטי שקורא ל־env.AI.run.
- ניקוד תמונות: OCR אוטומטי (Tesseract) + בדיקה ויזואלית של סוקר מעבדת TaskVerdict (סוקר מעבדה אחד; לא פאנל של שני בני אדם).
- ניקוד תמלול: מנרמל Whisper + WER. שליפת עובדות מוזרעות מול answer_key.json.
- הקלטה: קולות TTS סינתטיים באולפן נקי. בפגישות אמיתיות זה בדרך כלל יהיה קשה יותר.
- עלות: כ־4525.5 נוירונים משוערים (מכסה חינמית 10,000 ליום). חיוב בדולרים: 0.
מודלים שנבדקו / שדולגו
רשימה מלאה, כולל סיבות לדילוג (תנאי Deepgram אוסרי benchmarking; מודלי Leonardo/FLUX.2-dev/klein-9b חרגו ממכסת הנוירונים החינמית), בעמוד האנגלי וב־manifest.json.
תוצאות תמונה
| מודל | ספירה (3 תפוחים + 2 בננות) | טקסט מדויק בפוסטר | טקסט מדויק על שקית קפה |
|---|---|---|---|
| cf-flux-2-klein-4b | 3/3 | 2/3 | 1/3 |
| cf-flux-1-schnell | 1/3 | 0/3 | 0/3 |
| cf-sdxl-base-1-0 | 0/3 | 0/3 | 0/3 |
| cf-sdxl-lightning | 0/3 | 0/3 | 0/3 |
כל התמונות הגולמיות
cf-flux-2-klein-4b
cf-flux-1-schnell
cf-sdxl-base-1-0
cf-sdxl-lightning
תוצאות תמלול (STT-01-TTS)
| מודל | WER | עובדות | תמלול |
|---|---|---|---|
| cf-whisper-large-v3-turbo | 2.30% | 12/12 | הורדה |
| cf-whisper-tiny-en | 3.01% | 12/12 | הורדה |
| cf-whisper | 5.34% | 12/12 | הורדה |
This is NOT a ranking of consumer apps (Ideogram, Midjourney, Otter, etc.). Those remain NOT YET TESTED. Category /best/ pages stay unranked.