מי אנחנו

אנחנו חוקרים ומריצים מודלים פתוחים על GPU אמיתי.

מריצים מודלים פתוחים על המכונות שלנו ומכווננים אותם על העומס שלכם. משם יוצאים גם מוצר וגם שירותים.

בלי סיסמאות שיווקיות. המטרה פשוטה: שהמודלים ירוצו הכי מהר שאפשר, יהיו מדויקים איפה שצריך, ויפתרו בעיות אמיתיות בעבודה היומיומית של העסק.

אם המוצר שלכם רץ על LLM, חשבון ה-API הוא עלות אספקת השירות שלכם. הוא גדל עם כל לקוח שאתם מביאים, והמחיר נקבע במקום אחר. אנחנו מעבירים את העבודה הזו לחומרה שאתם שולטים בה, בעלות של אירוח עצמי, עם מודלים מכווננים בדיוק למה שאתם עושים.

צוותים שעושים את זה ברצינות מגיעים לכשליש ממה ששילמו, עם מודלים טובים יותר מאלה שהתחילו איתם, והחומרה ממשיכה לעבוד גם אחרי שסיימתם לשלם עליה.

אותה תשתית משמשת גם לעבודה בתוך העסק: מענה ללקוחות, ניירת ומסמכים, וידע של החברה שנשאר מעודכן. ואם העומס שלכם קטן, אפשר פשוט להתחיל מה-API שלנו.

למי זה מתאים: למייסדים, מנכ״לים וצוותי מוצר שרוצים agents שמורידים עומס תפעולי, מענה ללקוחות, מסמכים וידע ארגוני, וחותכים את חשבון ה-API. וגם ל-CTOs ולצוותי פיתוח שרוצים חומרה משלהם, כרטיס 5090 או שניים, ולהריץ עליה מודלים פתוחים בביצועים מקסימליים.

אנחנו לא כאן כדי להתקין עוד "צ׳אט פרטי".אנחנו בונים את מה שהעסק שלכם באמת צריך.

  • מערכת של agents
  • מישהו שמטפל בלקוחות
  • טריאז׳ בזמן משבר
  • סידור ניירת ומסמכים
  • ידע של החברה שמתעדכן כל יום
  • עוזר פנימי זה רק אפשרות אחת

hello@tiyuvta.aiלדבר עם מהנדסWhatsApp 0589723872

מה רץ ב-API

inference.tiyuvta.ai
מספרי Inference API
מודלקלט / Cache / פלט (ל-1M)שיא tok/sTTFT
GLM-5.3-Flash$0.15 / $0.03 / $0.50עד 179לא מפורסם

אלה המספרים של ה-endpoint שרץ עכשיו. הוא מתאים לפיתוח מהיר ולחיבור מיידי למוצר.

TTFT הוא הזמן עד לטוקן התוכן הראשון. המדידה נעשית על שרת ההגשה עצמו, כשמצב reasoning כבוי.

אלה הנתונים של ה-endpoint המשותף, שבו גם בקשות של משתמשים אחרים רצות על אותם כרטיסים. מכונה ייעודית, שלכם או שלנו, נותנת יותר מזה. הפער הזה הוא בדיוק הסיבה לעבור.

העבודה

מודלים מכווננים לנתונים שלכם, על חומרה שאתם שולטים בה

מכווננים מודלים פתוחים על הסכמות, הטרמינולוגיה והשפה שלכם, בונים סביבם את הפייפליין, ומריצים את הכל על כרטיסים שאתם שוכרים או קונים. ואז נשארים איתכם לאורך השנה, ומכווננים שוב כשיוצאים מודלים טובים יותר.

  • חותכים את עלות אספקת השירות של מוצר LLM: אותה עבודה, בעלות של אירוח עצמי
  • מערכות agents שעושות עבודה אמיתית: לקוחות, מסמכים, ידע ארגוני
  • fine-tune על הנתונים שלכם, באירוח אצלנו או במסירה לשרתים שלכם
  • הכרטיסים שלכם, הכיוונון שלנו, והמספרים מוכחים על החומרה שלכם

מתחילים כאן

Inference API

מפתח תוך דקות, תשלום לפי שימוש, תואם OpenAI, על המכונות שלנו. אם העומס שלכם קטן, זה כל מה שאתם צריכים, ובדרך כלל זול יותר ממה שאתם משלמים היום.

  • המודלים הפתוחים שלנו זמינים מיד, בקריאת API אחת
  • בלי להיכנס בכלל לחומרה
  • אותה עבודת כיוונון שאנחנו עושים ללקוחות שגדלו מעבר לזה
קבלו מפתח

הראיות

Lab

אנחנו חוקרים את מנוע ההגשה ומכווננים אותו לכל חומרה ולכל מודל. הכתיבה פומבית, ולכל מספר שאנחנו מפרסמים יש את המכונה שעליה נמדד ואת הלוג הגולמי.

  • מחקר טכני ומדידות ביצועים מהחומרה
  • טענות שאפשר לשחזר, לא סיסמאות

כתיבה ומחקר

כותבים כשיש תוצאות ומדידות מהשטח. המאמרים הטכניים מתפרסמים בינתיים באנגלית.

לקריאה בבלוג

ספרו לנו מה אתם מריצים, ונגיד לכם כמה זה צריך לעלות.

hello@tiyuvta.aiלדבר עם מהנדסWhatsApp 0589723872