יום שישי, 2 באוקטובר 2026 מתעדכן אוטומטית כל שעה
→ חזרה למהדורה

Basecamp Research גייסה 140 מיליון דולר כדי ללמד AI ביולוגיה מתוך נתוני אבולוציה

הסטארטאפ הלונדוני Basecamp Research גייס 140 מיליון דולר, בין היתר מאנבידיה ומקרן Anthology של אנתרופיק. החברה מאמנת מודלי AI על חומר גנטי של מיקרואורגניזמים שנאספו ביערות גשם, באוקיינוסים ובמעיינות חמים, כדי לתכנן אנטיביוטיקות וכלים לטיפולים תאיים. בינתיים יש לה תוצאות מעבדה ונתונים מעכברים בלבד.

חברת Basecamp Research מלונדון גייסה 140 מיליון דולר כדי להמשיך לפתח מודלי AI שלומדים ביולוגיה מתוך מגוון החיים על כדור הארץ. לפי החברה, קרן S32 הובילה את הסבב. השתתפו בו גם אנבידיה, קרן Anthology של אנתרופיק, קרן החדשנות של נאט"ו ו-Redalpine, לצד משקיעים נוספים.

החברה, שנוסדה ב-2020, מאמנת מודלים על חומר גנטי של מיקרואורגניזמים מבתי גידול שכמעט לא נחקרו. המטרה היא לתכנן בעזרתם אנטיביוטיקות וכלים לטיפולים תאיים. את הכסף היא מתכוונת להשקיע בהמשך הפיתוח של משפחת המודלים הביולוגיים שלה, EDEN, ובקידום מועמדים טיפוליים משלה לקראת פיתוח קליני.

טיפול גנטי בתוך הגוף

בשלב הראשון החברה מתמקדת בטיפולים תאיים. בטיפולים כאלה משנים גנטית את התאים של המטופל, למשל כדי שיוכלו להילחם בסרטן. Basecamp רוצה לבצע את השינוי הזה ישירות בתוך הגוף. הרעיון הוא שהמודלים ילמדו מהגנומים של המיקרואורגניזמים דפוסים שאפשר לנצל לצרכים רפואיים.

הדרך עוד ארוכה. לפי הכתבה, בשלב זה יש לחברה תוצאות מעבדה ונתונים מניסויים בעכברים. הם עדיין לא מראים אם הגישה יכולה להוביל לטיפולים בטוחים ויעילים בבני אדם.

בעיית הנתונים של הביולוגיה

"בהתחשב במורכבות של הביולוגיה, אנחנו פשוט צריכים סדרי גודל יותר נתונים", אמר CTO החברה, פיליפ לורנץ, בראיון ל-THE DECODER. לדבריו, העיקר הוא לשלב איסוף נתונים בהיקף עצום עם ניסויים קטנים וממוקדים.

כדי להמחיש את הפער, לורנץ מסתמך על הערכה של Epoch AI. לפיה, כל המילים שקיימות בעולם מסתכמות לכל היותר בכחמישה קוודריליון tokens (יחידות הטקסט שמודלי שפה מעבדים). ב-Basecamp מעריכים שמספר הנוקלאוטידים, אבני הבניין של ה-DNA, על פני כדור הארץ הוא 10 בחזקת 37. "אם תיקח חפיסה של 10 בחזקת 37 קלפי פוקר, הערימה תקיף את היקום הנצפה מיליון פעמים", אמר.

לדבריו, מאגרי הגנומים הציבוריים משקפים רק חלק קטן מהטבע. לפי מאמר המחקר של החברה על מאגר BaseData שלה, כ-68% מנפח הרצפים ב-Sequence Read Archive מגיעים מחמישה מינים בלבד, ובני אדם לבדם אחראים לכ-54%. "אם היית מאמן LLM רק על כתבות עיתון מ-1975, הוא היה מודל גרוע מאוד", אמר לורנץ בחקר מקרה שפרסמה מיקרוסופט, שותפת הענן של החברה. "זה בערך המצב שלנו בביולוגיה."

15 טריליון tokens של DNA

לכן Basecamp אוספת דגימות בעצמה, יחד עם שותפי מחקר מקומיים: מקרקע של יערות גשם, מאדמה וולקנית וממעמקי הים ליד אנטארקטיקה. לפי הודעת הגיוס, הרשת פרוסה כיום ביותר מ-30 מדינות ובכל שבע היבשות. לפי מיקרוסופט משתתפים בה 208 ארגונים מ-31 מדינות.

לדברי לורנץ, בזמן הראיון המאגר הכיל כ-15 טריליון tokens. זה סדר גודל דומה למאגרי הטקסט שעליהם מאמנים מודלים כמו Claude או GPT, אלא שכאן כל token הוא אבן בניין יחידה של DNA. לפי מיקרוסופט, הדור הראשון של EDEN אומן על 9.7 טריליון אבני בניין כאלה, מיותר ממיליון מינים שרוצפו לראשונה. האימון נעשה עם חוקרי מיקרוסופט על Azure. על פי הדיווח, כוח המחשוב שלו היה דומה לזה של GPT-4, אם כי OpenAI מעולם לא פרסמה את הנתון הזה באופן רשמי. בשנה וחצי הקרובות המאגר אמור לגדול בערך פי מאה.

למה זה חשוב

לאחרונה דיווח ה-Wall Street Journal שחברות התרופות משקיעות מיליארדים ב-AI, אבל עדיין אין הרבה ראיות מוצקות לשיפור ניכר בשיעורי ההצלחה בפיתוח הקליני. לורנץ לא רואה בזה סיבה לפקפק בטכנולוגיה. לדבריו, הביולוגיה היא בעיה "הרבה, הרבה, הרבה יותר מסובכת וגדולה" מהשפה.

ההימור של Basecamp הוא ככל הנראה שאותו עיקרון שהצליח במודלי השפה, יותר נתונים ויותר מגוונים, יעבוד גם בביולוגיה. השתתפות של אנבידיה ושל קרן Anthology של אנתרופיק בסבב מצביעה, כנראה, על כך ששחקני AI מרכזיים רואים בנתונים ביולוגיים את החזית הבאה לאימון מודלים. עם זאת, הציונים הטובים שמודלים כאלה מקבלים על הנייר עדיין לא מבטיחים מולקולות טובות, והמבחן האמיתי יגיע רק בניסויים בבני אדם.

💬 יש לכם הערה על הכתבה?
פרסומת

→ לכל הכתבות