Elorian, un laborator de cercetare în inteligență artificială fondat de foști cercetători Google DeepMind și Apple, a ieșit din stealth cu o finanțare seed de 55 de milioane de dolari și un obiectiv tehnic foarte specializat: să construiască modele care raționează nativ în spațiul vizual, fără să treacă imaginile mai întâi prin limbaj. Compania, cu sediul în Palo Alto, susține că sistemele AI actuale au, în privința înțelegerii vizuale, inteligența unui copil de trei ani.
Cofondatorul Andrew Dai, care a petrecut 14 ani la Google și a lucrat la nucleul tehnologiilor din spatele modelelor Gemini, pornește de la premisa că modelele de la marile laboratoare sunt fragile atunci când trebuie să interpreteze conținut vizual. Alături de Yinfei Yang, expert AI venit de la Apple, Dai vrea să ridice raționamentul vizual al modelelor de la nivel de copil la nivel de adult.
Runda de 55 de milioane de dolari a fost făcută în colaborare de Striker Ventures, Menlo Ventures și Altimeter, cu participarea NVIDIA, a fondului 49 Palms și a unui grup de cercetători AI proeminenți, printre care Jeff Dean. Potrivit relatărilor, runda a fost structurată în două tranșe, cu o evaluare care a urcat la 300 de milioane de dolari post-money — o cifră excepțională pentru un stadiu seed.
Teza tehnică a Elorian atacă modul în care funcționează astăzi modelele vision-language (VLM). Acestea raționează în doi pași: întâi traduc input-ul vizual în limbaj, apoi efectuează raționament bazat pe text, uneori cu instrumente externe. Elorian susține că acest lanț este fragil și predispus la halucinații, fiindcă multe sarcini vizuale nu pot fi descrise precis sau concis în cuvinte. Rezultatul este că modelele de top eșuează la sarcini de visual grounding elementare, pe care copiii le rezolvă fără efort.
Compania distinge explicit între generare și raționament. Modele precum NanoBanana excelează la producerea de imagini și video, dar Elorian argumentează că această capacitate generativă nu se traduce în raționament despre conținutul vizual — „gândirea” care precedă generarea se sprijină tot pe modele de limbaj, nu pe o capacitate nativă de raționament vizual.
Abordarea: manipularea directă a reprezentărilor vizuale
Abordarea Elorian combină antrenarea multimodală cu arhitecturi noi, concepute special pentru raționament multimodal. În loc să trateze imaginile ca input-uri statice, echipa antrenează modelele să interacționeze direct cu reprezentările vizuale și să le manipuleze — interpretând structura, relațiile și constrângerile fizice din interiorul scenei. Dai a subliniat că datele sunt un element central: calitatea datelor, proporțiile de amestec, sursele și diversitatea contează, iar Elorian folosește date sintetice la scară largă pentru a reconstrui lanțul de raționament în spațiul vizual.
Elorian țintește industriile în care înțelegerea vizuală fiabilă este o precondiție: robotică, agenți autonomi, inspecție industrială, aerospațial, medicină și științe. Compania dă ca exemple un inginer care iterează un design pentru a produce un motor mai ușor sau o aripă mai silențioasă, modele care formează coloana vertebrală a unor sisteme robotice capabile să opereze în medii noi, sau transformarea imaginilor satelitare în informații utile pentru monitorizarea vremii, răspunsul la dezastre și agricultura de precizie.
Echipa și poziționarea în piață
Fondată în 2025, Elorian are o echipă restrânsă, de 11–50 de persoane. Pe lângă Dai și Yang, printre cofondatori se numără Seth Neel, fost Assistant Professor la Harvard și specialist în date și AI. Dai are licență în informatică la Cambridge și doctorat în machine learning la Edinburgh, iar la Google a coautorat lucrarea „Semi-supervised Sequence Learning” împreună cu Quoc V. Le, precum și „Scaling up visual and vision-language representation learning with noisy text supervision”.
Pariind pe profunzime într-o singură modalitate în loc să concureze frontal cu laboratoarele generaliste, Elorian intră pe un teren unde activează deja World Labs, axat pe inteligență spațială, și Galileo AI, concentrat pe generare de design. Compania nu a generat încă venituri și poartă discuții cu potențiali clienți din robotică și automatizare industrială, cu pilotări timpurii așteptate să testeze performanța în condiții reale.


