Přeskočit na obsah
Open-science nástroje

AI nástroje pro metadata vědeckých modelů

Vyvíjel full-stackové nástroje pro správu metadat modelů strojového učení a AI workflow pro získávání strukturovaných informací z vědeckých PDF. Součástí řešení byla validace dat a automatizace napojená na GitHub.

Kontext
Nástroje pro metadata vědeckých modelů
Organizace
Ersilia
Role
Fullstack Developer
Období
2024–2025

Problém

Metadata modelů strojového učení potřebovala strukturovanou aplikaci a backend namísto nespojených ručních kroků.

Důležité informace z vědeckých PDF bylo potřeba získat ve formě, kterou lze zkontrolovat a použít v širším open-science workflow.

Omezení

Informace získané pomocí AI nebylo možné považovat automaticky za správné.

Aplikace musela zapadnout do existující spolupráce a práce s repozitáři na GitHubu.

Moje odpovědnost

Postavil jsem full-stackovou aplikaci v Next.js a TypeScriptu.

Navrhl jsem databázové schéma a backend pro strukturovaná metadata modelů.

Vyvinul jsem workflow pro vědecká PDF pomocí Vercel AI SDK.

Automatizoval jsem validaci metadat a synchronizaci repozitářů přes GitHub API a Actions.

Spolupracoval jsem přímo s výzkumníky a vývojáři v open-science týmu.

Přístup

Metadata jsem modeloval explicitně, aby aplikace, validace i práce s repozitáři sdílely stejný slovník.

AI extrakci jsem držel v kontrolovatelném workflow místo toho, aby se výstup modelu stal konečným zdrojem pravdy.

Pomocí GitHub automatizace jsem aplikaci napojil na repozitáře, se kterými už tým pracoval.

Klíčová technická rozhodnutí

Považovat výstup AI za vstup do validace

Vědecká PDF mají rozdílnou strukturu a výstup LLM je pravděpodobnostní.

Získat pomocí AI strukturované kandidáty a následně zachovat explicitní validaci a lidskou kontrolu.

Kontrola přidává tření, ale brání tomu, aby se nepodložená metadata stala autoritativními.

Napojit se na existující práci s repozitáři

Open-science tým už používal GitHub repozitáře jako součást svého pracovního modelu.

Automatizovat validaci a synchronizaci přes GitHub API a GitHub Actions místo vytváření samostatného publikačního procesu.

Výsledky

Dodal jsem full-stackové rozhraní a backend pro strukturovaná metadata modelů.

Propojil jsem AI analýzu PDF s explicitní validací.

Automatizací jsem omezil rozdíly mezi daty aplikace a GitHub workflow open-science týmu.

Reflexe

AI funkce jsou spolehlivé tehdy, když jsou datový model, validace a odpovědnost navrženy stejně pečlivě jako samotné volání modelu.

Hledáte někoho, kdo převezme odpovědnost za systémové hranice?

Jsem otevřený vybrané produktové práci a budoucím seniorním vývojářským příležitostem.

Kontaktovat