AI nástroje pro metadata vědeckých modelů
Vyvíjel full-stackové nástroje pro správu metadat modelů strojového učení a AI workflow pro získávání strukturovaných informací z vědeckých PDF. Součástí řešení byla validace dat a automatizace napojená na GitHub.
- Kontext
- Nástroje pro metadata vědeckých modelů
- Organizace
- Ersilia
- Role
- Fullstack Developer
- Období
- 2024–2025
Problém
Metadata modelů strojového učení potřebovala strukturovanou aplikaci a backend namísto nespojených ručních kroků.
Důležité informace z vědeckých PDF bylo potřeba získat ve formě, kterou lze zkontrolovat a použít v širším open-science workflow.
Omezení
Informace získané pomocí AI nebylo možné považovat automaticky za správné.
Aplikace musela zapadnout do existující spolupráce a práce s repozitáři na GitHubu.
Moje odpovědnost
Postavil jsem full-stackovou aplikaci v Next.js a TypeScriptu.
Navrhl jsem databázové schéma a backend pro strukturovaná metadata modelů.
Vyvinul jsem workflow pro vědecká PDF pomocí Vercel AI SDK.
Automatizoval jsem validaci metadat a synchronizaci repozitářů přes GitHub API a Actions.
Spolupracoval jsem přímo s výzkumníky a vývojáři v open-science týmu.
Přístup
Metadata jsem modeloval explicitně, aby aplikace, validace i práce s repozitáři sdílely stejný slovník.
AI extrakci jsem držel v kontrolovatelném workflow místo toho, aby se výstup modelu stal konečným zdrojem pravdy.
Pomocí GitHub automatizace jsem aplikaci napojil na repozitáře, se kterými už tým pracoval.
Klíčová technická rozhodnutí
Považovat výstup AI za vstup do validace
Vědecká PDF mají rozdílnou strukturu a výstup LLM je pravděpodobnostní.
Získat pomocí AI strukturované kandidáty a následně zachovat explicitní validaci a lidskou kontrolu.
Kontrola přidává tření, ale brání tomu, aby se nepodložená metadata stala autoritativními.
Napojit se na existující práci s repozitáři
Open-science tým už používal GitHub repozitáře jako součást svého pracovního modelu.
Automatizovat validaci a synchronizaci přes GitHub API a GitHub Actions místo vytváření samostatného publikačního procesu.
Výsledky
Dodal jsem full-stackové rozhraní a backend pro strukturovaná metadata modelů.
Propojil jsem AI analýzu PDF s explicitní validací.
Automatizací jsem omezil rozdíly mezi daty aplikace a GitHub workflow open-science týmu.
Reflexe
AI funkce jsou spolehlivé tehdy, když jsou datový model, validace a odpovědnost navrženy stejně pečlivě jako samotné volání modelu.
Související práce
Hledáte někoho, kdo převezme odpovědnost za systémové hranice?
Jsem otevřený vybrané produktové práci a budoucím seniorním vývojářským příležitostem.
Kontaktovat