Georgi Gerganov
Zavedením efektivní CPU inference a formátu GGUF v podstatě sám odstartoval moderní éru lokálních LLM
Autor revolučních knihoven llama.cpp a whisper.cpp.
Daniel Han a Michael Han (Unsloth AI)
Tvůrci knihovny Unsloth, která dramaticky zrychluje a zefektivňuje lokalizovaný fine-tuning (dolaďování) modelů na jediné GPU.
Jeffrey Morgan (jmorg)
Zakladatel a hlavní tvář projektu Ollama.
Tri Dao
Vynálezce algoritmů FlashAttention (1, 2 a novějších verzí). Jeho optimalizace matematických výpočtů v kontextovém okně dramaticky zrychlila běh všech moderních LLM na lokálních GPU.
Jon Durbin
Stojí za rodinou modelů Airoboros. Patří mezi průkopníky metod vytváření syntetických dat pro trénování vysoce kvalitních open-weight modelů nezávislými vývojáři.
Teknium (Nous Research)
Spoluzakladatel a hlavní engine výzkumné skupiny Nous Research. Stojí za zrodem legendárních lokálních modelů řady Hermes (např. OpenHermes), které dlouhodobě překonávaly základní modely v logice a kreativitě.
Eric Hartford
Evangelista konceptu "Uncensored AI". Vytvořil první populární odblokované verze modelů (WizardLM-Uncensored atd.), čímž otevřel diskuzi o svobodě slova, bezpečnosti a osobní odpovědnosti při provozu AI doma. Založil tím hnutí za svobodné, uživatelem kontrolované AI asistenty.
Clem Delangue (Hugging Face)
Spoluzakladatel a CEO Hugging Face. Jeho platforma je doslova „Mekkou“ lokálního AI hnutí. Poskytuje infrastrukturu pro sdílení modelů, repozitářů a komunitní žebříčky (Open LLM Leaderboard)
Moderátoři r/LocalLLaMA (např. u/u2berggeist a další)
Subreddit r/LocalLLaMA je celosvětovým centrem, kde se potkávají špičkoví inženýři s nadšenci. Lidé stojící za správou tohoto fóra udržují nejvýznamnější informační uzel celého odvětví.
Nathan Lambert (Interconnects / Allen Institute for AI)
Výzkumník a autor vlivného newsletteru Interconnects. Poskytuje hluboké analytické pohledy na politiku open-source AI, RLHF (trénování lidskou zpětnou vazbou) a reálné schopnosti otevřených modelů.
Mirasoda / Arcee AI team
Tým stojící za konceptem SLM (Small Language Models) a doménově specifickým slučováním modelů (Model Merging). Dokázali, že správným spojením menších lokálních modelů lze dosáhnout výkonu drahých gigantů.
====================================
Navrhli architekturu Transformer, na které stojí prakticky každé dnešní LLM, od Llamy po Mistral.
Uvnitř Mety prosazoval vydávání open-weight modelů. Llama (únor 2023) byla první silný model s dostupnými váhami a celá lokální scéna vznikla během několika týdnů po ní. Váhy Llamy 1 se k veřejnosti dostaly hlavně únikem z omezeného výzkumného přístupu, ne oficiálním vydáním.
llama.cpp (březen 2023) poprvé spustilo Llamu použitelně na CPU a běžném hardwaru i s kvantizací. Formát GGUF (srpen 2023) se stal standardem pro distribuci lokálních modelů.
Autor knihovny bitsandbytes, 8bitové kvantizace (LLM.int8()) a 4bitového fine-tuningu QLoRA. Díky němu se modely vejdou do VRAM spotřebitelských GPU a dají se na nich i dotrénovat.
Hugging Face je hlavní infrastruktura pro distribuci vah, datasetů a leaderboardů.
Ukázali, že z Llamy jde instrukčním laděním za zhruba 600 USD udělat chatbota. Autory byli Taori, Gulrajani, Zhang, Dubois, Li, Guestrin, Liang a Hashimoto (crfm.stanford.edu/2023/03/13/alpaca.html).
Mistral 7B vyšel pod licencí Apache 2.0, tedy bez omezení licence Llama, a překonal Llamu 2 13B. Mixtral zpopularizoval architekturu MoE pro lokální nasazení.
Jeho algoritmus zrychlil výpočet attention na GPU a snížil paměťové nároky. Je klíčový pro GPU inference a trénink, pro inferenci na CPU méně.
Spoluzakladatel Ollamy spolu s Michaelem Chiangem. Ollama je obálka nad llama.cpp, která zjednodušila instalaci na jeden příkaz a výrazně rozšířila počet uživatelů.
Unsloth výrazně zrychluje fine-tuning na jedné GPU a snižuje jeho paměťové nároky.
Stojí za modely Hermes / OpenHermes, které patřily k nejpoužívanějším komunitním fine-tunům.
Jeden z průkopníků syntetických instrukčních dat v komunitě.
Autor necenzurovaných variant modelů (WizardLM-Uncensored, Dolphin).
Firma prosazuje malé modely (SLM) a slučování modelů pomocí nástroje mergekit, který vytvořil Charles Goddard.
Edukační projekty (llama2.c, llm.c), učí lidi trénovat a spouštět LLM v čistém jazyce C od nuly.
=====================================
The AI Video Creator / Matthew Berman
Youtuber, který denně testuje nové open-source modely, benchmarkuje je na reálných úlohách a ukazuje běžným uživatelům, jak si doma postavit AI asistenty bez cloudu.
Chris Hay
Vývojář a tvůrce obsahu zaměřený na podnikovou integraci AI. Velmi srozumitelně propaguje lokální LLM, privátní RAG architektury a nasazení modelů bez odesílání firemních dat třetím stranám.
Alex Volkov
AI Evangelist ve Weights & Biases a tvůrce podcastu/newsletteru ThursdAI. Pravidelně mapuje novinky v open-source a nadšeně glosuje souboj mezi cloudovými a lokálními modely.
Prompt Engineering (Youtube kanál)
Jeden z nejlepších praktických kanálů zaměřených na technickou stránku věci: jak rozchodit lokální agenty, jak správně nastavit LM Studio či vLLM a jak z hardwaru dostat maximum tokenů za sekundu.
Ettore Di Giacinto
Zakladatel projektu LocalAI, což je zásadní open-source řešení pro firmy, které chtějí lokálně replikovat kompletní API ekosystém OpenAI (včetně textu, audia i obrázků) na vlastní infrastruktuře








