Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Otwarte modele wchodzą wyżej: projektowanie chipów, mowa i modele tabelaryczne w jednym tygodniu

OpenAI i Synopsys podpisały 30 września wieloletnią umowę na budowę GPT-Synopsys, wyspecjalizowanego modelu do projektowania chipów. To jedna z co najmniej pięciu premier lub partnerstw wokół modeli otwartych albo opisanych otwarcie, które ogłoszono w ostatnich dniach września.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 30 września 20268 min czytaniaŹródła 7
Otwarte modele wchodzą wyżej: projektowanie chipów, mowa i modele tabelaryczne w jednym tygodniu

Najnowszy ruch w pracy nad modelami otwartymi to nie wynik z benchmarku, a kontrakt. 30 września OpenAI i Synopsys ogłosiły, że podpisały wieloletnie partnerstwo strategiczne. Jego celem jest zbudowanie wyspecjalizowanego modelu AI do projektowania chipów o nazwie GPT-Synopsys. Synopsys sprzedaje narzędzia do automatycznej elektroniki, czyli oprogramowanie, którym inżynierowie rozrysowują układy. OpenAI licencjonuje te narzędzia na potrzeby projektu.

Deklarowany cel to model, który potrafi "rozumować o projektowaniu i weryfikacji chipów oraz bezpośrednio obsługiwać narzędzia Synopsys". Obie firmy mówią, że trwają już wczesne testy u klientów z branży półprzewodników, że dane klientów nie posłużą do trenowania i będą przechowywane zaszyfrowane, a produkt będzie wspólnie sprzedawany z podziałem przychodów. Prezes Synopsys Sassine Ghazi twierdzi, że AI może znacznie przyspieszyć proces projektowania. Współzałożyciel OpenAI Greg Brockman widzi w umowie drogę do lepszych chipów i lepszej AI.

To model zamknięty w komercyjnym łańcuchu. Ten sam tydzień przyniósł zupełnie inny typ premiery.

Małe modele, małe pliki, głośne deklaracje

Fermion Research wypuścił 30 września Phonon-2 i opisuje go jako najdokładniejszy otwarty model rozpoznawania mowy poniżej 900 MB. Firma twierdzi, że w pliku o rozmiarze 164 MB model dorównuje wynik w wynik swojemu pełnoprecyzyjnemu nauczycielowi o rozmiarze 2,5 GB, bije go na nagraniach ze spotkań i mowach parlamentarnych, a godzinę dźwięku zamienia w tekst w około 20 sekund na MacBooku Air. Wagi leżą na Hugging Face na licencji CC-BY-4.0, tej samej co NVIDIA Parakeet TDT 0.6B v3, od którego się wywodzą.

Ciekawa liczba to 5.21. Na siedmiu angielskich zbiorach z Open ASR Leaderboard Phonon-2 osiąga średnio 5,21 procent błędu na słowo, a każdy otwarty model z lepszym wynikiem jest co najmniej 5,8 razy większy, jak podaje firma w komunikacie. Waga każdego enkodera jest zapisana jako jeden z pięciu wyuczonych poziomów, upakowanych po pięć cyfr w systemie trójkowym na bajt, a dodatkowy bit przy każdej niezerowej wadze wybiera wartość. Daje to około 2,1 bita na zapisaną wagę. Firma twierdzi, że przewaga utrzymuje się w hałasie, od cichego pokoju po szum tła tak głośny jak mówiący, gdzie model pozostaje przed Parakeet Redux.

Niezależnego potwierdzenia w tym materiale nie ma. Pozycję w rankingu i deklarację o hałasie traktuj jako liczby producenta, dopóki ktoś ich nie odtworzy.

Tego samego dnia NVIDIA wystawiła na Hugging Face swój tabelaryczny model bazowy. NVIDIA Kumo Tabular to otwarty model bazowy dla danych tabelarycznych, który przewiduje etykiety nowych wierszy w jednym przebiegu w przód, bez trenowania, dostrajania i inżynierii cech, zarówno dla klasyfikacji, jak i regresji. Trenowano go wyłącznie na danych sztucznych, występuje w trzech rozmiarach od 28M do 215M parametrów, działa przez open source'ową bibliotekę structured-data-models firmy NVIDIA i jest wydany na licencji OpenMDW-1.1 dopuszczającej użycie komercyjne. NVIDIA mówi, że model zajmuje pierwsze miejsce w czterech benchmarkach: TabArena, BeyondArena, TALENT i ScoringBench.

Szczegóły architektury są tu mniej ważne niż sposób, w jaki się go sprzedaje. Pracę z danymi tabelarycznymi od dwóch dekad zdominowały drzewa wzmacniane gradientowo, a NVIDIA przekonuje, że wstępnie wytrenowany transformer potrafi przeczytać oznaczoną tabelę w kontekście i pominąć cały cykl zbierania etykiet, inżynierii cech i dostrajania hiperparametrów dla każdego zadania osobno. Model używa uwagi na kolumnach, wierszach i w kontekście, w nurcie TabICL i TabPFN, z temperaturą uwagi zależną od długości, żeby softmax nie rozmywał się, gdy tabela wnioskowania jest znacznie większa od tabeli treningowej. Braki danych nie wymagają uzupełniania.

Otwarte wagi od wolontariuszy i od instytutu państwowego

Dwie premiery z 30 września nie miały za sobą żadnej firmy albo miały państwową. Coop to mały model językowy wstępnie trenowany przez wolontariuszy, bez serwera, bez finansowania i bez demona. Pętla treningowa działa na oddanym sprzęcie konsumenckim oraz darmowych planach Hugging Face i GitHub Actions, jak podaje repozytorium na GitHubie. Etap 2 jest w toku: mniej więcej 145-milionowy transformer typu decoder-only trenowany od zera na FineWeb-Edu, z 12 warstwami, 14 głowami, d=896, kontekstem 1 024 tokenów i 32-tysięcznym bajtowym słownikiem BPE. Etap 1, model 15M na TinyStories, zakończył się po przekroczeniu optymalnego budżetu Chinchilli, ze stratą walidacyjną spadającą z 9,01 do 2,8 w ciągu sześciu dni.

Cały mechanizm jest tu historią. Workerzy pobierają aktualny checkpoint, wykonują lokalne kroki AdamW na osobistym fragmencie danych, liczą pseudogradient i zgłaszają go jako pull request do publicznego repozytorium danych na Hugging Face. Bezstanowe zadanie cron w GitHub Actions, zaplanowane co pięć minut, ale w praktyce odpalane w odstępach od kilku minut do kilku godzin, czyta checkpoint i otwarte pull requesty ze skrzynki, odrzuca zbyt stare zgłoszenia, przycina i bramkuje kosinusowo resztę, agreguje je średnią uciętą albo medianą geometryczną, wykonuje jeden zewnętrzny krok Niestierowa, wgrywa nowy checkpoint, dopisuje autorów do rejestru i zamyka przetworzone pull requesty.

Repozytorium mówi o ocenie wprost. Pojedyncza strata walidacyjna nic nie znaczy, bo zewnętrzne kroki podnoszą ją równie często, jak obniżają. Dlatego tabela wyników dopasowuje nachylenie po serii względem tokenów, a nie kroków zewnętrznych, i podaje je z błędem standardowym. "Spada" oznacza, że nachylenie przekracza dwa błędy standardowe. To uczciwsza zasada raportowania niż w większości laboratoriów z finansowaniem.

Tego samego dnia brytyjski Instytut Bezpieczeństwa AI i Meridian Labs opublikowały Inspect, otwartoźródłowe narzędzie do ewaluacji modeli frontier. Inspect obejmuje kodowanie, zadania agentowe, rozumowanie, wiedzę, zachowanie i rozumienie multimodalne, a w zestawie ma ponad 200 gotowych ewaluacji. Jego klocki to zbiory danych, solvery i oceniające. Obsługuje wywoływanie narzędzi, w tym narzędzi MCP oraz wbudowanych bash, python, wyszukiwania w sieci i komputera, uruchamia dowolnych zewnętrznych agentów, takich jak Claude Code, Codex CLI i Gemini CLI, i izoluje niezaufany kod modeli w Dockerze, Kubernetes, Modalu, Proxmoksie i Vagrancie przez API rozszerzeń. Termin jest wymowny. Narzędzia ewaluacyjne od rządowego instytutu bezpieczeństwa pojawiają się w tym samym tygodniu, w którym amerykański regulator otworzył branżowe śledztwo w sprawie niewłaściwego działania agentów AI.

Otwarte wagi wchodzą w chiński stos chipowy

Deepseek udostępnia otwartoźródłowe narzędzia programistyczne dla chipów AI Huaweia, jak podano na oficjalnym kanale Deepseek na WeChat, a Reuters potwierdził otwarcie kodu. Na pierwszym planie jest TileLang, otwartoźródłowy język programowania chipów AI stworzony pierwotnie przez badaczy z Uniwersytetu Pekińskiego, którego Deepseek używa od około roku i opisuje dziś jako główne narzędzie w pracy nad sztuczną inteligencją ogólną, jak podaje The New York Times.

Oprogramowanie zawiera biblioteki do obliczeń i do przenoszenia danych między chipami. Według Deepseek Huawei "w pełni wsparł" tę pracę, a obie firmy zoptymalizowały supernode, klaster 128 chipów Ascend 950. Deepseek przekonuje, że kto chce zbudować niezależny ekosystem programistyczny dla chipów AI, ten najpierw potrzebuje uniwersalnego języka, łatwego w programowaniu, ale nadal wydobywającego pełną wydajność ze sprzętu, i twierdzi, że TileLang daje prostszy model programowania niż CUDA.

To łączy się z szerszą dyskusją o tym, gdzie leży przewaga Nvidii. Firma badawcza SemiAnalysis, po przetestowaniu chipu wnioskowania OpenAI o nazwie Jalapeno, uznała fosę CUDA za "potencjalnie martwą", bo OpenAI tak szybko uruchamia nowe modele na własnym sprzęcie, i stwierdziła, że Jalapeno pobił Nvidia Blackwell w wydajności na wat w większości testowanych scenariuszy. SemiAnalysis dodała własne zastrzeżenia: testy objęły stosunkowo łatwe do optymalizacji scenariusze z około 8 000 tokenów wejściowych i 1 000 wyjściowych, a benchmark AgentX do wieloetapowych zadań agentowych nie został jeszcze uruchomiony. W sierpniu SemiAnalysis uznała, że Nvidia jest na tym benchmarku daleko z przodu, i stwierdziła, że Nvidia i tak będzie tańsza za token niż AMD, nawet gdyby AMD rozdawało swój sprzęt, bo przewaga siedzi w oprogramowaniu, które łączy wiele chipów w jeden system. Chipy Huaweia nie weszły do porównania w AgentX.

Jest też punkt nacisku wewnątrz kraju. Huawei przyznaje, że nie nadąża z popytem u siebie, więc planuje sprzedawać mniej chipów za granicą. Odnosząc się do amerykańskich kontroli eksportu, obecny przewodniczący rotacyjny Huaweia Eric Xu powiedział, że firma nie może zaakceptować przyszłości zależnej od tego, czy inni chcą sprzedawać chipy Chinom.

Na co patrzeć

Wzorzec tych premier jest taki, że otwarte wagi nie zamykają się już w checkpointach chatbotów. Przychodzą jako enkodery mowy dość małe na laptopa, predyktory tabelaryczne dla firmowych tabel, zestawy ewaluacyjne od państwowego organu bezpieczeństwa, wolontariackie pętle treningowe działające na darmowych planach, a teraz narzędzia programistyczne dla stosu akceleratorów innego niż Nvidia.

Dwie rzeczy pozostają nierozstrzygnięte. Po pierwsze, deklaracje o wynikach Phonon-2 i Kumo Tabular są w tym materiale twierdzeniami producenta lub opiekuna, a przy żadnej z trzech premier modeli nie ma niezależnego odtworzenia. Po drugie, obraz regulacyjny idzie w przeciwną stronę niż premiery: śledztwo FTC wobec Anthropic, OpenAI i Metr to pierwsze oficjalne działanie egzekucyjne USA dotyczące niesfornych agentów AI, jak podał The Guardian 30 września.

Otwarte wagi niczego z tego nie rozstrzygają. Przenoszą tylko spór na sprzęt, na którym więcej osób może go uruchomić.

Komentarze 0

Źródła

7
  1. 01OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05Inspect: An open-source framework for large language model evaluationsEN
  6. 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  7. 07US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.