Close Menu
    Facebook X (Twitter) Instagram
    HUMANMAG
    • Dom
    • Nagłówki
    • Świat
    • Biznes
    • Nauka
    • Technika
    • Sport
    • Rozrywka
    HUMANMAG
    Home»technologia»Runda 2: Testujemy nowego Barda napędzanego Gemini przeciwko ChatGPT
    technologia

    Runda 2: Testujemy nowego Barda napędzanego Gemini przeciwko ChatGPT

    8 grudnia, 2023Brak komentarzy4 Mins Read
    Facebook Twitter Pinterest LinkedIn Reddit WhatsApp Email
    Runda 2: Testujemy nowego Barda napędzanego Gemini przeciwko ChatGPT
    Share
    Facebook Twitter Pinterest Reddit WhatsApp Email
    Runda 2: Testujemy nowego Barda napędzanego Gemini przeciwko ChatGPT

    Auricha Lawsona

    W kwietniu wysłaliśmy serię przydatnych i/lub nieco głupich podpowiedzi za pośrednictwem (wówczas nowego) programu Google. Zasilanie PaLM Chatbot Bard i (nieco starszy) ChatGPT-4 OpenAI, aby zobaczyć, który chatbot AI wyjdzie na wierzch. W tamtym czasie daliśmy ChatGPT przewagę w pięciu z siedmiu prób, ale zauważyliśmy, że „biznes generatywnej sztucznej inteligencji jest wciąż w powijakach”. Teraz czasy sztucznej inteligencji są nieco mniej „wczesne”, a wydanie w tym tygodniu nowej wersji Barda opartej na nowym modelu językowym Gemini firmy Google wydawało się dobrym pretekstem, aby ponownie przyjrzeć się bitwie chatbota z tymi samymi starannie przygotowanymi podpowiedziami do nagrywania. Jest to szczególnie prawdziwe, ponieważ w materiałach promocyjnych Google podkreślono, że Gemini Ultra przewyższa GPT-4 w „30 z 32 powszechnie używanych testów porównawczych akademickich” (chociaż bardziej ograniczony „Gemini Pro”, na którym obecnie opiera się Bard, radzi sobie zauważalnie gorzej w tych wartościach odcięcia nie do końca niezawodny testy porównawcze).

    Tym razem postanowiliśmy porównać nowego Barda zasilanego przez Gemini z ChatGPT-3.5 – w celu bezpośredniego porównania obecnych „bezpłatnych” produktów asystentów AI obu firm – i ChatGPT-4 Turbo – aby rzucić okiem Obecny „topowy model” OpenAI Lista oczekujących płatny produkt subskrypcyjny (najwyższy produkt Google „Gemini Ultra” będzie publicznie dostępny dopiero w przyszłym roku). Przyjrzeliśmy się także kwietniowym wynikom modelu sprzed Gemini Bard, aby ocenić, jak duży postęp poczyniły wysiłki Google w ciągu ostatnich kilku miesięcy.

    Chociaż testy te są dalekie od kompleksowego, uważamy, że stanowią dobry punkt odniesienia do oceny wydajności tych asystentów AI w zadaniach, którymi na co dzień zajmują się przeciętni użytkownicy. W tym miejscu pokazują także, jak ogromny postęp poczyniły tekstowe modele AI w stosunkowo krótkim czasie.

    READ  Stany Zjednoczone zamykają kuloodporną usługę hostingową LolekHosted i wnoszą oskarżenia przeciwko swojemu polskiemu operatorowi

    Tata żartuje

    Podpowiedź: Napisz 5 oryginalnych dowcipów o tacie

    • Zrzut ekranu przedstawiający pięć „żartów o tacie” z Google Bard z siedzibą w Gemini.

      Kyle’a Orlanda/Ars Technica

    • Zrzut ekranu przedstawiający pięć „żartów o ojcu” ze starego Google Barda opartego na PaLM.

      Benja Edwardsa/Ars Technica

    • Zrzut ekranu przedstawiający pięć „żartów taty” z GPT-4 Turbo.

      Benja Edwardsa/Ars Technica

    • Zrzut ekranu przedstawiający pięć „żartów o tacie” z GPT-3.5.

      Kyle’a Orlanda/Ars Technica

    Po raz kolejny oba testowane LLM mają problemy z częścią podpowiedzi pytającą o oryginalność. Prawie wszystkie dowcipy o tacie wygenerowane przez ten monit można znaleźć dosłownie lub po niewielkim przeformułowaniu za pomocą szybkiej wyszukiwarki Google. Bard i ChatGPT-4 Turbo nawet umieścili na swoich listach dokładnie ten sam dowcip (o książce o antygrawitacji), podczas gdy ChatGPT-3.5 i ChatGPT-4 Turbo nałożyły się na dwa dowcipy („Naukowcy ufają atomom” i „Strachy na wróble wygrywają nagrody. „ „). ).

    Reklama

    Z drugiej strony większość ojców nie wymyśla własnych dowcipów o tacie. Kultywowanie rozległej ustnej tradycji dowcipów ojców jest tradycją tak starą jak sami ojcowie.

    Najciekawszy wynik pochodzi z ChatGPT-4 Turbo, w którym zażartowano o nadaniu dziecku imienia Brian Po Thomas Edison (rozumiesz?). Wygooglowanie tego konkretnego wyrażenia nie dało zbyt wielu wyników, ale wróciło niemal identyczny żart o Thomasie Jeffersona (również z dzieckiem o imieniu Brian). Podczas tych poszukiwań odkryłem także zabawny (?) fakt, że międzynarodowa gwiazda piłki nożnej Pelé najwyraźniej faktycznie został nazwany na cześć Thomasa Edisona. Kto wiedział?!

    Zwycięzca: Nazywamy to remisem, ponieważ dowcipy są niemal równie nieoryginalne i pełne kalamburów (chociaż należą się brawa dla GPT za niezamierzone doprowadzenie mnie do zbiegu okoliczności z Pelé).

    Dialog argumentacyjny

    Podpowiedź: Napisz pięciowierszową debatę pomiędzy wentylatorem procesora PowerPC a wentylatorem procesora Intel, około 2000 roku.

    • Zrzut ekranu okna dialogowego argumentów z Google Bard opartego na Gemini.

      Kyle’a Orlanda/Ars Technica

    • Zrzut ekranu okna dialogowego argumentów ze starego Google Barda opartego na PaLM.

      Benja Edwardsa/Ars Technica

    • Zrzut ekranu okna dialogowego argumentów z GPT-4 Turbo.

      Benja Edwardsa/Ars Technica

    • Zrzut ekranu okna dialogowego argumentów GPT-3.5

      Kyle’a Orlanda/Ars Technica

    Nowy Bard napędzany Bliźniakami zdecydowanie „ulepsza” starą odpowiedź Barda, przynajmniej jeśli chodzi o włączenie o wiele więcej żargonu. Nowa odpowiedź zawiera przelotne wzmianki o instrukcjach AltiVec, konstrukcjach RISC vs. CISC oraz technologii MMX, które nie byłyby nie na miejscu w wielu dyskusjach na forach Ars z tamtej epoki. I chociaż stary bard kończy niepokojąco uprzejmym „Każdemu jego”, nowy bard bardziej realistycznie sugeruje, że kłótnia mogłaby ciągnąć się w nieskończoność po wymaganych pięciu linijkach.

    READ  Pozornie ujawniono rozmiar pliku Monster Hunter Stories 2: Wings of the Ruin Switch

    Na stronie ChatGPT dość długa odpowiedź GPT 3.5 została zredukowana do znacznie bardziej zwięzłego argumentu w GPT-4 Turbo. Obie odpowiedzi GPT zwykle unikają technicznego żargonu i szybko skupiają się na bardziej ogólnym argumencie dotyczącym wydajności w porównaniu do zgodności, który jest prawdopodobnie bardziej zrozumiały dla ogółu odbiorców (choć mniej specyficzny dla odbiorców technicznych).

    Zwycięzca: ChatGPT potrafi dobrze wyjaśnić obie strony debaty, nie opierając się na mylącym żargonie, dlatego też wypada tutaj najlepiej.

    Witold Gombrowicz

    Witold Gombrowicz jest autorem publikującym na portalu humanmag.pl, gdzie porusza tematy związane z aktualnościami, polityką, biznesem, technologią, sportem, rozrywką i stylem życia. Skupia się na przejrzystym przedstawianiu faktów, dostarczaniu użytecznych informacji oraz opisywaniu wydarzeń i historii istotnych dla czytelników w rzetelny i przystępny sposób.

    Share. Facebook Twitter Pinterest LinkedIn WhatsApp Reddit Email
    Previous ArticleRWE zabezpiecza kontrakty CfD na projekty fotowoltaiczne o mocy 66 MW w Polsce
    Next Article Aktorka Calum Mikayla Cowling została zaatakowana w Polsce i doznała urazu oczodołu

    Related Posts

    Poważny błąd w Windows 11 może zajmować setki gigabajtów miejsca na dysku

    8 lipca, 2026

    Gracze protestują przeciwko rezygnacji z płyt na PlayStation. Petycja zyskuje coraz większe poparcie

    8 lipca, 2026

    Xbox przechodzi największą restrukturyzację w swojej historii. Pracę straci 3200 osób

    8 lipca, 2026

    Meta uruchamia AI Studio w USA, aby umożliwić programistom tworzenie chatbotów AI

    30 lipca, 2024

    PSA: zdobądź 1000 złotych punktów dzięki tej ofercie internetowego członkostwa rodzinnego Switch (Ameryka Północna)

    30 lipca, 2024

    Apple twierdzi, że jego modele AI zostały przeszkolone na niestandardowych chipach Google

    30 lipca, 2024
    Add A Comment
    Leave A Reply Cancel Reply

    Navigate
    • Dom
    • Nagłówki
    • Świat
    • Biznes
    • Nauka
    • Technika
    • Sport
    • Rozrywka
    Pages
    • o nas
    • Formularz kontaktowy
    • DMCA
    • Polityka Redakcyjna
    • Polityka prywatności
    • o nas
    • Formularz kontaktowy
    • DMCA
    • Polityka Redakcyjna
    • Polityka prywatności
    © 2026 HumanMag. All rights reserved.

    Type above and press Enter to search. Press Esc to cancel.