Korzystaj z narzędzi agentów, aby rozszerzać, automatyzować i udoskonalać swoich agentów

Agenty stają się potężniejsze, gdy wyposażysz je w specjalistyczne narzędzia, które rozszerzają ich podstawowe możliwości. Copilot Studio oferuje trzy główne kategorie narzędzi agentów:

W tym artykule opisano, jak działa każdy typ narzędzia, kiedy należy go używać oraz w jaki sposób mogą one pomóc w budowie bardziej skutecznych i wydajnych agentów. Dowiadujesz się także o różnicach między maszynami hostowanymi a „przynieś własne” do scenariuszy obsługi komputera, a także otrzymasz wskazówki dotyczące wyboru między tradycyjnymi podejściami zrobotyzowanej automatyzacji procesów (RPA) a Computer Using Agents (CUA).

Generowanie odpowiedzi za pomocą poleceń AI

Polecenia AI wykorzystują zestaw instrukcji do wygenerowania odpowiedzi przez model AI. Możesz dołączyć zmienne, aby wstawić więcej tekstu lub dokumentów do tych instrukcji. Wyjście jest zazwyczaj dostarczane w postaci tekstu niesformatowanego lub formatu JSON. Możesz wybrać dowolny model sztucznej inteligencji wbudowany w Copilot Studio lub wdrożony za pośrednictwem Microsoft Foundry, aby wygenerować odpowiedź.

Możesz wywoływać polecenia jako narzędzie agenta lub bezpośrednio w obrębie tematu. Wszystkie polecenia są zapisywane w bibliotece poleceń, która obsługuje zarządzanie cyklem życia aplikacji, kontrolę dostępu opartą na rolach oraz udostępnianie.

Dowiedz się więcej, używając poleceń, aby agent mógł wykonywać określone zadania.

Kiedy używać poleceń AI, a kiedy orkiestratora

Każdy agent utworzony w Copilot Studio korzysta z orkiestratora, aby określić, jak odpowiedzieć, wybierając narzędzia, tematy i wiedzę na podstawie instrukcji systemowych, danych wejściowych użytkownika i informacji kontekstowych. Orkiestrator jest motorem orkiestracji generatywnej, wykorzystując narzędzia i opisy agenta do planowania działań i komponowania odpowiedzi.

Chociaż odpowiedzi sterowane orkiestracją mogą wydawać się podobne do poleceń AI, obie te funkcje pełnią różne funkcje. Polecenia AI to niezależne działania oparte na poleceniach, które dają twórcom większą kontrolę nad konfiguracją modelu.

Polecenia AI obsługują szerszy zakres modeli, w tym te dostępne poprzez Microsoft Foundry. Obsługują także funkcje, takie jak osadzenie w Dataverse, wprowadzanie plików oraz interpreter kodu.

Orkiestrator korzysta ze stałego promptu systemowego i opisów narzędzi, aby wybrać odpowiednie moduły konstrukcyjne dla danego żądania. Twórcy nie mogą edytować systemu promptu orkiestratora, ale mogą wpływać na jego zachowanie za pomocą instrukcji agenta.

Polecenia AI dają pełną kontrolę nad formatowaniem, ograniczeniami i logiką, przez co są najlepszym wyborem w scenariuszach wymagających precyzyjnie dostrojonej lub silnie ustrukturyzowanej odpowiedzi. Na przykład, jeśli potrzebujesz kontroli stylistycznej wykraczającej poza proste formatowanie („napisz rymowany wiersz w strukturze ABAB, używając dokładnie tych słów), polecenie będzie lepszym wyborem.

Orkiestrator dobrze sprawdza się w prostych zadaniach, takich jak wyodrębnianie pojedynczej nazwy z tekstu. Do złożonego wyodrębniania używaj poleceń AI. Na przykład, wydobywanie wielu encji z obszernego raportu i połączenie ich z relacjami specyficznymi dla domeny (takimi jak wyodrębnianie wielu nazwisk z raportu ubezpieczeniowego i identyfikowanie właściciela warsztatu samochodowego powiązanego tylko z jedną stroną zdarzenia).

Wybór między orkiestratorem a poleceniami AI zależy od poziomu wymaganego dostosowywania. Jeśli potrzebujesz precyzyjnej kontroli nad zachowaniem lub wynikiem modelu, wybierz polecenia AI. W sytuacjach, gdy wystarczające są ogólne rozumowanie, wybór narzędzi i proste formatowanie, najlepszym rozwiązaniem jest użycie orkiestratora.

Integruj narzędzia agentów za pomocą MCP

Protokół kontekstu modelu (MCP) to uniwersalny interfejs, który modele AI wykorzystują do interakcji z narzędziami zewnętrznymi, źródłami danych i środowiskami użytkownika w sposób spójny i skalowalny.

Dla porównania, łączniki Power Platform wymagają opisu każdej akcji i jej wejść oraz aktualizowania tych opisów, gdy pojawiają się nowe definicje. Ręczne kodowanie integracji dla każdego narzędzia jest bardziej skomplikowane i mniej skalowalne.

Korzystaj z serwerów MCP udostępnianych przez Copilot Studio dla usług Microsoft, takich jak Outlook, Dataverse i GitHub, lub usług zewnętrznych, takich jak Salesforce i JIRA. Buduj niestandardowe serwery MCP dla usług, dla których nie istnieją takie serwery.

Korzyści MCP obejmują:

  • Ustandaryzowany kontekst dla modeli AI
  • Płynna integracja z Copilot Studio
  • Poprawa efektywności programistów i środowiska użytkownika
  • Nadzór, monitorowanie i rozszerzalność

Przed implementacją serwerów MCP rozważ następujące ograniczenia:

  • Nie można wzbogacić opisów narzędzi o dodatkowy kontekst dotyczący momentu ich wywołania.
  • Tematy nie mogą bezpośrednio wywoływać serwerów MCP.

Należy zrozumieć, kiedy stosować MCP

Te same wyniki można uzyskać w Copilot Studio, stosując różne metody integracji. Ważne jest, aby zrozumieć, kiedy używać serwerów Protokół kontekstu modelu (MCP), a kiedy prostszych opcji, takich jak złącza Power Platform czy bezpośrednie wywołania API REST.

Używaj MCP, gdy potrzebujesz ustandaryzowanego, centralnie zarządzanego sposobu udostępniania narzędzi i zasobów wielu agentom bez konieczności konfiguracji pojedynczego klienta. Serwery MCP udostępniają narzędzia i zasoby, które agenci mogą automatycznie odkrywać, ustanawiać wersję i używać w spójny sposób, ponieważ serwer MCP definiuje opisy narzędzi i ich dane wejściowe. Natomiast dodanie API wymaga ręcznego opisania jego celu i zdefiniowania wejść dla każdego agenta.

MCP jest szczególnie przydatny, gdy nadrzędne API często się zmieniają. Zamiast aktualizować każdego agenta, który korzysta z API, wystarczy zmodyfikować definicję raz na serwerze MCP, a wszystkie agenty automatycznie użyją zaktualizowanej wersji bez ponownego publikowania. Jeśli nie istnieje serwer MCP lub pracujesz nad szybkim prototypem, bezpośrednie wywoływanie API jest szybsze i eliminuje konieczność ponoszenia kosztów konfiguracji wymaganych do wdrożenia pełnego cyklu życia MCP.

Aby można było korzystać z MCP, należy włączyć orkiestrację generatywną. Dowiedz się więcej w Jak działa MCP?

Automatyzuj procesy na komputerze przy użyciu narzędzia do obsługi komputera

Dzięki zastosowaniu narzędzia obsługi komputera agent może obsługiwać komputer bez potrzeby stosowania skryptów automatyzacji czy API. Zamiast używać skryptów lub interfejsów API, konfigurujesz agenta za pomocą polecenia. Agent decyduje, jak najlepiej osiągnąć swoje cele. W trakcie procesu agent wykonuje zrzut ekranu na każdym kroku, analizuje go, aby podjąć następną akcję, wykonuje tę akcję i powtarza ten cykl aż do ukończenia zadania. Zrzuty ekranu wykonane przez agenta oraz kroki rozumowania są dostępne jako część historii uruchomienia.

Typowe przypadki użycia, w których agent może skorzystać z narzędzia obsługa komputera, obejmują:

  • Wprowadzanie danych: Dla każdego wiersza w przychodzącym pliku CSV utwórz zlecenie sprzedaży w SAP i zapisz wygenerowany identyfikator zamówienia do pliku.
  • Ekstrakcja danych: Przejdź do portalu każdego dostawcy, wyszukaj wskazane SKU, wyodrębnij cenę, stan magazynowy i czas realizacji, a następnie wstaw wyniki z oznaczeniem czasu do bazy danych.
  • Obsługa wielu aplikacji: Wyeksportuj transakcje dnia z klienta Desktop Finance, nawiguj po QuickBooks i zaksięguj każdy wpis do właściwego konta.

Interpretacja maszyn hostowanych a własnych

Agenty mogą uruchomić narzędzie do obsługi komputera na maszynie hostowanej przez Microsoft lub na urządzeniu „przynieś własne” (BYO). Maszyny hostowane są dostępne do natychmiastowego użycia bez konieczności konfiguracji IT ani rozliczeń. Należą do udostępnionej puli wcześniej aprowizowanych komputerów Windows 365 Cloud PC, które nie mają przypisanego do klienta dzierżawy. Maszyny BYO muszą być wcześniej skonfigurowane w ramach własnej sieci wirtualnej klienta. Rejestrujesz maszyny i zarządzasz maszynami BYO w usłudze Power Automate.

Używaj maszyn BYO do scenariuszy produkcyjnych. Obsługują Microsoft Entra ID, są zarejestrowane w usłudze Intune i obsługują zarówno przypadki użycia automatyzacji webowej, jak i pulpitu. Używaj maszyn hostowanych wyłącznie do prototypowania ze względu na ich ograniczone możliwości. Na użytkownika dostępny jest tylko jeden komputer chmurowy, a jego wykorzystanie można ograniczać w zależności od zapotrzebowania.

Dowiedz się więcej w temacie Konfigurowanie, gdzie uruchamiać narzędzie do obsługi komputera.

Zrobotyzowana automatyzacja procesów (RPA) kontra Agenci wykorzystujący komputer (CUA)

Zrobotyzowana automatyzacja procesów (RPA) polega na automatyzacji działań na komputerze za pomocą skryptu. RPA można zastosować w wielu podobnych scenariuszach co CUA. Jednak ważne jest, aby zrozumieć różnice między RPA a CUA.

Aspect RPA CUA
Typ automatyzacji Na podstawie reguły Na podstawie LLM
Metoda interakcji Drzewo UI Obraz
Tworzenie Scenariusz, złożony Instrukcje w języku naturalnym
Podejmowanie decyzji Predefiniowane reguły Autonomiczne decyzje oparte na analizie wizualnej
Elastyczność Ograniczona elastyczność Wysoka elastyczność
Obsługa błędów Statyczna obsługa błędów Samokorekta oparta na wizualnym sprzężeniu zwrotnym

Użyj RPA w przypadku:

  • Dozwolone są tylko funkcje ogólnej dostępności (GA).
  • Interfejs użytkownika jest stabilny. Ekrany, pola i selektory rzadko się zmieniają.
  • Zasady są jasne. Decyzje można zapisać jako reguły.
  • Szybkość ma znaczenie. Wysoka objętość. Każda sekunda się liczy.
  • Podlega zespołowi RPA. Zespół posiada wiedzę z zakresu rozwoju i zarządzania RPA.

Użyj CUA w przypadku:

  • Interfejsy użytkownika często się zmieniają lub znacznie różnią. Pracujesz z wieloma aplikacjami i częstymi zmienionymi projektami.
  • Potrzebujesz tego szybko. Lista zadań zespołu RPA jest pełna.
  • Interfejs użytkownika ma znaczenie. Zadanie zależy od elementów widocznych na ekranie, takich jak wykresy, kolory i układy dynamiczne.
  • Decyzje są rozmyte. Agent musi rozumować, wybrać kolejny krok lub się poprawić.