Ein wirklich leistungsfähiger KI-Agent benötigt sowohl Intelligenz als auch echte Handlungsfähigkeit-. Er muss genau verstehen, was der Benutzer will, und dann die Dinge tatsächlich erledigen. So beschrieb Yuan Yuan, Dekan des Alibaba Research Institute, die ideale Form von KI-Agenten während eines kürzlich abgehaltenen Seminars zum Thema „Sicherheit und Entwicklung des Verhaltens von KI-Agenten“.

Sie betonte, dass KI-Agenten zwar vielversprechend darin seien, KI-Technologie in echtes Geld umzuwandeln und die Benutzererfahrung dramatisch zu verbessern, ihre Einführung jedoch bestehende Regeln, Governance oder Geschäftsökosysteme nicht auf den Kopf stellen dürfe. Stattdessen sollte alles auf sichere und kontrollierbare Weise ablaufen, mit enger Zusammenarbeit in der gesamten Branche, damit Telefonhersteller und App-Entwickler beide an den Vorteilen fortschrittlicher Modelle teilhaben können.
Im vergangenen Jahr war die große Frage am Markt: „Kann KI wirklich Aufgaben für uns erledigen?“ Wir haben gesehen, dass unterschiedliche Ansätze entstanden sind.
Einige Produkte versuchen, Telefonvorgänge zu „übernehmen“, indem sie verstehen, was auf dem Bildschirm angezeigt wird, und menschliches Tippen und Wischen nachahmen, um beispielsweise Videos zu bearbeiten, Tickets zu buchen oder Essen in verschiedenen Apps zu bestellen. Diese werden üblicherweise aufgerufenGUI-Agenten(kurz für Graphical User Interface Agents).
Technisch gesehen funktionieren sie so, dass die KI den Bildschirm „sieht“, es erkennt und dann Klicks und Gesten simuliert. Doch das wirft sofort eine Reihe kniffliger Fragen auf: Wer erteilt die Erlaubnis? Wer haftet, wenn es schiefgeht? Auf welche Dienste kann es zugreifen? Und wer hält es unter Kontrolle?
Auf dem Seminar stellten Experten fest, dass dieser bildschirmbasierte Ansatz -kurzfristig einen echten {1}Wert hat{2}}und es KI-Agenten ermöglicht, in den täglichen Einsatz einzusteigen, ohne große Änderungen an vorhandenen Apps zu erzwingen. Aber auf lange Sicht hat es eingebaute-Grenzen in Bezug auf Zuverlässigkeit, Geschwindigkeit und wie gut es gesteuert werden kann. Viele sehen darin eher eine provisorische Brücke als das Endspiel.
Jiao Haitao, Professor an der China University of Political Science and Law, argumentierte, dass Berechtigungen für KI-Agenten Szene für Szene gehandhabt werden sollten. Kritische Aktionen benötigen eine zweite Bestätigung durch den Benutzer, und Dinge, die persönliche Eigenschaften, subjektive Entscheidungen oder soziale Interaktionen betreffen, sollten überhaupt nicht delegiert werden. Er wies auf die Herausforderungen mit doppelten -Autorisierungsregeln- hin, bei denen nicht jedes Szenario allein auf einer Drittanbieterplattform- basieren sollte- und schlug der Branche vor, durch Verhandlungen und Standards zusammenzuarbeiten, um das Problem schrittweise zu lösen.
Telefonhersteller erkunden aktiv ihre eigenen Wege für KI-Agenten.
In einem kürzlichen Medienbriefing sagte Jiang Yuchen, OPPOs Direktor für Forschung und Entwicklung intelligenter Produkte für ColorOS, Reportern, dass Produkte wie das Doubao-Telefon einen positiven Einfluss auf die Branche und das Ökosystem gehabt hätten, indem sie die Dinge vorangetrieben hätten. Aber sie war klar: „Es ist nicht die endgültige Form eines KI-Telefons-es ist im Grunde immer noch eine Methode zur Bedienung der alten GUI-Schnittstellen.“
Für OPPO ist die Wahl zwischen GUI-Ansätzen-nicht eine Frage der Ideologie-, sondern in erster Linie ein technisches und skalierbares Problem. Jiang erklärte, dass so etwas wie Doubao es sich leisten könne, als technischer Prototyp aggressiver vorzugehen, aber große Telefonhersteller hätten es mit einer riesigen Nutzerbasis zu tun. „Wenn Sie eine Funktion starten und am nächsten Tag die meisten Dienste nicht mehr ordnungsgemäß funktionieren, ist das für uns ein Qualitätsvorfall. -Das können wir nicht akzeptieren.“ Bei diesem Maßstab wird die Leistungsfähigkeit jedes instabilen Systems-schnell vergrößert.
Ihrer Ansicht nach sind bildschirm{0}}operationsbasierte-Agenten „so etwas wie eine Zwischenstufe“. Der künftige Mainstream-Pfad wird eher in Richtung Mainstream tendierenA2A-Zusammenarbeit (Agent-zu-Agent)., bei dem KI-Agenten direkt miteinander sprechen und zusammenarbeiten.
Sie betonte, dass es bei dieser Entwicklung für Telefonhersteller nicht auf die Größe oder Parameter des Modells ankommt, sondern auf ihr tiefes, langfristiges Verständnis der Nutzer. „Wir glauben nicht, dass das große Modell die Seele des Telefons ist“, sagte Jiang. „Wir glauben, dass ‚Speicher‘ die Seele ist. Sobald Ihr Telefon Sie wirklich versteht, ist es wirklich schwierig, zu etwas anderem zu wechseln.“
Auf dem Seminar waren sich mehrere Experten einig, dass die eigentliche Herausforderung für KI-Agenten nicht nur darin besteht: „Kann sie ihre Arbeit erledigen?“-sondern darin besteht, klare Grenzen für das zu definieren, was sie tun können und wie sie verwaltet werden.
Yuan Yuan stellte fest, dass die aktuelle GUI-Welle einen gesunden „Welseffekt“ erzeugt habe, der die gesamte Branche aufrüttelte und belebte. Sie forderte jedoch Chinas KI-Sektor auf, nicht auf dem GUI-Weg steckenzubleiben. Bauen Sie stattdessen darauf auf, um bessere Routen zu finden, die Sicherheit und Fortschritt in Einklang bringen. Sie verwies auf den Ansatz von Apple als gutes Beispiel: Er richtet eine offene, API-basierte Zusammenarbeit zwischen Agenten und Apps ein und nutzt gleichzeitig die Bildschirmerkennung, um Sicherheitsgrenzen aufrechtzuerhalten und Benutzerabsichten präzise an Apps weiterzuleiten, wodurch diese Befehle intelligenter ausführen können.
Wang Yue, stellvertretender Direktor des Instituts für Informationssysteme an der Fakultät für Elektrotechnik der Tsinghua-Universität, sieht KI-Agenten als einen wichtigen Wendepunkt{0}}KI-Systeme beginnen, direkt mit der Außenwelt zu interagieren. Dies wird nicht nur die Art und Weise verändern, wie Informationssysteme aufgebaut sind; Es könnte auch die Wirtschaftsabläufe verändern. Er warnte davor, dass wirklich disruptive Innovationen das Risiko bergen, die Systemverwaltbarkeit zu schwächen und Vertrauensgrundlagen zu untergraben. Deshalb brauchen wir bessere Autorisierungsmechanismen und A2A-Kontrollen, um schließlich zu marktgesteuerten, wettbewerbsbasierten Glaubwürdigkeitssystemen überzugehen.
Insgesamt verlagert sich die Diskussion von der Frage, ob KI auf Telefonen agieren kann, hin zur Frage, wie man dies verantwortungsvoll und nachhaltig tun kann. -Und die Zusammenarbeit zwischen Agenten im A2A-Stil- scheint ein vielversprechender Weg zu sein, um dorthin zu gelangen, ohne alles andere zu zerstören.
