Zum Inhalt springen
Aktualisiert: 1. Oktober 20269 min LesezeitAndreas Hinderks

Keine Push-Nachrichten mehr: Was mein lokaler E-Mail-Agent tatsächlich für mich erledigt

Ein E-Mail-Agent auf Basis von Hermes Agent und einem lokalen Sprachmodell ersetzt meine Push-Benachrichtigungen. Was er erledigt und was die Forschung über die Akzeptanz persönlicher KI-Agenten sagt.

Illustration: Eine Person mit Bart sitzt lächelnd am Schreibtisch und tippt auf einem türkisfarbenen Laptop, daneben liegt ein Smartphone flach auf dem Tisch. Rechts stehen drei übereinanderliegende Briefablagen: oben ein einzelner orangefarbener Umschlag, in der Mitte einige pfirsichfarbene Umschläge, unten ein Stapel hellgrüner Umschläge. Nur vom orangefarbenen Umschlag führt eine gestrichelte Linie im Bogen zum Laptop.

Ich bekomme keine Push-Benachrichtigungen für E-Mails mehr. Stattdessen prüft ein lokal laufender E-Mail-Agent alle 30 Minuten mein Postfach und meldet sich nur, wenn jemand ohne meine Antwort nicht weiterarbeiten kann. Antworten legt der Agent als Entwurf ab, gesendet wird erst nach meiner Freigabe. Genau diese Arbeitsteilung, beraten und sortieren ja, nach außen handeln nein, ist laut aktueller Forschung der Bereich, in dem Menschen persönlichen KI-Agenten am ehesten vertrauen.

Dabei war ich skeptisch. Ich habe Hermes Agent, ein Open-Source-Framework für Agenten von Nous Research, ursprünglich nur installiert, um zu sehen, wie das so ist. Ich habe nicht wirklich erwartet, dass mir dieser Agent Arbeit abnimmt, wie man es bei Agenten-Demos eben kennt, die im Video beeindrucken und im Alltag selten halten, was sie versprechen.

Inzwischen muss ich gestehen: Der Agent ist ziemlich hilfreich. Und zwar nicht, weil er besonders viel kann, sondern weil er eine Sache gut macht, die mich vorher jeden Tag Konzentration gekostet hat.

Der E-Mail-Agent entscheidet, wann ich gestört werde

Push-Benachrichtigungen für E-Mails habe ich komplett abgeschaltet. Keine einzige ist übrig. Stattdessen prüft der Agent alle 30 Minuten mein Postfach und entscheidet, ob eine Mail kritisch ist, also sofort oder zeitnah von mir bearbeitet werden muss. Nur dann meldet er sich.

Das Kriterium, nach dem der E-Mail-Agent entscheidet, ist bewusst einfach: Erwartet jemand etwas von mir, ohne das er nicht weiterarbeiten kann? Dann ist es kritisch. Alles andere kann warten.

Man könnte das mit Absenderlisten, Schlagworten oder Prioritätsstufen deutlich komplizierter machen. Ich halte die eine Frage aus drei Gründen für tragfähiger.

Erstens ist die Frage menschlich nachvollziehbar. Es ist die Regel, nach der man auch einem Menschen sagen würde, wann er einen im Urlaub anrufen darf: wenn jemand ohne einen nicht weiterkommt.

Zweitens trennt das Kriterium Dringlichkeit von Wichtigkeit. Eine Anfrage für einen Vortrag im nächsten Frühjahr kann wichtig sein, blockiert aber niemanden. Eine kurze Rückfrage zu einer Freigabe, an der ein Team gerade hängt, ist vielleicht unspektakulär, aber jemand wartet darauf.

Drittens ist es für ein Sprachmodell gut prüfbar. Ob in einer Mail eine Frage, eine Bitte oder eine Abhängigkeit steckt, lässt sich aus dem Text recht zuverlässig ablesen. Ein Modell muss dafür nicht wissen, wie wichtig mir ein Absender ist. Es muss nur erkennen, ob am anderen Ende jemand steht und wartet.

Welche Aufgaben mein E-Mail-Agent übernimmt

Um diesen Kern herum sind ein paar weitere Aufgaben gewachsen:

  • Tageszusammenfassung: Am Ende des Tages schickt mir der Agent eine Übersicht, gegliedert in kritisch, wichtig und kann warten.
  • Newsletter-Auswertung: Der Agent liest meine Newsletter und prüft, ob etwas für mich Relevantes dabei ist. Die Themen habe ich vorgegeben, etwa UX-Messung, UX-Management, Hochschullehre, Kommunalpolitik und KI in der Softwareentwicklung und in der UX-Arbeit.
  • Rechnungen: Der Agent leitet alle Rechnungen an die Buchhaltung und an mein Archiv weiter.
  • Antworten über Slack: Der Agent meldet sich in Slack. Dort kann ich eine Antwort auf eine Mail in Stichpunkten vorformulieren. Der Agent formuliert sie aus und legt sie als Entwurf im Mailprogramm ab. Gesendet wird erst, wenn ich es tue.

Das Setup: ein lokales Sprachmodell auf dem Mac Studio

Der E-Mail-Agent läuft auf einem Apple Mac Studio mit M3 Ultra und 96 GB RAM. Als Sprachmodell nutze ich Qwen 3.8, betrieben über llama-server, als Framework Hermes Agent und als Kommunikationskanal Slack. Sowohl der Check alle 30 Minuten als auch die abendliche Tageszusammenfassung laufen über Qwen 3.8, also komplett lokal. Meine Mails verlassen für keine dieser Aufgaben meinen Rechner. Als jemand, der sich für digitale Souveränität einsetzt, ist mir das wichtig. Eingeführt habe ich das Ganze schrittweise: Zuerst durfte der Agent nur lesen und einordnen. Schreiben, also Entwürfe anlegen, kam erst dazu, als die Klassifikation stabil war.

Was im Alltag gut funktioniert

Drei Dinge funktionieren bei meinem E-Mail-Agenten bisher besonders gut.

An erster Stelle steht das Vorformulieren von Antworten aus meinen Stichpunkten. Ich schreibe in Slack ein paar Stichworte, und im Mailprogramm liegt ein ausformulierter Entwurf, den ich prüfe und selbst abschicke.

An zweiter Stelle steht das Einordnen nach Wichtigkeit. Ich werde nicht mehr bei jeder eingehenden Mail kurz rausgerissen, sondern nur noch, wenn jemand auf mich wartet.

Und drittens die Zusammenfassung von Newslettern. Statt jeden Newsletter selbst zu überfliegen, bekomme ich die Hinweise, die zu meinen Themen passen.

Wann akzeptieren Menschen persönliche KI-Agenten?

Als UX-Forscher interessiert mich nicht nur, dass ich diesen Agenten nutze, sondern warum ich ihm vertraue und wo die Grenzen liegen. Wann ein Assistent besser abgibt, statt selbst weiterzumachen, war schon Thema meines Beitrags zu Conversational Design. Die aktuelle Forschung liefert dazu ein recht konsistentes Bild.

Akzeptanz ist nicht gleich Delegation. Yankouskaya und Kolleg:innen (2026) haben in AI & Society Daten von 30.994 Personen aus 35 Ländern ausgewertet, um zu verstehen, wann Menschen KI Rollen wie Arzt, Lehrkraft oder Begleiter überlassen würden. Sie unterscheiden zwischen Akzeptanz, also der Frage, ob ich ein System nutze, und Delegation, also der Frage, ob ich Entscheidungsbefugnis abgebe. Klassische Akzeptanzmodelle wie das Technology Acceptance Model (TAM) erklären nur den ersten Teil, Delegation verlangt zusätzlich die Abgabe von Verantwortung. Für Agenten ist gerade dieser zweite Teil entscheidend.

Vertrauen wird pro Aufgabe kalibriert, nicht pro Agent. Pochampally, An und Chen (2026, Virginia Tech) haben in einer kontrollierten Studie 20 Studierende fünf alltägliche Aufgaben mit dem Allzweck-Agenten OpenClaw erledigen lassen, eine kleine Stichprobe, aber ein aufschlussreicher Befund. Bei beratenden und risikoarmen Aufgaben gewährten die Teilnehmenden viel Autonomie, bei unumkehrbaren, nach außen sichtbaren Aktionen verlangten sie eine Bestätigung. Ausgerechnet die E-Mail-Aufgabe, bei mittlerem Risiko, führte zum stärksten Vertrauensverlust (M = 3,10) und zum höchsten Wunsch nach Freigabe (M = 4,65, jeweils auf einer Skala von 1 bis 5). Eine Aufgabe mit höherem Risiko, deren Ergebnis man prüfen konnte, löste diese Reaktion nicht aus. Die Autoren beschreiben das als „Delegation Regret“: Bedauern nicht über einen Fehler, sondern darüber, dass der Agent ohne Vorschau gehandelt hat, selbst wenn das Ergebnis gut war.

Menschen wollen einen Delegationsvertrag. In einer Befragung von Blackbox im Auftrag von Sumsub mit 1.050 Personen, allerdings ausschließlich aus Festlandchina, Hongkong und Taiwan, bevorzugen 77 % eine menschliche Freigabe, bevor ein Agent handelt. 44 % würden Agenten nur begrenzte Aktionen in selbst gewählten Apps erlauben, etwa für E-Mail, Einkauf oder Banking. Nach einem teuren Fehler würden nur 14 % den Agenten ganz aufgeben, 55 % würden ihn weiter nutzen, aber nur noch für Aufgaben ohne Finanzbezug. Vertrauen bricht also nicht einfach, es fällt auf eine niedrigere Autonomiestufe zurück.

Zusammenarbeit ja, Führung nein. In einer Befragung von Hanover Research im Auftrag von Workday (2025) unter 2.950 Entscheider:innen und Verantwortlichen für Software-Einführungen arbeiten 75 % gern mit KI-Agenten zusammen, aber nur 30 % fänden es in Ordnung, von einem Agenten geführt zu werden. Erfahrung verschiebt das Bild: Unter denen, die Agenten erst erkunden, vertrauen 36 % darauf, dass ihre Organisation sie verantwortungsvoll einsetzt, unter den Fortgeschrittenen sind es 95 %.

Autonomie bleibt die Ausnahme. Im Consumer Pulse 2026 von Accenture mit 25.590 Befragten aus 16 Ländern würden 32 % einem Agenten die Kaufentscheidung innerhalb vorgegebener Grenzen wie Preis und Vorlieben überlassen. Für vollständig autonome Käufe einschließlich Bezahlung wären nur 9 % offen. Im Bereich Zahlungen wären 12 % bereit, einen Agenten eigenständig entscheiden zu lassen.

Und die Push-Benachrichtigungen? Mark und Kolleg:innen (CHI 2016, Microsoft Research) haben 40 Wissensarbeiter zwölf Arbeitstage lang beobachtet. Je mehr Zeit sie täglich mit E-Mail verbrachten, desto geringer war die empfundene Produktivität und desto höher der gemessene Stress. Wer Mails vor allem aus eigenem Antrieb prüft, statt auf Benachrichtigungen zu reagieren, berichtete bei längerer E-Mail-Zeit eine höhere Produktivität. Dass gebündeltes Abarbeiten den Stress senkt, fanden die Autor:innen dagegen nicht. Eine Folgestudie von Akbar und Kolleg:innen (CHI 2019) mit 63 Teilnehmenden zeigt, warum: Menschen mit hohen Neurotizismus-Werten sind beim Bündeln sogar stärker gestresst als bei häufigen Unterbrechungen. Ganz so einfach, wie ich es mir wünschen würde, ist es also nicht.

Warum mein Setup zu den Befunden passt

Wenn ich meinen E-Mail-Agenten neben diese Befunde lege, liegt es ziemlich genau dort, wo die Forschung hohe Akzeptanz erwartet.

Der Agent berät und sortiert, er handelt nicht nach außen. Antworten landen als Entwurf, die Freigabe bleibt bei mir, und damit ist genau die Situation ausgeschlossen, die das Delegation Regret auslöst. Die einzige autonome Außenwirkung, das Weiterleiten von Rechnungen, ist eng begrenzt, hat feste Empfänger und ist risikoarm. Und der Agent hat sich sein Vertrauen schrittweise verdient: erst lesen, dann schreiben. Das erinnert an einen Grundsatz aus meinem Beitrag über einen Chatbot für eine Kommune: lieber nachfragen als raten.

Rückblickend habe ich, ohne es so zu nennen, einen Delegationsvertrag geschlossen. Nicht mit dem Agenten als Ganzem, sondern Aufgabe für Aufgabe.

Offen ist für mich als Forscher, wie sich das weiterentwickelt. Wird meine Akzeptanz weiter wachsen, sodass ich ihn irgendwann Routineantworten selbst senden lasse, etwa Terminbestätigungen? Oder bleibt die Grenze „nach außen sichtbar“ stabil, egal wie gut die Entwürfe werden? Bei der Frage, ob mir der Agent überhaupt nützt, habe ich mich jedenfalls schon einmal geirrt.

Was würdet ihr delegieren?

Was würdet ihr gerne von einem E-Mail-Agenten erledigen lassen?

Und wo wäre für euch die Grenze, an der ihr die Kontrolle nicht abgeben würdet? Schreibt es mir auf LinkedIn. Wie ich sonst mit KI-Werkzeugen arbeite, steht unter KI-gestützte Entwicklung und in Mal eben gebaut.

Quellen

Alle Links abgerufen am 01.10.2026.

Häufige Fragen

Im hier beschriebenen Setup nach einer einzigen Frage: Erwartet jemand etwas, ohne das er nicht weiterarbeiten kann? Dann ist die Mail kritisch, und der Agent meldet sie sofort. Alles andere kann warten und landet in der Tageszusammenfassung. Das Kriterium trennt Dringlichkeit von Wichtigkeit und lässt sich für ein Sprachmodell gut am Text einer Mail prüfen.

Nein. Antworten werden in Slack in Stichpunkten vorformuliert, der Agent formuliert sie aus und legt sie als Entwurf im Mailprogramm ab. Gesendet wird erst nach menschlicher Freigabe. Die einzige autonome Aktion nach außen ist das Weiterleiten von Rechnungen an feste Empfänger, die Buchhaltung und ein Archiv.

Ja. Das beschriebene Setup läuft auf einem Apple Mac Studio mit M3 Ultra und 96 GB RAM. Als Sprachmodell dient Qwen 3.8, betrieben über llama-server, als Framework Hermes Agent von Nous Research. Sowohl der Check alle 30 Minuten als auch die Tageszusammenfassung laufen lokal, die Mails verlassen den Rechner dafür nicht. Nur die Kommunikation mit dem Agenten läuft über Slack.

Bei beratenden und risikoarmen Aufgaben gewähren Menschen viel Autonomie, bei unumkehrbaren, nach außen sichtbaren Aktionen verlangen sie eine Freigabe. In einer Studie von Pochampally, An und Chen (2026) mit 20 Studierenden führte ausgerechnet die E-Mail-Aufgabe zum stärksten Vertrauensverlust und zum höchsten Wunsch nach Freigabe. In einer Befragung von Blackbox für Sumsub (2026) bevorzugen 77 % eine menschliche Freigabe, bevor ein Agent handelt.

Der Begriff stammt von Pochampally, An und Chen (2026). Gemeint ist Bedauern nicht über einen Fehler eines KI-Agenten, sondern darüber, dass der Agent ohne Vorschau gehandelt hat, selbst wenn das Ergebnis gut war. Entwürfe, die erst nach Freigabe gesendet werden, vermeiden genau diese Situation.

Mark et al. (CHI 2016) haben 40 Wissensarbeiter zwölf Arbeitstage lang beobachtet: Je mehr Zeit täglich auf E-Mail entfiel, desto geringer war die empfundene Produktivität und desto höher der gemessene Stress. Wer Mails vor allem aus eigenem Antrieb prüft statt auf Benachrichtigungen zu reagieren, berichtete bei längerer E-Mail-Zeit eine höhere Produktivität. Dass gebündeltes Abarbeiten den Stress senkt, fanden die Autoren nicht. Akbar et al. (CHI 2019) zeigten, dass Menschen mit hohen Neurotizismus-Werten beim Bündeln sogar stärker gestresst sind.