Data Analytics report

как собрать локальную память из plaud и krisp

многомерное сравнение asr и промежуточное решение для myalignment

executive summary

  • выбор сейчас: смешанный pipeline. parakeet делает быстрый независимый черновик, mlx large-v3-turbo делает второй проход с безопасным словарём сущностей, plaud остаётся третьим внешним голосом там, где provider-текст уже существует.
  • целевая метрика myalignment шире wer. система должна правильно определить человека, проект, утверждение, отрицание и исправление, затем вернуть точный аудиоспан. красивый текст без правильной маршрутизации бесполезен.
  • словарь должен помогать распознаванию, но не подсказывать факты. prompt содержит только допустимые написания имён и проектов; отношения извлекаются после asr и всегда хранят исходную форму.
  • победитель выбирается по сегменту, а не по файлу. расхождение моделей становится сигналом риска; критические куски получают дополнительный проход или human review.
Source: агрегация общих моделей по шести score receiptsTables: transcript-score.json, benchmark.json

равновзвешенная агрегация четырёх общих вариантов по шести захватам

лучший room wer

23.4%Source: замороженные room-v1 score receiptsTable: transcript-score.json

лучший end-to-end wer среди комнатных прогонов; ниже лучше

лучший end-to-end wer среди комнатных прогонов; ниже лучшеSource: замороженные room-v1 score receiptsTable: transcript-score.json

скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей

захватов

6Source: реестр agent-memory-v1Table: benchmark.json

неизменяемые аудиозахваты, включённые в текущую сводку

неизменяемые аудиозахваты, включённые в текущую сводкуSource: реестр agent-memory-v1Table: benchmark.json

шесть неизменяемых полевых захватов и их score receipts

mlx completeness

51.5%Source: замороженные room-v1 score receiptsTable: transcript-score.json

доля эталонного объёма слов, оставшаяся в сыром mlx на груди

доля эталонного объёма слов, оставшаяся в сыром mlx на грудиSource: замороженные room-v1 score receiptsTable: transcript-score.json

скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей

решение сейчас

  • parakeet — быстрый независимый первый проход и лидер на байке / в дальнем комнатном прогоне.
  • mlx large-v3-turbo — второй качественный проход с безопасным словарём сущностей. контекст содержит только написание имён, без отношений и фактов.
  • plaud — независимый облачный голос и источник таймкодов; его текст остаётся кандидатом, а не истиной.
  • completeness-gate обязателен: если кандидат короче 70%Source: замороженные room-v1 score receiptsTable: transcript-score.json медианы других вариантов или потерял стартовый/финальный якорь, он уходит в карантин. сырой mlx на груди сохранил только 52Source: замороженные room-v1 score receiptsTable: transcript-score.json слова против 101Source: замороженные room-v1 score receiptsTable: transcript-score.json102Source: замороженные room-v1 score receiptsTable: transcript-score.json у других вариантов.
Source: замороженные room-v1 score receiptsTable: transcript-score.json

скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей

лучший результат меняется по размещению: mlx с entity-контекстом на груди, plaud на 50 см, parakeet на 2 м.

ошибка по трём комнатным размещениям data
размещениеwerмодельentity recallcritical recallслов
грудь32.7%plaud56.3%26.7%102
грудь50.5%whisper base43.8%13.3%101
грудь62.6%mlx raw12.5%33.3%52
грудь23.4%mlx + entities87.5%60%100
грудь37.4%parakeet43.8%26.7%101
стол 50 см30.8%plaud62.5%33.3%103
стол 50 см45.8%whisper base25%13.3%104
стол 50 см33.6%mlx raw43.8%33.3%104
стол 50 см34.6%mlx + entities68.8%40%93
стол 50 см38.3%parakeet25%20%104
стол 2 м36%plaud56.3%33.3%110
стол 2 м55.9%whisper base12.5%13.3%105
стол 2 м30.6%mlx raw50%33.3%109
стол 2 м34.2%mlx + entities43.8%26.7%110
стол 2 м24.3%parakeet25%26.7%112

разлом результата

на груди сырой mlx потерял примерно первые 28 секунд, хотя нормализация wav и ослабление decoder-gates не помогли. короткий entity-only prompt восстановил начало и дал wer 23,4%. на 2 м тот же prompt ухудшил результат: значит контекст надо применять как контролируемую гипотезу и сравнивать с независимым первым проходом.

2 м дал лучший parakeet wer — 24,3%, но запись была длиннее и примерно на 25–35% медленнее. расстояние, темп, паузы и практика смешаны; акустический вывод пока недоказан.

точные комнатные метрики

  • грудь: mlx + entities 23Source: замороженные room-v1 score receiptsTable: transcript-score.json,4%Source: замороженные room-v1 score receiptsTable: transcript-score.json; plaud 32Source: замороженные room-v1 score receiptsTable: transcript-score.json,7%Source: замороженные room-v1 score receiptsTable: transcript-score.json; parakeet 37Source: замороженные room-v1 score receiptsTable: transcript-score.json,4%Source: замороженные room-v1 score receiptsTable: transcript-score.json; whisper base 50Source: замороженные room-v1 score receiptsTable: transcript-score.json,5%Source: замороженные room-v1 score receiptsTable: transcript-score.json; mlx raw 62Source: замороженные room-v1 score receiptsTable: transcript-score.json,6%Source: замороженные room-v1 score receiptsTable: transcript-score.json.
  • стол 50Source: замороженные room-v1 score receiptsTable: transcript-score.json см: plaud 30Source: замороженные room-v1 score receiptsTable: transcript-score.json,8%Source: замороженные room-v1 score receiptsTable: transcript-score.json; mlx raw 33Source: замороженные room-v1 score receiptsTable: transcript-score.json,6%Source: замороженные room-v1 score receiptsTable: transcript-score.json; mlx + entities 34Source: замороженные room-v1 score receiptsTable: transcript-score.json,6%Source: замороженные room-v1 score receiptsTable: transcript-score.json; parakeet 38Source: замороженные room-v1 score receiptsTable: transcript-score.json,3%Source: замороженные room-v1 score receiptsTable: transcript-score.json; whisper base 45Source: замороженные room-v1 score receiptsTable: transcript-score.json,8%Source: замороженные room-v1 score receiptsTable: transcript-score.json.
  • стол 2Source: замороженные room-v1 score receiptsTable: transcript-score.json м: parakeet 24Source: замороженные room-v1 score receiptsTable: transcript-score.json,3%Source: замороженные room-v1 score receiptsTable: transcript-score.json; mlx raw 30Source: замороженные room-v1 score receiptsTable: transcript-score.json,6%Source: замороженные room-v1 score receiptsTable: transcript-score.json; mlx + entities 34Source: замороженные room-v1 score receiptsTable: transcript-score.json,2%Source: замороженные room-v1 score receiptsTable: transcript-score.json; plaud 36Source: замороженные room-v1 score receiptsTable: transcript-score.json,0%Source: замороженные room-v1 score receiptsTable: transcript-score.json; whisper base 55Source: замороженные room-v1 score receiptsTable: transcript-score.json,9%Source: замороженные room-v1 score receiptsTable: transcript-score.json.

темп по plaud-сегментам: грудь примерно 105Source: замороженные room-v1 score receiptsTable: transcript-score.json слов/мин, 50Source: замороженные room-v1 score receiptsTable: transcript-score.json см — 114Source: замороженные room-v1 score receiptsTable: transcript-score.json, 2Source: замороженные room-v1 score receiptsTable: transcript-score.json м — 79Source: замороженные room-v1 score receiptsTable: transcript-score.json. это диагностическая оценка, а не точный speech-rate.

Source: замороженные room-v1 score receiptsTable: transcript-score.json

скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей

победитель зависит от среды
победитель зависит от среды data
захватwerмодель
зал34.6%mlx raw
байк · шея56.4%parakeet
байк · у рта66.5%parakeet
комната · грудь23.4%mlx + entities
комната · 50 см30.8%plaud
комната · 2 м24.3%parakeet

качество многомерно

heatmap использует только сопоставимые измерения: точность полного текста, entity recall, качество в тихой и шумной среде и устойчивость между захватами. parakeet имеет лучший средний текстовый результат и шумовую устойчивость; plaud заметно сильнее по именам; mlx способен быть лучшим, но имеет самый большой разброс из-за silent collapse.

Source: агрегация общих моделей по шести score receiptsTables: transcript-score.json, benchmark.json

равновзвешенная агрегация четырёх общих вариантов по шести захватам

измеренный профиль моделей
измеренный профиль моделей data
измерениеscoreмодельопределениезахватов
весь текст55.2%plaud1 − средний end-to-end wer6
сущности56.3%plaudсредний entity recall6
тихая среда66.8%plaud1 − средний room wer3
шум43.6%plaud1 − средний gym+bike wer3
стабильность85.2%plaud1 − стандартное отклонение wer6
весь текст38.3%whisper base1 − средний end-to-end wer6
сущности25.6%whisper baseсредний entity recall6
тихая среда49.3%whisper base1 − средний room wer3
шум27.4%whisper base1 − средний gym+bike wer3
стабильность88.1%whisper base1 − стандартное отклонение wer6
весь текст48.2%mlx raw1 − средний end-to-end wer6
сущности39.7%mlx rawсредний entity recall6
тихая среда57.7%mlx raw1 − средний room wer3
шум38.7%mlx raw1 − средний gym+bike wer3
стабильность80.5%mlx raw1 − стандартное отклонение wer6
весь текст56.7%parakeet1 − средний end-to-end wer6
сущности37%parakeetсредний entity recall6
тихая среда66.7%parakeet1 − средний room wer3
шум46.8%parakeet1 − средний gym+bike wer3
стабильность86%parakeet1 − стандартное отклонение wer6

одного лидера действительно нет

верхний правый угол — желаемая зона: одновременно точный текст и сохранённые сущности. 24Source: агрегация общих моделей по шести score receiptsTables: transcript-score.json, benchmark.json точки показывают, что среда двигает одну модель сильнее, чем средний рейтинг. поэтому production-router должен сравнивать кандидатов по каждому сегменту и не доверять глобальному победителю.

Source: агрегация общих моделей по шести score receiptsTables: transcript-score.json, benchmark.json

равновзвешенная агрегация четырёх общих вариантов по шести захватам

текстовая точность и распознавание сущностей
текстовая точность и распознавание сущностей data
точность текста · 1 − werentity recallмодельслов в эталонесреда
61.1%53.6%plaud419зал
34.4%17.9%whisper base419зал
65.4%50%mlx raw419зал
63.2%46.4%parakeet419зал
38.7%63.6%plaud163байк · шея
23.3%27.3%whisper base163байк · шея
20.2%54.5%mlx raw163байк · шея
43.6%54.5%parakeet163байк · шея
31.1%45.5%plaud164байк · у рта
24.4%27.3%whisper base164байк · у рта
30.5%27.3%mlx raw164байк · у рта
33.5%27.3%parakeet164байк · у рта
67.3%56.3%plaud107комната · грудь
49.5%43.8%whisper base107комната · грудь
37.4%12.5%mlx raw107комната · грудь
62.6%43.8%parakeet107комната · грудь
69.2%62.5%plaud107комната · 50 см
54.2%25%whisper base107комната · 50 см
66.4%43.8%mlx raw107комната · 50 см
61.7%25%parakeet107комната · 50 см
64%56.3%plaud111комната · 2 м
44.1%12.5%whisper base111комната · 2 м
69.4%50%mlx raw111комната · 2 м
75.7%25%parakeet111комната · 2 м

смысловой слой

полный транскрипт — промежуточный материал. единица ценности для агента: утверждение с полярностью и ролями, привязанное к аудиоспану. хранить нужно аудио-хэш, варианты текста, сущности и алиасы, отношения, отрицания и исправления чисел, confidence/disagreement, временной диапазон и human correction.

следующий scorer должен мерить relation + polarity + negation, anchor completeness, ложный хвост, speaker split и минуты ручной коррекции на час аудио. строгий exact-string recall сейчас штрафует фонетически неверное имя сильнее, чем сохранённый смысл.

инфраструктурный рычаг

один job на запись: fetch + sha receipt → parakeet raw → mlx entity-context → completeness/hallucination gate → segment consensus → human gold spans → индекс и отчёт. локальный content-addressed vault уже работает; следующий системный долг — зашифрованный remote primary, независимое зеркало и restore canary до любого удаления локального сырья.

выбранный промежуточный pipeline

plaud / krisp / superwhisper
          ↓ immutable audio + sha-256
vad + 30–90 sec semantic segments
          ↓
parakeet raw ───────┐
mlx + entity lexicon ├─→ disagreement + completeness gate
plaud provider ─────┘
          ↓
entity linker → diarization → speaker identity
          ↓
claims: subject · relation · object · polarity · time span
          ↓
domain router: myalignment / gconf / vahue / fff / therapy / journal
          ↓
episode → hypothesis → experiment → reviewed memory

автовыбор сегмента: согласие двух независимых кандидатов, сохранённые якоря и высокая entity confidence. эскалация: пропавший старт/конец, отрицание или число в зоне разногласия, неизвестное имя, конфликт speaker identity, повторяющийся хвост. исходный токен никогда не затирается нормализованным именем.

какие модели добавить

сначала заморозить human-gold, затем добавить по одному challenger на класс. локально: canary-1b-v2 как русскоязычный nemo-кандидат с таймкодами и whisper-large-v3 как accuracy-ceiling против turbo. qwen3-asr-1.7b оставить третьим: 0.6b уже провалил смысловую часть, поэтому новый 4.7 gb вес оправдан только на хорошем gold. облачно: gpt-transcribe как внешний quality ceiling и gpt-4o-transcribe-diarize для двух спикеров — только после отдельного разрешения на передачу приватного аудио.

следующий тест

  1. room-v2: один 5–6-минутный агрессивный текст, три отдельных последовательных размещения, фиксированный темп и случайный порядок.
  2. acoustic-control: один и тот же заранее записанный голос через колонку, plaud на груди / 50 см / 2 м — это изолирует размещение от человеческой подачи.
  3. 30-second-boundary: критическое утверждение до и после 30-й секунды, чтобы воспроизвести mlx-collapse.
  4. semantic-adversarial: отрицания, перестановка ролей, похожие суммы, даты, коррекции и законные повторы.
  5. natural-gold: по 60–90 секунд ручного gold из quiet, gym, bike и разговора; именно это даст реальный model wer.
  6. long-form: 20–30 минут и два спикера после прохождения короткого протокола.

границы уверенности

высокая уверенность: сырой mlx на груди неполон; победитель зависит от среды; parakeet достаточно быстр для первого прохода.

средняя: entity-only prompt полезен как второй проход — один из трёх room-файлов сильно выиграл, один слегка проиграл, один проиграл заметно.

низкая: сравнительное качество размещений. тексты почти одинаковы, но скорость, паузы и фактическое произнесение не были выровнены человеческим gold.

Sources

  1. замороженные room-v1 score receiptsbenchmarks/agent-memory-v1/captures/room-quiet-v1 · local deterministic scorer · 2026-09-04T16:45:00Z

    скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей

    SQL query
    select capture_id, model, wer, entity_recall, critical_recall, words from local_room_v1_score_receipts
  2. реестр agent-memory-v1benchmarks/agent-memory-v1/benchmark.json · local benchmark registry · 2026-09-04T16:50:00Z

    шесть неизменяемых полевых захватов и их score receipts

    SQL query
    select capture_id, environment, winning_model, winning_wer from local_agent_memory_v1_registry
  3. агрегация общих моделей по шести score receiptsbenchmarks/agent-memory-v1/captures/all-six-common-models · local deterministic aggregation · 2026-09-04T16:30:00Z

    равновзвешенная агрегация четырёх общих вариантов по шести захватам

    SQL query
    select capture_id, model, 1 - wer as text_fidelity, entity_recall, reference_words from all_six_common_model_scores