лучший room wer
23.4%Source: замороженные room-v1 score receipts
лучший end-to-end wer среди комнатных прогонов; ниже лучше
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
Data Analytics report
многомерное сравнение asr и промежуточное решение для myalignment
равновзвешенная агрегация четырёх общих вариантов по шести захватам
лучший room wer
23.4%Source: замороженные room-v1 score receipts
лучший end-to-end wer среди комнатных прогонов; ниже лучше
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
захватов
6Source: реестр agent-memory-v1
неизменяемые аудиозахваты, включённые в текущую сводку
шесть неизменяемых полевых захватов и их score receipts
mlx completeness
51.5%Source: замороженные room-v1 score receipts
доля эталонного объёма слов, оставшаяся в сыром mlx на груди
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
лучший результат меняется по размещению: mlx с entity-контекстом на груди, plaud на 50 см, parakeet на 2 м.
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
| размещение | wer | модель | entity recall | critical recall | слов |
|---|---|---|---|---|---|
| грудь | 32.7% | plaud | 56.3% | 26.7% | 102 |
| грудь | 50.5% | whisper base | 43.8% | 13.3% | 101 |
| грудь | 62.6% | mlx raw | 12.5% | 33.3% | 52 |
| грудь | 23.4% | mlx + entities | 87.5% | 60% | 100 |
| грудь | 37.4% | parakeet | 43.8% | 26.7% | 101 |
| стол 50 см | 30.8% | plaud | 62.5% | 33.3% | 103 |
| стол 50 см | 45.8% | whisper base | 25% | 13.3% | 104 |
| стол 50 см | 33.6% | mlx raw | 43.8% | 33.3% | 104 |
| стол 50 см | 34.6% | mlx + entities | 68.8% | 40% | 93 |
| стол 50 см | 38.3% | parakeet | 25% | 20% | 104 |
| стол 2 м | 36% | plaud | 56.3% | 33.3% | 110 |
| стол 2 м | 55.9% | whisper base | 12.5% | 13.3% | 105 |
| стол 2 м | 30.6% | mlx raw | 50% | 33.3% | 109 |
| стол 2 м | 34.2% | mlx + entities | 43.8% | 26.7% | 110 |
| стол 2 м | 24.3% | parakeet | 25% | 26.7% | 112 |
на груди сырой mlx потерял примерно первые 28 секунд, хотя нормализация wav и ослабление decoder-gates не помогли. короткий entity-only prompt восстановил начало и дал wer 23,4%. на 2 м тот же prompt ухудшил результат: значит контекст надо применять как контролируемую гипотезу и сравнивать с независимым первым проходом.
2 м дал лучший parakeet wer — 24,3%, но запись была длиннее и примерно на 25–35% медленнее. расстояние, темп, паузы и практика смешаны; акустический вывод пока недоказан.
темп по plaud-сегментам: грудь примерно 105Source: замороженные room-v1 score receipts слов/мин, 50Source: замороженные room-v1 score receipts см — 114Source: замороженные room-v1 score receipts, 2Source: замороженные room-v1 score receipts м — 79Source: замороженные room-v1 score receipts. это диагностическая оценка, а не точный speech-rate.
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
шесть неизменяемых полевых захватов и их score receipts
| захват | wer | модель |
|---|---|---|
| зал | 34.6% | mlx raw |
| байк · шея | 56.4% | parakeet |
| байк · у рта | 66.5% | parakeet |
| комната · грудь | 23.4% | mlx + entities |
| комната · 50 см | 30.8% | plaud |
| комната · 2 м | 24.3% | parakeet |
heatmap использует только сопоставимые измерения: точность полного текста, entity recall, качество в тихой и шумной среде и устойчивость между захватами. parakeet имеет лучший средний текстовый результат и шумовую устойчивость; plaud заметно сильнее по именам; mlx способен быть лучшим, но имеет самый большой разброс из-за silent collapse.
равновзвешенная агрегация четырёх общих вариантов по шести захватам
равновзвешенная агрегация четырёх общих вариантов по шести захватам
| измерение | score | модель | определение | захватов |
|---|---|---|---|---|
| весь текст | 55.2% | plaud | 1 − средний end-to-end wer | 6 |
| сущности | 56.3% | plaud | средний entity recall | 6 |
| тихая среда | 66.8% | plaud | 1 − средний room wer | 3 |
| шум | 43.6% | plaud | 1 − средний gym+bike wer | 3 |
| стабильность | 85.2% | plaud | 1 − стандартное отклонение wer | 6 |
| весь текст | 38.3% | whisper base | 1 − средний end-to-end wer | 6 |
| сущности | 25.6% | whisper base | средний entity recall | 6 |
| тихая среда | 49.3% | whisper base | 1 − средний room wer | 3 |
| шум | 27.4% | whisper base | 1 − средний gym+bike wer | 3 |
| стабильность | 88.1% | whisper base | 1 − стандартное отклонение wer | 6 |
| весь текст | 48.2% | mlx raw | 1 − средний end-to-end wer | 6 |
| сущности | 39.7% | mlx raw | средний entity recall | 6 |
| тихая среда | 57.7% | mlx raw | 1 − средний room wer | 3 |
| шум | 38.7% | mlx raw | 1 − средний gym+bike wer | 3 |
| стабильность | 80.5% | mlx raw | 1 − стандартное отклонение wer | 6 |
| весь текст | 56.7% | parakeet | 1 − средний end-to-end wer | 6 |
| сущности | 37% | parakeet | средний entity recall | 6 |
| тихая среда | 66.7% | parakeet | 1 − средний room wer | 3 |
| шум | 46.8% | parakeet | 1 − средний gym+bike wer | 3 |
| стабильность | 86% | parakeet | 1 − стандартное отклонение wer | 6 |
верхний правый угол — желаемая зона: одновременно точный текст и сохранённые сущности. 24Source: агрегация общих моделей по шести score receipts точки показывают, что среда двигает одну модель сильнее, чем средний рейтинг. поэтому production-router должен сравнивать кандидатов по каждому сегменту и не доверять глобальному победителю.
равновзвешенная агрегация четырёх общих вариантов по шести захватам
равновзвешенная агрегация четырёх общих вариантов по шести захватам
| точность текста · 1 − wer | entity recall | модель | слов в эталоне | среда |
|---|---|---|---|---|
| 61.1% | 53.6% | plaud | 419 | зал |
| 34.4% | 17.9% | whisper base | 419 | зал |
| 65.4% | 50% | mlx raw | 419 | зал |
| 63.2% | 46.4% | parakeet | 419 | зал |
| 38.7% | 63.6% | plaud | 163 | байк · шея |
| 23.3% | 27.3% | whisper base | 163 | байк · шея |
| 20.2% | 54.5% | mlx raw | 163 | байк · шея |
| 43.6% | 54.5% | parakeet | 163 | байк · шея |
| 31.1% | 45.5% | plaud | 164 | байк · у рта |
| 24.4% | 27.3% | whisper base | 164 | байк · у рта |
| 30.5% | 27.3% | mlx raw | 164 | байк · у рта |
| 33.5% | 27.3% | parakeet | 164 | байк · у рта |
| 67.3% | 56.3% | plaud | 107 | комната · грудь |
| 49.5% | 43.8% | whisper base | 107 | комната · грудь |
| 37.4% | 12.5% | mlx raw | 107 | комната · грудь |
| 62.6% | 43.8% | parakeet | 107 | комната · грудь |
| 69.2% | 62.5% | plaud | 107 | комната · 50 см |
| 54.2% | 25% | whisper base | 107 | комната · 50 см |
| 66.4% | 43.8% | mlx raw | 107 | комната · 50 см |
| 61.7% | 25% | parakeet | 107 | комната · 50 см |
| 64% | 56.3% | plaud | 111 | комната · 2 м |
| 44.1% | 12.5% | whisper base | 111 | комната · 2 м |
| 69.4% | 50% | mlx raw | 111 | комната · 2 м |
| 75.7% | 25% | parakeet | 111 | комната · 2 м |
полный транскрипт — промежуточный материал. единица ценности для агента: утверждение с полярностью и ролями, привязанное к аудиоспану. хранить нужно аудио-хэш, варианты текста, сущности и алиасы, отношения, отрицания и исправления чисел, confidence/disagreement, временной диапазон и human correction.
следующий scorer должен мерить relation + polarity + negation, anchor completeness, ложный хвост, speaker split и минуты ручной коррекции на час аудио. строгий exact-string recall сейчас штрафует фонетически неверное имя сильнее, чем сохранённый смысл.
один job на запись: fetch + sha receipt → parakeet raw → mlx entity-context → completeness/hallucination gate → segment consensus → human gold spans → индекс и отчёт. локальный content-addressed vault уже работает; следующий системный долг — зашифрованный remote primary, независимое зеркало и restore canary до любого удаления локального сырья.
plaud / krisp / superwhisper
↓ immutable audio + sha-256
vad + 30–90 sec semantic segments
↓
parakeet raw ───────┐
mlx + entity lexicon ├─→ disagreement + completeness gate
plaud provider ─────┘
↓
entity linker → diarization → speaker identity
↓
claims: subject · relation · object · polarity · time span
↓
domain router: myalignment / gconf / vahue / fff / therapy / journal
↓
episode → hypothesis → experiment → reviewed memory
автовыбор сегмента: согласие двух независимых кандидатов, сохранённые якоря и высокая entity confidence. эскалация: пропавший старт/конец, отрицание или число в зоне разногласия, неизвестное имя, конфликт speaker identity, повторяющийся хвост. исходный токен никогда не затирается нормализованным именем.
сначала заморозить human-gold, затем добавить по одному challenger на класс. локально: canary-1b-v2 как русскоязычный nemo-кандидат с таймкодами и whisper-large-v3 как accuracy-ceiling против turbo. qwen3-asr-1.7b оставить третьим: 0.6b уже провалил смысловую часть, поэтому новый 4.7 gb вес оправдан только на хорошем gold. облачно: gpt-transcribe как внешний quality ceiling и gpt-4o-transcribe-diarize для двух спикеров — только после отдельного разрешения на передачу приватного аудио.
высокая уверенность: сырой mlx на груди неполон; победитель зависит от среды; parakeet достаточно быстр для первого прохода.
средняя: entity-only prompt полезен как второй проход — один из трёх room-файлов сильно выиграл, один слегка проиграл, один проиграл заметно.
низкая: сравнительное качество размещений. тексты почти одинаковы, но скорость, паузы и фактическое произнесение не были выровнены человеческим gold.
скриптовый wer, entity recall и critical phrase recall для трёх room-v1 записей
select capture_id, model, wer, entity_recall, critical_recall, words from local_room_v1_score_receiptsшесть неизменяемых полевых захватов и их score receipts
select capture_id, environment, winning_model, winning_wer from local_agent_memory_v1_registryравновзвешенная агрегация четырёх общих вариантов по шести захватам
select capture_id, model, 1 - wer as text_fidelity, entity_recall, reference_words from all_six_common_model_scores